跳轉到主要內容
AI 數據

生成式AI在你的第二語言中會變得更差

簡短回答。因為模型能力反映了在模型訓練時該語言中已存在的文本的總量和質量,而這種分佈極為不均衡。這種影響……

Lifewood Data Technology · 2026年7月24日 · 閱讀約 8 分鐘

簡短回答。 因為模型能力反映了在訓練時該語言中存在文本的體積和質量,而這種分佈極為不均衡。這一效應在相同內容上是可測量的:MMLU-ProX,它提出了相同11,829個問題,覆蓋29種語言,在36個評估模型中,高資源語言與低資源語言之間的差距高達24.3分,強模型在英語上得分超過70%,而在斯瓦希里語上約為40%。危險之處並不在於輸出明顯錯誤。流暢性退化速度比準確性慢,因此弱語言的輸出雖然讀起來仍流暢,但錯誤頻率更高——而僅限英語的問答系統無法察覺這一點,因為其設計如此。

這是數據差距在生產層面的後果,而非其背後分類問題:該差距在內容管道各層級如何體現,為何總部無法察覺,以及如何圍繞可測量的能力進行分層處理,而非對所有環節應用統一流程。


差距的來源是什麼?

模型學習的是其訓練時所見文本的分佈。語言在該文本中出現的比例,取決於該語言被書寫、數字化並可獲取的程度,而不是取決於有多少人使用該語言。這兩個數量差異巨大,因此一個擁有數億使用者的語言,其數字化語料庫可能只有另一個使用者僅為十分之一的語言的十分之一。

後果通過層級疊加:

  • 分詞。 分詞器主要基於高資源文本訓練,將其他語言分割成更多單位意義的標記,這會消耗上下文窗口和成本。
  • 指令微調。 指令數據絕大多數為英文或從英文翻譯而來,因此模型對“良好回答”概念的理解是基於英文慣例進行校準的。
  • 評估。 評估套件以英文為優先,因此在開發過程中無法發現其他語言的偏差。
  • 檢索。 用於支撐回答的本地語言資料較少且質量較低。

每一層單獨來看都是合理的。但累積效應導致了巨大的能力差距。

實際操作中關鍵的區別: 流利度和準確性退化速率不同。模型從相對少量的數據中學習語言的結構,因此輸出在事實可靠性下降之前,仍能保持語法正確和地道。不掌握該語言的評審者看到流暢文本便認為其合格。這是多語言AI內容中最昂貴的誤讀之一。


測量結果所揭示的內容

MMLU-ProX 是最乾淨的可用證據,因為它控制了內容。它通過半自動翻譯過程結合專家驗證,將一個側重推理的英文基準擴展到29種語言類型,每個語言版本均包含相同的11,829個問題——因此,不同語言之間的分數差異反映的是模型能力的差異,而非問題難度的差異。在36個最先進的模型中,包括增強推理能力和多語言優化的模型,作者報告了高資源語言與低資源語言之間高達 24.3分 的差距。該研究發表於EMNLP 2025年。

另一項研究則解決了更微妙的問題:對於許多語言而言,差距並不為人所知,因為不存在基準數據。2024年的一項研究創建了大約 一百萬條人工翻譯的詞彙,覆蓋了 八種低資源非洲語言 —— 阿姆哈拉語、巴馬拉語、伊博語、塞佩迪語、肖納語、塞索托語、塞茨瓦納語和茨貢語——涉及超過 1.6億名使用者,正是由於標準基準數據不存在,導致差距無法被測量,而非差距本身很小。

流水線層 低資源語言中的症狀 英語團隊所看到的情況
生成 在流暢度不變的情況下,事實錯誤率更高 沒有。輸出讀起來很好
分詞 每句更多標記符;上下文被截斷;成本更高 各市場之間成本差異無解釋
指令遵循能力 趨向英語修辭慣例 文本正確且讀起來像翻譯
本地知識 錯誤或缺失的市場特定事實、名稱、法規 本地讀者立即不信任的自信文本
評估 測試套件無法檢測到的迴歸問題 綠色儀表板與區域辦公室的投訴
檢索 可用的本地語言資料更少且質量較弱 基於簡短需求說明的薄弱答案

從第三列往下閱讀,可以解釋這些項目為何會悄然失敗。每一個症狀要麼在總部層面不可見,要麼歸因於模型能力之外的因素。


商業不對稱性

如果受影響的語言在商業上處於邊緣地位,這種差距的影響會較小。實際情況恰恰相反。CSA Research對8709名消費者進行的涵蓋29個國家的調查——通過新聞稿發佈而非正式論文發佈——發現76%的在線購物者更願意使用自己母語的信息進行購物,而40%則完全不會從其他語言的網站購買。在英語水平較低的市場中,對母語的偏好並未減弱,反而更強。

因此,模型表現最不穩定的市場,往往是本地化發佈對轉化效果最為關鍵的市場。當一個項目在模型表現不佳時默認將這些市場切換至英文,實際上選擇了最差的商業選項,卻在儀表板上呈現出一種注重質量的決策形象。

另一種選擇不是發佈未經審核的輸出內容。而是分級處理:在模型能力最弱的語言上,接受更高的人工成本,這部分成本由模型在能力較強語言上產生的收益來資助。


構建一個能夠彌補能力差距的流程

目標不是一個統一的流程。而是一個其強度根據 測量 的語言能力動態設定的流程,而這首先需要進行測量。

  1. 根據測量能力對語言列表進行分級,而不是按收入分級。 在每個目標語言之前,先進行一次小型的本地語言評估。三個層級就足夠了:強、可接受但需人工審核、弱到需要人工創作或大量重寫。收入決定你是否進入一個市場;能力決定你如何為該市場提供服務。
  2. 本地語言構建評估集,而不是翻譯成其他語言。 一個翻譯後的測試集衡量的是翻譯質量,且嵌入了英語框架和與英語相關的知識。只有由本地母語者創作的內容,涵蓋本地慣例、實體和法規,才能真正揭示關鍵差距。
  3. 將內容生成基於本地語言的檢索結果。 檢索減少了對模型記憶內容的依賴,而這正是當前問題所在。當本地語言資源稀缺時,應從強語言的可信來源中檢索,並在人工審核下翻譯——這是一個明確且可追溯的步驟,而非一個沉默的處理過程。
  4. 在模型能力較弱的語言上,更嚴格地約束輸出格式。 模板、受控術語和固定結構減少了模型在創造性錯誤方面的空間。自由生成僅是強語言模型才能享受的奢侈。
  5. 將審核員置於市場一線,並提供審核標準。 一位海外母語者能發現語法錯誤;市場一線的審核員則能發現語言風格、使用時效和本地事實性錯誤。根據定義明確的錯誤類型(如MQM)進行評分,使不同語言的結果具有可比性,而非一系列獨立的主觀判斷。
  6. 樣本與能力成反比。能力越弱的部分,抽樣比例應越高。 將相同的5%樣本應用於英語和弱層級語言時,對於你最無法承受的語言,其逃逸率會接受得更高。
  7. 模型變更時需重新測量。模型發生變化時重新測量。 某種語言的能力在不同版本之間可能大幅變動,無論是增強還是減弱。每次模型更新後都應重新運行評估並重新分級——一種語言可能獲得了更輕的處理流程,也可能失去了原有的流程。

團隊相信的三件事,證據並不支持

"從英語翻譯,質量問題就解決了。" 它轉移了問題,而非解決了問題。低資源語言對的翻譯質量同樣面臨底層數據問題,通過英語作為中介會引入已記錄的文化特定內容錯誤。帶有審核的翻譯是一種合理策略;它並非一種避免審核需求的方法。

「差距正在縮小,因此是暫時的。」“差距正在縮小,所以這只是暫時的問題。” 部分差距確實在縮小,但並不均衡。數字語料庫增長緩慢的語言,從更大規模訓練中獲益甚微,且在前沿模型中報告的差距依然持續存在。認為差距會消失,實際上是在依賴他人的路線圖。

「如果讀起來流暢,就足夠了。」“只要讀起來流暢,就沒有問題。” 這是測量結果最直接反駁的假設。流暢性與準確性脫節,而脫節最嚴重的地方恰恰是你最難以驗證的地方。這也是為什麼同事的母語者抽查不能替代由合格評審員依據評分標準進行的審核。


Lifewood的應對方式

上述所有內容對於少數幾種語言可以在內部實施。當語言數量達到十到二十種時,這種實施就不再可行,其原因並非技術層面:該流程需要為每種語言在每次發佈時都配備一名具備資質的本地評審員,同時為每種語言維護一個本地評估集。這是一個人力和網絡問題,也正是多語言項目通常只限於團隊實際能夠配置的語言。

Lifewood 將該網絡作為其核心業務運營:支持 50+ languages 的區域本地評審員,覆蓋 30多個國家的40多個交付中心,擁有 56,788 名註冊貢獻者,並實施了一種雙重人工參與閉環審核流程,其準確率標準達到 95%+

相關要點比一個音節還窄:這個問題是通過市場中的人員解決的,而不是通過更好的提示詞,任何不涉及市場評審員的供應商回答,都是在回答一個不同的問題。參見 多語言數據收集AIGC服務


資料與進一步閱讀

  • MMLU-ProX:用於高級大語言模型評估的多語言基準——29種語言,每種語言11,829個項目,36個模型;EMNLP 及2025年。
  • 《彌合差距:通過新基準、微調和文化調整提升低資源非洲語言大語言模型性能》,2024年12月。
  • CSA研究,《讀不懂,就不買》第三次全球調查——通過新聞稿發佈,而非作為已發表的論文。
  • MQM委員會,MQM錯誤分類體系。
  • 配套指南:高資源語言與低資源語言在AI訓練中的區別超越翻譯:為何AI需要文化相關數據

常見問題

在MMLU-ProX上,該測試在29種語言中提出相同的11,829個問題,報告的高資源語言與低資源語言之間的差距達到24.3分,強模型在英語中得分超過70%,而在斯瓦希里語中約為40%。差距因模型和任務而異;但在評估的36個模型中,差距的方向始終一致。

該術語指的是可用於訓練的數字化文本的體積和質量,而不是說話者的人口數量。根據這一定義,一些說話者數量非常龐大的語言仍屬於低資源語言,因此僅依靠說話者數量作為代理是不充分的。要了解模型在某種語言中的表現,唯一可靠的方法是在該語言中進行評估。

這是一種常見且合理的策略,前提是翻譯步驟需經過審查。但這並未解決根本數據問題——低資源語言對的翻譯質量也受到同樣的稀缺性影響——且通過英文作為中間語言進行轉換往往會削弱文化特定內容。應將其視為一種生產選擇,仍需在市場中進行審查,而不是作為一種彌補差距的方法。

因為大多數質量評估都是以英語進行,或者由非母語使用者進行,他們只關注明顯的錯誤,而這裡的失敗模式是生成流暢、語法正確的文本但內容錯誤。要發現這類問題,需要在目標語言中編寫評估項目,並由身處市場一線的評審人員進行評審,其評分標準應基於明確的錯誤類型,而非一般性的主觀印象。

不均衡。多語言能力在不同代際之間確實有所提升,但這種提升取決於每種語言的數據可用性,而那些語料庫增長緩慢的語言,即使訓練規模擴大,其性能提升也相對有限。現在建立分層和評審流程是更經濟的選擇,而且即使模型性能提升,這一流程也不會被浪費——它將成為我們察覺到這種提升的機制。

如果這些市場具有商業價值——市場證據表明,這些市場的買家最堅持使用自己的語言。正確的做法是建立更嚴格的流程,而非默認使用英語:包括人工撰寫或大幅重寫內容,使用更嚴格的模板,引入檢索錨定,以及進行完整而非抽樣的評審,這些流程的資金來源於在強勢語言中該計劃所節省的成本。

每種語言準備五十到一百個條目,由該語言的母語使用者編寫,覆蓋內容實際依賴的本地知識和慣例,再由第二位母語使用者進行評分。每個語言僅需幾天的工作量,可重複用於每次模型更新,並將關於能力的爭論轉化為具體數據。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊