簡短回答。 不行,因為目前大多數多語言聲明都是通過翻譯基準來證明的。
翻譯測試會引入模型可利用的捷徑,且與本地使用者實際判斷為優質內容的基準嚴重不符:一項研究發現,翻譯基準與本地人類判斷的相關係數為0.47,而本地構建的基準則達到0.68。真正的測試意味著由該語言的使用者撰寫的基準、生成式任務而非選擇題、按語言分別報告,以及模型從未見過的保留集。
為什麼多語言基準測試分數不能證明多語言能力?
因為大多數多語言基準測試都是通過翻譯英文測試題構建的,因此高分可能反映的是翻譯質量,而非語言本身的能力。
最近的一項調查研究提出,多語言評估存在三大核心挑戰:覆蓋範圍,即測試是否涵蓋了所有語言;代表性,即測試內容是否真正反映了語言和文化,而非源自英文原文;以及可信度,即結果是否具有科學可靠性。翻譯型基準測試和以美國為中心的框架被認定為代表性缺陷的主要表現。
實際後果是,'支持100種語言'、'在100種語言中進行了評估'和'在100種語言中表現良好'是三個不同的陳述,而市場常常將前者誤當作後者。
一項由微軟關聯的多語言評估調查發現,全球各個地區都有相當比例的語言主要通過翻譯內容進行評估,其中歐洲和東亞最為依賴翻譯。有趣的是,撒哈拉以南非洲地區原生內容佔比最高,這是由於區域研究社區自主構建了語言特定的基準測試所致。
翻譯型基準測試有什麼問題?
有三點:一是它們留下了可檢測的源語言痕跡,模型會利用這些痕跡作為捷徑;二是模型會利用這些痕跡作為捷徑;三是它們與實際使用這些語言的人群存在分歧。
翻譯病態。翻譯會留下痕跡,包括詞元和句法結構,使讀者能夠識別出源語言。
這一現象在語言學中已有充分記載,在評估情境下,它是一種汙染因素而非一個有趣的現象。
線索繼承。由於所有非英語內容均源自一個共同的英語源頭,模型的表現可能反映的是對通過翻譯保留下來的英語線索的識別,而非真正的理解。早期研究恰好證明了這一機制,表明翻譯會引入模型可以利用的細微瑕疵,作為非語義的捷徑。模型可以通過識別原始問題的形態而獲得高分。
與說話者的分歧。這是最具決策相關性的發現。與本地人類判斷相比,翻譯後的基準測試匹配度遠差,相關係數為0.47,而原生構建的基準測試為0.68。如果你的基準測試與用戶判斷不一致,那麼問題就出在基準測試本身。
翻譯質量的變化比大多數買家所認為的要大。全球MMLU,一項覆蓋42種語言、規模龐大且用心良苦的嘗試,結合了機器翻譯與眾包人工驗證,但僅有約20%的機器翻譯文本經過人工修正,且問題和答案是分別翻譯的,導致某些語言中出現明顯的語法不一致現象。
與原生創作的對比是可測量的。在一個僧伽羅語基準測試中,原生撰寫的STEM類問題自然性評分高達97.3%,而翻譯版本的對應評分僅為71.1%。
原生撰寫的基準測試能解決這個問題嗎?
它們解決了代表性問題,卻引入了另一個問題:可比性。而且,大多數這類基準測試仍然在測試錯誤的內容。
原生基準測試確實取得了真正的進步。那些從真實課程、政府考試和本地在線學習平臺編寫問題的努力,保留了文化背景、正確的術語和真實的表述框架,並完全避免了翻譯腔。方言特化的版本進一步擴展了這一優勢。
有兩個侷限性值得明確指出。
跨語言比較變得更為困難。如果一個德語數據集基於駕駛理論,而一個法語數據集基於不同的主題,那麼分數差異就會混淆語言能力與任務難度。原生來源的數據集在內部是有效的,但難以在不同語言之間進行比較,而這正是買家所希望實現的。
多項選擇測試是檢索而非生成。無論是翻譯版還是原生數據集,絕大多數都採用多項選擇格式,這種格式衡量的是知識檢索能力,且存在選擇偏差。現實世界中的實用性依賴於連貫、流暢且語義忠實的生成能力,而多項選擇測試無法評估這一點。研究人員已明確指出,評估多語言生成質量仍然是一個開放性問題。
對企業而言,實際的解讀是:沒有任何單一的公開基準能夠回答這個問題。原生基準可以告訴你模型是否能夠處理特定語言和文化。生成能力評估可以告訴你輸出是否可用。兩者互不替代。
汙染問題嚴重嗎?
對於較早的基準來說顯著,對於較新的基準來說小得多,且完全排除是不可能的。
汙染意味著評估問題出現在模型預訓練數據中,通過記憶而非實際能力來提升分數。大型網絡爬取語料庫使得任何公開較長時間的基準都存在汙染的可能性。
最近的測量結果提供了可用的圖景。較新的基準顯示出顯著更低的汙染率,例如MILU為0.0%,INCLUDE為1.0%,Global MMLU為1.7%,分析結論是基準的年齡和知名度是汙染風險的強預測因子。其推論令人不安:被引用最多的基準,最有可能受到汙染。
檢測也存在不確定性。不同的方法測量的是不同的內容,表面形式的重疊和由記憶驅動的性能差距會在同一基準測試上產生差異結果,作者指出,沒有任何單一的檢測方法足以應對多語言汙染。
因此有兩種實際應對措施。第一,優先採用最新的基準測試,並對長期存在的排行榜分數保持比其知名度所暗示的更為謹慎的態度。第二,而且對一家公司來說更為重要的是,維護一個從未公開發表的私有保留評估集。這是唯一可靠的防禦手段,以防止汙染,同時也是唯一能夠衡量你實際應用場景而非通用場景的測試。
一個嚴肅的多語言評估計劃應該是什麼樣子?
五層結構,按語言分別運行,結果分開報告而非平均。
第 1 層:母語知識與理解。問題由該語言的使用者直接編寫,最好取自當地課程或考試。這一層測試模型是否真正掌握該語言中的知識,而不是僅能理解翻譯後的內容。
第 2 層:生成質量。由該語言的使用者評價開放式任務的流暢度、連貫性及語義忠實度。
正是在這裡,多項選擇題基準測試變得沉默,用戶也在此形成他們的初步印象。
第3層:在您實際使用場景下的任務表現。一個從真實工作中抽取的私有數據集:您的領域、客戶用語、文檔類型。未受人為構造汙染。
第4層:語氣、風格和得體性。由說話者判斷,因為這無法自動化。這一層決定了輸出是否顯得尊重或冒犯。
第5層:語言特定的安全性與拒絕行為。護欄僅在訓練時覆蓋的範圍內有效,因此在英語中進行的安全性評估幾乎無法反映其他語言的暴露情況。
兩個學科貫穿所有五層。按語言分別報告,絕不進行彙總,因為平均值會被集合中最強的語言所主導。而且必須在測量之前,為每個市場定義什麼是好的回答,因為對直接性、長度和正式程度的期望各不相同,若一切以英語標準為基準進行評分,將得出自信但錯誤的結論。
這些評估集是由誰實際構建的?
會說該語言的人,按照規範工作。這一約束決定了公司是否能夠誠實進行評估。
每一層之上都需要相同的輸入:母語者撰寫項目、評判輸出、解決分歧並記錄決策。不存在可自動替代的方案,而使用模型在處理不佳的語言中評判輸出的捷徑,會在新的地方重現原始問題。
這使得評估成為一種運營能力,而非研究能力。它需要持續在每種語言中進行招聘、篩選、制定目標語言的指南、跟蹤和解決評分者間的一致性問題,因為模型會不斷變化,評估集也必須隨之更新。
這正是Lifewood在其50多種語言能力中所做的一部分:通過經過篩選的母語者,在遍佈30多個國家的交付中心,採用人工參與閉環模型,生產語言本地化的評估與偏好數據,包括語氣和得體性判斷以及各語言的紅隊測試。其分散式設計的原因,與母語基準優於翻譯基準的原因相同。關於一種語言的判斷,必須來自實際使用該語言的人。
閉合點是一個商業層面的問題。任何供應商都可以聲稱具備語言覆蓋能力。能夠針對由母語者撰寫的語料庫,生成每種語言的評估結果,包括生成和安全性的供應商,其主張是可以被驗證的。在一個支持列表價格低廉的市場中,可驗證的證據就是差異化的關鍵所在。
關鍵要點
- 多語言評估面臨三個核心挑戰:覆蓋範圍、代表性與可信度。翻譯的基準測試和以美國為中心的框架是代表性問題的主要來源。
- ‘支持100種語言’、‘在100種語言中經過評估’和‘在100種語言中表現良好’是三種不同的主張。
- 翻譯的基準測試會留下翻譯腔的殘餘,模型可以將其作為非語義的捷徑加以利用,從而僅在識別層面得分,而非真正理解內容。
- 翻譯的基準測試與本地人類判斷的相關性為0.47,而原生構建的基準測試則達到0.68。
- 在Global-MMLU中,僅有約20%的機器翻譯文本經過人工校對,且問題和答案是分別翻譯的。
- 在一個僧伽羅語基準測試中,原生語料的自然性評分高達97.3%,而翻譯版本的評分僅為71.1%。
- 原生基準測試解決了代表性問題,但會增加跨語言比較的複雜性,因為不同語言對應不同的主題,這會混淆語言能力與題目難度之間的關係。
- 兩個家族中的大多數基準都採用多項選擇題,這主要測試檢索而非生成能力,且易受選擇偏差影響。
- MILU、INCLUDE和Global MMLU的汙染率分別報告為0.0%、1.0%和1.7%,年齡和知名度是預測風險的因素。
- 沒有單一的汙染檢測方法足夠有效,因此私有保留集是唯一可靠的防禦手段。
- 一項嚴肅的計劃為每種語言設置了五層:本土知識、生成質量、私有任務表現、語氣和得體性,以及安全性。
- 每一層都需要母語者參與,這使得評估成為一種運營能力,而非單純的科研活動。
資料與進一步閱讀
- "往返翻譯揭示了前沿多語言基準測試所遺漏的內容", arXiv, 關於翻譯基準測試的侷限性,包括INCLUDE和Global-MMLU,以及多選約束
- "翻譯稅並非標量:對中國多語言基準測試中提示繼承的反事實審計", arXiv, 關於提示繼承以及0.47與0.68相關性發現
- Microsoft Research,《多語言情境評估的現狀與前景》:介紹數據汙染率及各地區對翻譯的依賴
- Emergent Mind, "Multilingual MMLU", 在原生撰寫的基準測試和僧伽羅語自然性對比上的表現
- "Recovered in Translation: 一種高效的基準測試和數據集自動化翻譯流程", arXiv, 在Global-MMLU構建與修正率上的研究
- "多語言歐洲語言模型:基準測試方法與挑戰", arXiv, 關於基準測試中翻譯語病的問題
- Lifewood,公司概況及交付網絡