簡短回答。 一個以英語構建的評估體系應用於另一種語言時,其非英語部分得分良好,僅僅是因為評估標準從未對其進行過有效測試。 MultiNRC 顯示了這一差距:在法語、西班牙語和中文中,共有超過 1,000 個原生撰寫的推理問題,14 個領先的大語言模型在這些問題上表現不佳——而在由母語者撰寫的相同問題的英文版本上,模型在數學推理方面表現提升了約 10 個百分點。現有的多語言基準測試通常是從英語翻譯而來,這使它們偏向於那些最初以英語形式設計的問題。
大語言模型的評估集是什麼?
在 2026 年的評估手冊中有一句話,比我發現的任何其他內容都更精確地描述了這種失敗模式:
團隊將一個以英語構建的評估體系推向印地語、日語或阿拉伯語的終端用戶,最終得到的是一種‘雙語質量產品’:英語部分得分良好,而非英語部分得分良好僅僅是因為評估標準無法發現其中的問題。
這就是問題所在。不是說模型在另一種語言中的表現更差,這本是預期且可測量的。而是評估體系在另一種語言中表現更差,因此性能退化是不可見的。
我此前已專門撰文介紹瞭如何解讀已發佈的多語言基準測試,包括為什麼翻譯版本與本地人類判斷存在較大偏差。本文是其配套內容:如何自行構建一個評估集,而這正是任何在多個市場部署業務的公司最終都必須面對的任務。
從設定基準的發現開始
在方法論之前,應以結果來校準預期。
MultiNRC 由 Scale AI 構建,包含超過 1,000 個由母語者撰寫的、在語言和文化上紮根的推理問題,涵蓋法語、西班牙語和中文,共四個類別:語言特定的語義推理、文字遊戲與謎題、文化與傳統推理,以及具有文化相關性的數學推理。
他們對 14 個領先的大型語言模型進行了評估,覆蓋了大多數模型家族。沒有一個模型得分超過 50%。
而且,由於該團隊還通過母語為英語的專家手動翻譯,製作了這些文化紮根問題的英文等價版本,因此他們能夠直接分離出語言效應。大多數模型在英文數學推理問題上的表現,相較於原始語言問題,顯著提升約 10 個百分點,基於相同的底層問題。
對該設計的批評才是關鍵所在:現有的多語言推理基準測試通常通過翻譯英文基準來構建,這使其偏向於以英語語言和文化為背景的推理問題。一個翻譯後的測試衡量的是模型能否處理被翻譯的英文問題,而不是衡量模型能否在該語言中對當地文化進行推理。
三種構建模式
現有實踐採用三種方法,大多數權威基準測試將這三種方法結合使用。
機器翻譯結合專家後編輯。大型基準測試(如MuBench、BenchMAX和MMLU-ProX)採用機器翻譯和大語言模型輔助翻譯流程,並輔以專家後編輯,以保持語義、術語和文化的一致性。其優勢在於並行數據構建,能夠實現直接的跨語言比較,因為每種語言都看到相同的項目內容。
混合人工審核。翻譯後進行結構化的多標註員裁決。
原生編寫。由母語者用目標語言撰寫問題,如MultiNRC。具有最高真實性,無並行性,成本最高。
這種權衡是真實且值得強調的,對於任何進行此領域評估的人來說都至關重要。並行翻譯的集合可實現跨語言比較,原生撰寫的集合則能說明模型在該語言中的表現。它們回答了不同的問題,一個成熟項目必須同時具備兩者。
實際構建的成本是多少
有兩個已發表的數值提供了可使用的初步參考,這在該領域中是罕見的。
BenchMAX在16種非英語語言中擴展了對六大核心大語言模型能力的評估,採用三步流程:首先將內容從英語翻譯,然後由三位人工標註員對每個樣本進行後編輯,最後選擇最終版本的翻譯結果。
每個項目涉及十六種語言,三位標註員,是該設計中的主要成本驅動因素。
MIDB明確報告了將原本僅限英語的AlpacaEval和MT-Bench擴展至16種語言所需的努力:一支由20名專業譯員組成的團隊,總計投入175人日用於測試集開發。
這個數字應納入項目計劃中。在進行任何本地化創作之前,為擴展兩個現有基準測試,每種語言大約需要11人日。
經驗證的QA方法論
我找到的最透明的發佈質量流程來自一個多語言意圖分類基準測試,其內容值得幾乎完全複製。
他們的流程:候選樣本首先通過LLM輔助的篩選和一致性檢查,然後由每位語言的兩位標註員進行審核。在測試集構建中,有5%的子集進行了雙標註,該子集的標註員一致性達到95%。剩餘的分歧由第三位專家裁決,沒有達成共識的樣本則被完全剔除。
該設計中有三項值得明確指出。
自動過濾首先運行,作為初步分層而非判斷,其架構與數據操作中其他地方使用的架構一致。
一致性是基於定義的子集進行測量,而非默認假設。95%的數值被報告出來,使讀者能夠判斷該子集的可靠性,而非盲目信任它。
無共識項被移除而非強行解決。這是大多數團隊所忽略的紀律。兩名合格標註員無法達成一致的項目,並非難題,而是模糊項,將其納入會為每個模型的評分引入噪聲。
該基準在範圍描述中提出一個值得采納的區別:原生評估與合成評估。其原生評估使用了一個經人工驗證的、從真實多語言流量中分離出的674個示例子集,並去除了跨語言語義重複項。
六百七十四個示例。來自真實流量的分離數據。已去除跨語言的重複項。這比數萬條翻譯示例更具實用價值,且大多數公司均可實現。
分層,以及它所防止的錯誤
此處的實踐指導異常具體,值得儘可能貼近原文引用。
按語言和文字系統對黃金標準集進行分層。並提出兩個明確警告:不要將所有中文、日文、韓文(CJK)合併在一起,也不要假設西班牙語和葡萄牙語的行為相同。
這兩種錯誤都很常見,因為從行政上來說是方便的。中文、日文和韓文在書寫系統上有相似性,而在其他與模型行為相關的內容上幾乎毫無共通之處。西班牙語和葡萄牙語相近,團隊通常會將其中一個視為另一個的代理,而且相近到錯誤表現是微妙的而非明顯的。
相關的質量標準:每種語言都僱傭本地標註員,並確保每種語言的Kappa值高於0.7。
按語言劃分。不是整個集合的總體一致性數值,否則整體數值可能看起來健康,而某一種語言的值卻僅為0.4。
這與我在此係列中反覆倡導的按語言劃分的報告紀律一致,只不過現在是應用於評估構建,而非生產數據。
默認應發佈的四個評分標準
這是我找到的最直接可操作的內容,我建議任何正在構建多語言評估的團隊都採用它。四個本地化的評分標準,每個都能捕捉到一般質量評分所遺漏的錯誤:
習語傳遞質量(IdiomTransferQuality)。翻譯是否保留了習語的意圖,而不是字面翻譯?能夠捕捉到技術上準確但讀起來像機器生成的輸出。
文化語體一致性(CulturalRegisterAdherence)。響應是否符合用戶所在區域的文化語體?能夠捕捉到正確但不恰當隨意,或正確但過於正式的回應。
拒絕保留。源語言中的拒絕在目標語言中是否仍然保持為拒絕?這是一個安全準則,這是我最優先考慮的。護欄是按語言單獨訓練的,如果一個模型在英語中拒絕請求,但在其他語言中卻予以執行,這屬於安全失敗,而非質量失敗。
正式程度正確性。回應是否達到了預期的正式程度?尤其在具有語法化禮貌體系的語言中,這一點錯誤並非只是風格上的失誤,而是一種社會性錯誤。
這些都無法由經過英語訓練的評判模型來評估,這是需要原生語言標註員而非僅僅偏好使用原生語言標註員的根本原因。
評判問題
關於自動化裁決的一則說明,因為這是成本壓力推動的地方,也應當在此處有選擇地抵制。
已發佈的基準測試確實使用了大語言模型評判員:OMGEval中使用GPT-4,MMLU-ProX中使用GPT-4o,其他地方也有類似方法。結合多階段人工標註,這是一種可擴展的合理架構。
其侷限性在於,評判模型繼承了被評判模型本身的語言能力曲線。一個在英語方面很強但在約魯巴語方面很弱的評判模型,將對約魯巴語的輸出進行不可靠的評估,並且在英語中使用的自信評分行為也會同樣體現在約魯巴語的評估中。它的錯誤不會顯現出錯誤的特徵。
實際做法:在大規模集合中用於初步篩選、處理效率和迴歸測試的自動化評判;對於上述四個準則以及任何評判模型自身能力存疑的語言,均採用原生語言標註員進行評判。
我們是如何看待這個問題的
聲明我們的立場:Lifewood 通過在超過30個國家的交付中心的母語人士,構建了覆蓋50多種語言的評估與偏好數據,因此評估集的構建是我們工作的一部分。
我想對任何正在規劃這項工作的人說兩點。
第一點是,最高價值的資產是一個私有的母語數據集,而不是一個大規模的翻譯數據集。物流基準的674個由人工驗證的母語示例,來自真實流量的保留樣本,比一個規模是其50倍的機器翻譯數據集更能作為評估工具,因為它衡量的是實際部署效果,而不是一個基準對它的代理,而且它不會因出現在訓練數據中而被汙染。
第二點是,標註員的需求是決定性約束,它首先是一個招聘問題,而不是一個方法論問題。每個語言需要達到0.7以上的Kappa值,這就要求每個語言配備2到3名合格的母語標註員,同時在線並遵循統一的指導方針。對於16種語言來說,這需要30到50名具備相應語言背景的人員,這屬於交付網絡的問題,而不是研究設計的問題。正是在這裡,項目容易出現延誤,因此應當以招聘時間線而非標註時間線來規劃。
構建清單
明確每個數據集的用途。平行翻譯用於跨語言對比,母語撰寫用於判斷模型在該語言中的表現。不要將兩者混為一談。
預算要務實。根據已發佈的MIDB數據,每種語言擴展現有英文基準大約需要11人天,這還不包括母語撰寫部分。
運行LLM輔助過濾作為初步篩查,然後進行人工審核,順序如上。
每種語言配備兩名標註員,使用雙標註子集來衡量一致性,由第三名專家進行裁決,並對無共識項採取移除而非強制解決的方式。
每種語言的Kappa值必須高於0.7,並按語言分別報告。
按語言和文字系統進行分層,不按地區,也不按文字家族分層。
發佈四種本土化評分標準,優先保留拒絕響應。
從真實流量中構建一個私有的保留性本土化數據集,移除跨語言語義重複項。
使用自動化裁判提升處理效率,但不用於校準集的評估。
關鍵要點
- 將一個英文構建的評估體系應用於其他語言時,該體系中非英文部分得分良好,僅僅是因為評分標準無法識別其中存在的缺陷。
- MultiNRC 包含超過 1000 個用法語、西班牙語和中文原生撰寫的推理問題,涵蓋四個類別。在對 14 個領先大語言模型進行評估時,沒有一個模型得分超過 50%。
- 在相同的問題上,使用母語人士撰寫的英文等價版本,模型在數學推理方面表現比英文版本高出約 10 個百分點。
- 現有的多語言推理基準測試通常是從英文翻譯而來,這使它們偏向於具有英文語言和英文文化背景的問題。
- 三種構建方式:機器翻譯結合專家後編輯、混合人工審核以及原生撰寫。平行集可實現跨語言對比;原生集則衡量模型在該語言中的實際表現。
- BenchMAX 通過翻譯、每樣本由三位人工標註員進行後編輯,以及最終版本選擇,覆蓋了 16 種非英語語言和六種能力。
- MIDB 報告了 20 名專業翻譯人員和 175 人天的工作量,將 AlpacaEval 和 MT-Bench 擴展到 16 種語言,每種語言大約需要 11 人天。
- 一個已發表的問答流程採用了大語言模型輔助篩選、每種語言兩名標註員、5% 的雙標註子集且標註一致性達 95%、第三方專家裁決,以及移除無共識樣本。
- 他們的原生評估集包含 674 個經人工驗證的示例,來自預留的真實多語言流量,已去除跨語言語義重複項。
- 按語言和文字系統對黃金標準集進行分層。不要將中文、日文、韓文(CJK)合併處理,也不要將西班牙語和葡萄牙語視為等同。
- 每種語言的標註員間Kappa係數必須達到0.7以上,並按語言單獨報告,而非彙總後報告。
- 默認提供四種本土化評分標準:習語傳遞質量、文化語域一致性、拒絕保留和正式程度正確性。
- 拒絕保留是一項安全評分標準:如果一個模型在英語中拒絕回答,但在其他語言中卻合規執行,這屬於安全漏洞。
- 已發佈的基準測試使用大語言模型(LLM)裁判者,包括GPT-4和GPT-4o,但這些模型在評判時繼承了被評估模型的語言能力曲線,因此校準子集必須依賴人類母語判斷。
- 關鍵約束是標註員招募:在十六種語言中實現Kappa係數高於0.7,需要三十到五十名合格的母語標註員同時工作。
資料與進一步閱讀
- "MultiNRC:一種具有挑戰性的多語言推理評估基準,用於大語言模型(LLMs)", Scale AI, arXiv, 在1000多個本地問題、四個推理類別、對14個模型的評估中,沒有一個模型得分超過50%,且在數學推理方面存在10分的英語優勢
- Future AGI, "Multilingual LLM Evaluation: A 2026 Playbook for Non-English", 關於雙語質量產品框架、按語言和文字系統分層、每種語言Kappa係數0.7的門檻,以及四種本土化評分標準
- "BenchMAX: 一個面向大語言模型的多語言綜合評估套件", arXiv, 涵蓋16種語言的六大能力範圍,以及由三位標註員執行的三步翻譯、後編輯和選擇流程
- "MIDB: 多語言指令數據增強", arXiv, 需要20名譯員和175人天的工作量來擴展。
- HAlpacaEval 和 MT-Bench 擴展至16種語言
- "從合成到原生:物流客戶服務場景中多語言意圖分類的基準測試", arXiv, 採用大語言模型輔助篩選,每種語言配備兩位標註員,5%的雙標註子集在95%的一致性下,由第三方專家裁決,移除無共識項,並構建了包含674個示例的原生評估子集