簡短回答。 多語言大語言模型訓練數據由三類供應商提供——大型通用標註公司、專業語言數據公司以及擁有本地交付中心的管理型多語言服務商——其質量通過四種機制保障,而非依賴單一檢查:在數據採集前就設計好覆蓋範圍(涵蓋語言、方言、領域、人口群體,並有意識地分層),在本地市場進行母語者生產與審核,按語言分別測量經校正的一致性,而非整體平均值,以及每項數據均記錄其來源與用戶同意情況。整體質量指標是弱多語言語料庫掩蓋其缺陷的主要方式:一個以英語為主的平均值,無法反映模型在實際使用中會失敗的語言場景。
基礎模型的評判越來越關注其最薄弱支持的語言,而非其最強的語言。正是這些薄弱語言引發了抱怨,也是監管機構關注的重點,也是從‘模型有效運行’到‘模型讓所有者難堪’之間差距最大的地方。這些薄弱語言背後的數據通常是最薄弱的部分,也是採購過程中最被忽視的部分。
本指南涵蓋什麼樣的多語言語料庫是優質的,質量是如何實際驗證的,以及應向供應商提出哪些要求。
多語言語料庫為何會失敗
有五種失敗模式佔其大部分,這些模式均非罕見,且在訓練前預防成本低廉,一旦訓練完成則修復成本高昂。
翻譯的英文內容。 由機器翻譯英文數據構建的語料庫,會將英語的表達結構、文化假設和英語風格的問題帶入每一種語言中。基於此類語料庫訓練的模型,會用另一種語言回答英語問題。這種方式快速且成本低廉,卻恰好產生出那種‘流暢但生硬’的質量,母語使用者能立刻察覺。
方言與語體坍縮。 "阿拉伯語" 並非一種變體,僅基於現代標準阿拉伯語構建的語料庫,將無法處理用戶實際使用的口語形式。同樣的問題也存在於中文方言、美洲各國的西班牙語,以及任何存在正式與非正式語體差異的語言中。
領域偏差。 通過網絡爬取的多語言數據,過度包含新聞、百科全書和論壇文本。如果你的模型服務於醫療、金融或工業支持領域,它所需的專業詞彙,恰恰是這些容易爬取的文本中最缺乏的部分。
腳本和分詞盲點。 擁有豐富形態變化、非拉丁文字或沒有空格詞邊界的語言,每單位意義消耗的token更多,且對標準化錯誤更敏感。一個基於英語構建和測試的流程,會默默地破壞這些語言的文本。
整體質量報告。 隱藏其他四種失敗模式的模式。一個包含40種語言的語料庫報告97%的質量,其中可能有一種語言只有60%,直到用戶使用時才會被發現。
在收集任何數據之前設計覆蓋範圍
覆蓋範圍是一個設計決策,而非結果。包含四個維度,明確決定:
| 維度 | 指定什麼內容 | 為何重要 |
|---|---|---|
| 語言 | 按商業優先級分層,每層設定目標體量 | 防止長尾內容成為最容易獲取的內容 |
| 同一語言內的不同變體 | 方言、地域變體、正式與非正式語體 | 最常見的差距,且在語言層面規劃中是不可見的 |
| 領域 | 模型所服務的各個學科領域的分佈情況 | 網絡爬取數據偏向新聞和百科全書文本 |
| 說話者和作者的人口統計特徵 | 符合使用場景的年齡、性別、地域、教育背景的組合 | 決定了模型對哪些人群表現不佳 |
在數據收集階段一個有用的檢查項,按語言而非全局計算:
覆蓋率 = 該分層已採集的數據項數 ÷ 該分層目標數據項數
報告各層次的最小覆蓋比例以及平均值。平均值告訴你項目進度正常;最小值則告訴你哪種語言或方言將在評估中失敗。
四種質量機制如何運作
1. 原生、市場內生產與審核
供應商常混淆的兩個區別:
- 母語者 與 流利使用者。兩者都有用;只有前者能可靠地捕捉語境、習語以及‘沒人會這麼說’類的錯誤。
- 市場內 與 海外分佈。市場內審核員追蹤當前用法、現行法規和當前文化參照。海外分佈審核員在許多任務上表現優異,但存在用法、法規和文化參照上的漂移現象。
請要求提供 每種語言的審核人員數量及地理位置 —— 而非僅支持語言的數量。對於語音和對話數據,需瞭解每種語言內部各方言的覆蓋情況 範圍,因為僅基於一個城市數據構建的越南語能力,並不能代表整體越南語的覆蓋情況。
2. 按語言分別衡量的一致性
真正重要的質量指標是獨立標註員之間經過校正的共識度,按 語言 計算:
Cohen's kappa = (Observed agreement − Expected agreement) ÷ (1 − Expected agreement)
原始一致性在不平衡任務上具有誤導性——兩名標註員可能95%的時間達成一致,卻幾乎無法區分內容。全局平均值恰恰隱藏了你需要觀察的語言細節。必須提供每種語言的獨立表格,並將任何僅在聚合中報告的語言視為未測量。
對於轉錄工作,等效的每語言指標是詞錯誤率(WER),並明確設定慣例:對於不流暢表達、數字、語言切換和專有名詞,不同供應商對錯誤的認定標準各不相同,缺乏明確說明的WER指標無法與任何其他指標進行比較。
3. 按語言構建的黃金標準集
僅用英語構建並翻譯的黃金標準集並非真正的黃金標準集。每種語言都需要獨立的參考樣本,由母語者構建,定期更新,並以已知速率注入實際工作流程,從而實現質量的持續監測,而非僅在交付時進行評估。
提出三個問題:誰構建黃金標準集,更新頻率如何,以及黃金標準注入生產工作的比例是多少。缺乏黃金標準集協議的供應商只是在檢查輸出,而非真正測量質量。
4. 每項內容的來源、同意與許可
對於大語言模型數據而言,這是一項採購准入條件,而非附加福利:
- 每項內容的來源與許可,明確建立其可用於模型訓練的權利,而非默認假設。
- 同意 對收集到的語音、圖像和文本貢獻進行記錄,包括後續使用的情況。
- 個人身份信息處理 —— 檢測、在必要時進行脫敏,並提供可執行和確認的刪除路徑。
- 汙染控制 —— 在語料庫內部進行去重,並儘可能與公開評估集進行篩查,以確保你的基準測試衡量的是能力而非記憶。
- 合成數據,明確標註為合成數據。 模型生成的訓練數據具有合法用途和不同風險;若語料庫中混合使用而未標註,將使這些風險無法管理。
在訓練前對語料庫進行評估
五項檢查,均可在樣本上運行:
- 由非參與生產環節的母語者 閱讀樣本內容。要求其做出簡單判斷:一名熟練的本地撰稿人是否會寫出這樣的內容?
- 翻譯腔檢測。 對樣本內容進行檢查,要求評審人員猜測其原始語言。如果他們能夠準確判斷,則說明語料庫是翻譯內容而非母語內容。
- 方言與語體分佈 應對照設計目標,而非對照總體數量。
- 領域分佈 應對照模型的預期用途,而非對照最容易收集的內容。
- 重複及近重複率,按語言劃分。在低資源語言中,重複內容常見,因為可用的原始材料較少,且相同文本廣泛傳播。
在投入付費試點之前運行這些測試。每個優先語言需包含數千條項目,包括最難處理的語言,這比任何提案都更有信息量。
對供應商的要求
| 需求 | 請求的證據 |
|---|---|
| 本地化、市場化的生產 | 按語言的人員配置及地理位置 |
| 按語言的質量報告 | 按語言劃分的Kappa或WER表格,上個季度數據 |
| 黃金標準集協議 | 由誰構建,更新頻率,注入率 |
| 覆蓋設計 | 分層計劃及各層的最低覆蓋比例 |
| 低資源獲取方法 | 在尚未覆蓋的語言中如何招募和驗證講者,以及所需時間 |
| 來源追溯與同意 | 每項記錄;模型訓練的許可位置 |
| 汙染控制 | 去重方法;評估集篩選 |
| 安全性和居住地要求 | 數據存儲和處理的位置;命名的次級處理方 |
紅燈警示: 僅使用單一聚合質量指標;語言覆蓋範圍僅按支持語言計算;使用了翻譯的黃金標準集;未說明如何獲取新低資源語言數據;聲稱‘支持任何語言’但缺乏具體的數據來源方法。
Lifewood的應對方式
Lifewood 通過自有交付中心的管理團隊提供多語言訓練數據,而非開放眾包,這種模式使得每種語言的可問責性成為可能——相同的評審員長期參與某語言,從而讓黃金標準集和一致度指標具有實際意義。
覆蓋範圍具有結構性:50多種語言,在30多個國家設有40多個交付中心,以及一個由56,788名貢獻者組成的全球池,採用本地化標註員而非遠程近似人員,專注於低資源語言和地域方言——這是語料庫中最可能通過翻譯獲取的部分。覆蓋範圍包括大語言模型工作,如強化學習人類反饋(RLHF)、監督微調(SFT)、數據蒸餾和響應評估,覆蓋50多種語言,多語言語音轉錄及音素標註,以及針對地理和人口細分領域的定製化實地採集。AI數據遺產可追溯至2004年,公司目前成立於2018年;服務對象涵蓋前沿模型實驗室、語音AI開發者、AI計算供應商、計算機視覺供應商以及自動駕駛項目,客戶身份根據協議予以保密。
參見 企業級大語言模型訓練數據, 多語言數據採集, 低資源語音數據, AI數據驗證 和 質量保證流程。
資料與進一步閱讀
- Cohen的kappa和Krippendorff的alpha是標準的校正機會一致性度量;應按語言分別使用,而不是報告整體的原始一致性。
- 配套指南:選擇AI標註服務的9個標準 —— 覆蓋所有模態的供應商選擇。
- Lifewood 的交付數據(50+ 種語言,40+ 箇中心,30+ 個國家,56,788 名貢獻者)已發佈於 lifewood.com。