一家總部位於美國的全球前五消費科技公司,其旗艦級消費 AI 助手已在 40 多個市場部署
為旗艦級消費 AI 平臺提供覆蓋 50 多種語言的多語言提示-回覆、RLHF 與 SFT 數據
發佈日期 2026年7月24日
概覽
| 所屬行業 | 消費科技 / 前沿 AI | 旗艦級消費 AI 平臺及相關全球 AI 項目 |
|---|---|---|
| 客戶所在地區 | 美國客戶 | 生產分佈在 40 多個交付中心 |
| 數據類型 | 3 種 | 多語言提示-回覆配對數據 · RLHF 偏好排序數據 · 監督微調語料 |
| 語言覆蓋 | 50 多種語言 | 本地母語標註人員,而非翻譯語料 |
| 質量標準 | 95% 以上準確率服務承諾 | 依據客戶認可的黃金標準集 |
| 標註者間一致性 | 95% 以上閾值 | 兩位獨立審核員針對同一項目 |
| 審核模式 | 雙層人工閉環 | 公開數據集通常只經過一輪處理且未經分級 |
| 培訓投入 | 414,120 個培訓工時 | 2025 年孟加拉國團隊,人均約 60 個工時——屬於團隊整體投入,非項目專屬數據 |
| 狀態 | 進行中 | 涵蓋多語言數據、RLHF 及 SFT 的多年期供應關係 |
這是一份 Lifewood Data Technology 關於LLM 訓練數據的案例研究——一個為一家總部位於美國的全球前五消費科技公司,其旗艦級消費 AI 助手已在 40 多個市場部署、覆蓋美國 · 全球交付的項目。 為旗艦級消費 AI 平臺提供覆蓋 50 多種語言的多語言提示-回覆、RLHF 與 SFT 數據
一種語言的覆蓋盲區,是產品缺陷,而非可以忽略的誤差
前沿消費級 AI 需要的訓練數據,既要多語言,又要達到遠高於公開數據集的質量分級標準。原因在於:失敗無法被"平均"掉。一個部署在數百萬臺設備上的消費級 AI 平臺,某一種語言出現覆蓋盲區,對該語言的每一位使用者而言,都會顯現為看得見的產品缺陷,無論另外四十九種語言做得多麼出色。第二個制約因素是:僅有廣度是不夠的。多語言提示-回覆配對數據教會模型如何作答;RLHF 偏好排序數據教會模型判斷兩個回答中哪一個更好;監督微調語料則教會模型某種特定行為。只購買第一種,是最常見的錯誤——一個覆蓋面廣、卻沒有偏好數據的模型,能用每一種語言流利作答,卻沒有一種語言答得好。
覆蓋 50 多種語言的三類數據,由母語使用者製作,而非翻譯而來
Lifewood 作為客戶旗艦級消費 AI 平臺及相關項目的高端訓練數據合作伙伴,在 50 多種語言中提供全部三類數據。生產工作通過分佈在 40 多個交付中心的本地母語標註人員完成,並遵循人工閉環質檢流程。一、本地母語生產。語言覆蓋能力由真正會說這門語言的人構建,而非翻譯而來。Lifewood 直接從該語言的使用社區中招募標註人員,這正是實現真實方言及語域覆蓋的關鍵。二、三類數據統一標準。提示-回覆、偏好排序及微調語料,均依據同一套黃金標準集及同一套審核流程製作,而非分別採集後再由客戶自行協調統一。三、依據客戶認可的黃金標準集執行雙層審核。遵循 95% 以上的準確率服務承諾及 95% 以上的標註者間一致性閾值。四、持續供應而非一次性交付。前沿項目很少是一次性採購:隨著產品迭代,模型行為會發生偏移;新語言的開放會帶來新市場;用戶預期的變化也會讓偏好數據逐漸過時。這項工作之所以是持續性的,原因與模型本身的持續演進如出一轍。支撐這一切的審核產能,是實實在在配備到位的,而非空口承諾——2025 年,孟加拉國團隊累計交付了 414,120 個培訓工時,人均約 60 個工時。
一項覆蓋全部三類數據、持續多年的活躍供應關係
這項合作以持續供應關係而非一次性交付項目的形式運行,涵蓋 50 多種語言的多語言數據採集、RLHF 偏好數據及監督微調語料,合同約定的準確率標準為 95% 以上,標註者間一致性維持在 95% 以上的閾值。
Lifewood 相關服務
經核實的成果
| 指標 | 數值 | 基線 | 衡量方式 |
|---|---|---|---|
| 語言覆蓋 | 50 多種語言 | 公開多語言數據集通常覆蓋更窄且未經分級 | 已交付語言清單 |
| 準確率標準 | 95% 以上 | 合同約定標準,而非盡力而為 | 客戶認可的黃金標準集 |
| 標註者間一致性 | 95% 以上 | 維持的閾值,而非某一時期的平均值 | 兩位獨立審核員,同一項目 |
| 交付數據類型 | 3 種 | 大多數供應商只提供提示-回覆數據 | 提示-回覆、RLHF 偏好、SFT |
| 交付版圖 | 40 多箇中心 | 並行擴展,而非單一場地排隊 | Lifewood 中心網絡 |
方法與核實。 本頁數據由 Lifewood 自行披露。準確率依據客戶認可的黃金標準集、在雙層人工閉環審核下測算,標註者間一致性作為獨立指標單獨跟蹤,維持在 95% 以上的閾值——單項準確率描述的只是供應商與自身的一致性,而兩位獨立審核員之間的一致性,才能說明規範是否被真正共享理解。414,120 個培訓工時這一數據,涵蓋 2025 年孟加拉國團隊,屬於團隊整體投入而非項目產出指標。本頁不公開項目具體數量。根據協議保密條款,本頁不披露客戶名稱。
關於這個項目的常見問題
在這個多語言 LLM 訓練數據項目中,Lifewood 提供三種不同類型的數據——提示-回覆配對數據、RLHF 偏好排序數據及監督微調語料——覆蓋 50 多種語言。
在消費級 AI 平臺數據項目中,Lifewood 將單語種質量視為產品級要求,因為在數百萬臺設備的裝機規模下,失敗無法被平均掉。
這個 LLM 訓練數據項目,依據客戶認可的黃金標準集,運行雙層人工閉環流程,遵循 95% 以上準確率服務承諾及 95% 以上標註者間一致性閾值。
這項多語言 LLM 訓練數據合作,是一項涵蓋多語言數據、RLHF 及 SFT 的活躍多年期供應關係。