跳轉到主要內容
AI 數據

全球多語言AI數據收集的未來

簡短回答。六種力量正在重塑它,其中四種在十二個月內出現。來源追溯於2026年8月2日在歐盟成為法律可執行的。經過同行評審的研究……

Mumu D. · 2026年8月12日 · 閱讀約 9 分鐘

簡短回答。 六種力量正在重塑這一領域,其中四種在十二個月內出現。來源追溯在歐盟於 2026年8月2日 成為具有法律效力的條款。經過同行評審的研究已將合成數據限制在輔助角色,這反而提升了經驗證的人類數據的價值。數據勞動正從無監管轉向有監管,肯尼亞在2026年正起草公平薪酬基準。各國政府正將語言覆蓋作為公共基礎設施進行資助。買家需求正從標註量轉向評估和偏好數據。而語音正成為主要模態,因為世界上超過7000種語言中,僅有約 3000種 擁有成熟的書寫系統。

貫穿其中的共同點是:那些可以被自動化的部分正在被自動化,而剩下的部分則需要那些能夠說當地語言、身處當地的人來完成,其貢獻必須被記錄並獲得公平報酬。這是一項比大規模標註更窄、但更持久的業務。


2026年發生了什麼變化,使其成為轉折點?

來源追溯(provenance)不再只是良好實踐,而是成為具有法律效力的法規。這一演變過程值得精確闡述,因為相關日期經常被誤報。

日期 適用範圍
2024年8月1日 歐盟人工智能法案正式生效
2025年2月2日 禁止性行為和人工智能素養義務
2025年8月2日 通用目的人工智能模型的治理規則和義務
2026年8月2日 適用於一般情況;透明度規則生效;人工智能辦公室獲得對通用目的AI模型的執法權力
2027年12月2日 在敏感領域中的高風險系統(根據《人工智能綜合法案》,生效日期為2026年7月27日)
2028年8月2日 嵌入受監管產品中的AI

對於數據供應商而言,單一工具的重要性超過其他任何工具。除了GPAI行為準則外,委員會還發布了一個訓練內容的公眾摘要模板,要求提供商概述其模型訓練所使用數據的來源。‘這些數據來自哪裡’現在已成為公開回答,而非內部信息。

因此,一個數據集的評判標準是雙重的,而非單一標準:它是否優質,以及是否能夠證明其來源?那些在實際工作過程中就捕獲了用戶同意、貢獻者元數據和質量決策的供應商,與那些計劃事後重建這些信息的供應商相比,處於更有利地位。


合成數據會取代人工多語言數據採集嗎?

不會,且經過同行評審的證據異常清晰——但該證據在兩個方向上都被誇大了,因此注意事項至關重要。

參考點是Shumailov等人2024年發表在Nature上的論文,該論文表明,當模型僅在合成數據上遞歸訓練時,其性能會退化,大約在五到十代內出現可測量的崩潰。這種失敗具有特定形態:分佈的尾部最先消失。罕見、異常和低頻情況逐漸消失,而平均性能仍看似可接受,直到後期輸出才變得單調重複。

兩個澄清:

  • 這並不是對合成數據的反對。 這些實驗使用了純粹的合成數據,原始的人類數據被丟棄且沒有驗證,這並不是嚴肅實驗室的實際操作方式。後續研究已表明,通過驗證以及積累真實數據與合成數據並行,而非替代真實數據,就可以避免崩潰現象。
  • 但這對人類錨定提出了強有力的支持,而這一論點在多語言工作領域尤為突出。分佈尾部正是低資源語言收集的核心所在:地域變體、罕見結構、方言形式——這些在遞歸訓練中出現頻率低且最先被丟失的內容。

經濟後果已經體現在該領域對數據的討論中:經過驗證的人類來源正從一種被默認的屬性轉變為一種被定價的屬性。更廣泛的討論見於在AI生成數據上訓練AI模型是否安全


當數據勞動變得受監管時會發生什麼?

成本變得明確,供應鏈變得可審計,合規與非合規供應商之間的差距也隨之拉大。這是該領域最被低估的轉變。

肯尼亞的草案人工智能及其他新興技術政策,於2026年發佈供諮詢,目前是明確的信號之一。該政策針對數據標註、內容審核和AI質量評估崗位,並提出一個公平薪酬參考框架,該框架以國際薪酬水平為基準,而非國內最低標準。它所解決的差距十分明顯:肯尼亞數據工作者的報告收入約為$1.46至$3.74每小時,而美國同等崗位的薪酬則為$21至$27

該草案還提議強制實施心理社會支持、書面合同、透明的薪酬報告機制以及申訴渠道,肯尼亞2026年AI法案將進一步引入基於風險的框架和一名專門的AI監管官。學術研究也趨於一致:一篇2026年CHI會議論文基於對肯尼亞數據工作者的訪談,描述了由不穩定的合同、薄弱的制度保護和全球勞動力套利所形成的‘困局制度’。

任何委託多語言數據的人將面臨三個後果。

  1. 勞工實踐變成了採購問題,而非價值聲明。 受歐盟文件義務約束的買家將越來越多地被要求說明貢獻者是如何被對待的,而不僅僅是被交付的內容。
  2. 價格預期被重新設定。 以壓低工資為基礎的報價,並不是同一服務的更便宜版本;它代表的是不同的風險特徵。
  3. 留存變得具有戰略意義。 在少數語言中,受過訓練的貢獻者是稀缺資源。公平的條款是供應商能夠確保明年仍能提供該語言服務的關鍵。

政府現在為何要資助語言覆蓋?

因為語言能力已被重新歸類為國家基礎設施,而這改變了誰需要為底層數據付費。

2026年6月,歐盟委員會選定 EUROPA聯盟 為前沿人工智能大獎的獲勝者——一個旨在為所有 24種歐盟官方語言 構建歐洲開源前沿人工智能模型的項目。這是一項由公共資金支持的語言覆蓋承諾,其規模遠超任何商業業務案例單獨所能產生的成果,與歐盟的人工智能千廠計劃以及其他國家的主權人工智能努力並列存在。

這一轉變有三個重要意義。 新買家:公共項目和國家機構正成為重要採購方,其需求與商業買家不同——強調開放性、文檔化、可審計性以及明確的語言覆蓋要求。 不同的經濟模式:當語言覆蓋成為政策目標而非收入計算時,那些在商業測試中失敗的語言仍可獲得資助。 開放輸出:由公共資金支持的數據集往往會被公開發布,這為所有在這些語言中工作的從業者設定了最低基準。

其推論是,沒有國家支持或商業案例的語言仍處於暴露狀態。公共資金正在重新繪製地圖,而不是將其抹平。


買家需求是如何變化的?

從數量轉向判斷。市場背景是擴張——Grand View Research 2024年將數據收集和標註的價值評估為 $3.8 billion,並預測到2030年將達到 $17.1 billion,複合年增長率達 28.4%,其中亞太地區增長最快,音頻數據類型也是增長最快的類型之一。在這一宏觀數據之下,數據構成正在發生變化。

  • 評估正演變為一種產品。 當模型能力足夠強,以至於普通的準確性檢查無法區分它們時,真正有價值的工作就是設計能夠揭示失敗的測試——按語言劃分,由母語使用者撰寫,而非翻譯而成。
  • 偏好與對齊數據極為稀缺。 教會模型在特定文化中恰當行為的過程無法通過網絡爬取或翻譯實現,而這正是母語創作最難以被替代的階段。
  • 紅隊測試必須是多語言的。 安全行為必須在每個發佈語言中進行探查,因為防護措施僅在訓練時存在的語言中才有效。
  • 批量標註正被自動化。 日常標註工作正越來越多地由機器輔助並輔以人工驗證,壓縮了數量類工作的利潤空間,同時提升了判斷類工作的溢價。

對於供應商而言,可辯護的定位正從產能轉向專業能力;對於買家而言,最便宜的項目通常並非決定模型質量的關鍵因素。


為什麼語音正在成為核心?

因為世界上剩餘的大多數語言數據從未被記錄下來。大約 3,000種 世界上的 7,000 多種語言中已有書寫系統,因此對於以口頭語言為主的語言來說,語音並非多種媒介之一——它就是唯一的途徑。

有三個發展推動著這一趨勢。最近的開源語音系統表明,有意識地在實地進行數據採集,可以將語音識別擴展到超過一千種語言,其中包括數百種此前從未被服務的語言。音頻數據在數據採集預測中是增長最快的領域之一。在許多市場中,語音接口仍然佔據主導地位,尤其是在書面標準識字率低於口語熟練度的地區。

語音數據採集在結構上也更加困難:需要實地人員參與,而非在工作室進行,必須處理高生物識別級別的知情同意,以及在缺乏書寫體系的情況下進行轉錄決策。這些問題屬於運營和治理層面,而非模型層面,因此更有利於那些已在相關地區擁有本地團隊的組織。


組織應如何應對這一切?

  • 從一開始就記錄來源信息。 在實際工作過程中記錄知情同意、貢獻者元數據、補償記錄和質量決策。目前所有監管趨勢均不建議對此進行弱化。
  • 將合成流程錨定在經過驗證的人類數據上。 應積累而非替代,並在進入訓練前進行驗證。在真實數據稀少的領域,這一點尤為重要。
  • 為公平勞動預算並預期其接受審計。 趨勢是向基準化薪酬、書面合同和信息披露發展。
  • 在數據量之前投資於評估。 由母語使用者撰寫的、按語言劃分的評估集正成為稀缺資產。
  • 現在規劃語音能力。 對以口語為主導的語言而言,其制約因素是實地存在和知情同意基礎設施,而這兩項建設所需時間均長於一次數據採購。

Lifewood的應對方式

Lifewood的交付體系圍繞分佈式中心和區域語音運營構建,原因如上:收集全世界的口語語言無法遠程完成。 40多個交付中心,覆蓋30多個國家50多種語言 包括少數語言方言,以及 56,788 名註冊貢獻者,這些構成了實地存在這一前提條件,而非一個需要啟動的項目。

來源追溯在工作過程中被實時記錄——包括知情同意、貢獻者元數據、補償記錄、任務分配和質量決策——而不是在交付時才彙總,因為上述歐盟時間線將這些記錄變為買家可能需要公開的文件。貢獻者是通過培訓和保留來實現的,而非按項目臨時招募; 414,120小時培訓時間 已在2025年交付給孟加拉國團隊,這正是能夠實現罕見語言二次交付的機制。質量以客戶批准的黃金標準集為基準,達到 95%以上的準確率SLA,按語言分別報告。

以上內容並非法律建議,不同司法管轄區以及數據生產方式會帶來不同的義務。參見 AI數據服務多語言數據採集低資源語言語音數據採集


資料與進一步閱讀

  • 歐洲委員會, AI法案 政策頁面——應用時間線、GPAI義務、培訓內容摘要模板、AI綜合方案。
  • 歐洲委員會, 委員會選定EUROPA聯盟為前沿AI大獎挑戰賽的獲勝者,2026年6月19日。
  • Shumailov等, 當AI模型在遞歸生成數據上訓練時會崩潰Nature,2024年7月。
  • Transformer, 合成數據比你想像的更有用 — 崩潰結果的侷限性。
  • ITWeb Africa, 肯尼亞為AI從業者設立標準 — 公平薪酬參考框架草案。
  • "計劃只是生存": 肯尼亞的數據工作與困局制度, CHI 2026.
  • Grand View Research, 2025–2030年數據收集與標註市場規模報告.
  • 主要為口語語言的人類校正轉錄成本分析, arXiv.

常見問題

該法案於2026年8月2日普遍適用,其中透明度規則已生效,人工智能辦公室對通用人工智能模型擁有執法權力。高風險義務自2027年12月2日適用於敏感領域系統,自2028年8月2日適用於嵌入受監管產品的人工智能系統,這是根據2026年7月27日生效的《人工智能綜合法案》規定。

不會。《自然》雜誌發表的同行評審研究表明,僅使用合成數據進行遞歸訓練,模型在大約五到十代後就會退化,少數情況下最先丟失的是模型能力。合成數據作為補充手段,必須建立在經過驗證的人類數據之上,並與之積累,而非替代它。

因為這類數據的價值在於罕見形式和地域差異,而這些正是遞歸生成最先侵蝕的分佈部分。一個擁有薄弱人類數據支撐的語言,其合成生成所依賴的基礎就更少。

它將使真實成本變得可見。公平報酬、知情同意處理和文檔記錄等成本,目前合規供應商已經承擔;監管將取消那些未滿足要求的供應商所享有的折扣。

評估數據、偏好數據和對抗性測試數據,以及語音數據。大規模標註正越來越多地採用機器輔助、人工驗證的方式,這壓縮了體積類工作的邊際空間,同時提升了無法被自動化處理的判斷工作溢價。

貢獻者的位置、招募和支付方式、獲得的同意內容、質量決策的記錄方式,以及數據集是否附帶審計人員可以追蹤的文檔。這些問題正逐漸成為採購要求,而非盡職調查的偏好。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊