跳轉到主要內容
AI 數據

2025年全球多語言AI數據採集領域前10家公司

簡短回答。2025年重新排列了行業。6月,Meta以143億美元收購了Scale AI的49%股份,並聘請了其創始人;幾天後,谷歌——Scale的最大客戶,計劃支出約2億美元……

Mumu D. · 2026年9月1日 · 閱讀約 14 分鐘

簡要回答。 2025 年重新排列了整個行業格局。Meta 於 6 月以 $14.3bn 收購 Scale AI 49% 股權,並聘請其創始人;數日內,Google(作為 Scale AI 最大客戶,計劃 2025 年支出約為 $200m)以及 OpenAI 和微軟開始將工作轉移至其他平臺,同時自建了 Surge AI,該平臺在 2024 年已實現 $1.2bn 的收入,超越 Scale AI,繼承了前沿實驗室的領先地位。LXT 完成對 Clickworker 的收購併實現整合,目前擁有 700 萬+貢獻者,覆蓋 1000 多種語言區域。當年定義行業的十家機構為:Appen、TELUS Digital、Surge AI、Scale AI、LXT、iMerit、Defined.ai、Sama、Nexdata 和 Shaip

在 AI 訓練數據行業短暫的歷史中,沒有哪一年像 2025 年那樣戲劇性。6 月,Meta 以 143 億美元收購了 Scale AI 49% 的股權——當時 Scale AI 的估值高達 290 億美元,成為行業最具價值的公司,並聘請其創始人 Alexandr Wang 負責 Meta 新成立的超級智能實驗室。數日內,Google(作為 Scale AI 最大客戶,計劃 2025 年支出約 2 億美元)、OpenAI、微軟和 xAI 均開始切斷合作關係。一個詞驅動了所有企業的撤離:中立性。前沿實驗室不再將自身的專有訓練數據通過一家被直接競爭對手控股的公司進行處理。

這一事件徹底重塑了整個市場格局。自建的 Surge AI——在 2024 年已實現 12 億美元收入,超越 Scale AI——繼承了前沿實驗室的領先地位。LXT 於 2025 年 1 月完成對 Clickworker 的收購,並於 7 月完成平臺全面整合,目前擁有 700 萬以上貢獻者,覆蓋 1000 多種語言區域。TELUS Digital 於 2025 年 10 月被 TELUS 全面私有化。整個行業的需求顯著轉向專家級、多語言的人類數據,用於大語言模型的訓練、安全性和評估。

在這一動盪的背景下,以下是2025年定義全球多語言AI數據採集的十家領先企業——根據語言覆蓋範圍、眾包規模、服務深度、企業信譽以及在獨立2025年行業分析中的認可度進行排名。


我們如何對這些公司進行排名

  • 2025年的語言與地域覆蓋範圍——該日曆年中記錄的語言和方言覆蓋範圍。

  • 全球眾包與勞動力規模——2025年報告的貢獻者網絡的規模及其地理分佈。

  • 服務深度——定製化採集、現成數據集、標註、RLHF/LLM對齊以及評估服務。

  • 企業信譽——認證、合規性、分析師認可以及截至2025年的知名客戶。

  • 獨立認可——在知名2025年行業排名和回顧性分析中的一致性表現。


2025年度十大


1. Appen

多語言領域的資深企業,穩定發展總部:澳大利亞悉尼(成立於1996年)

語言覆蓋範圍(2025年):235種以上語言(正向擴展至500多個語境),通過100萬+貢獻者 最適合:大規模多語言語音與文本數據收集、強化學習人類反饋(RLHF)、大語言模型(LLM)數據項目 Appen在2025年經歷了從2024年失去谷歌後進入更輕量級階段,但其核心資產依然堅不可摧:擁有超過100萬經過嚴格篩選的貢獻者,覆蓋170多個國家,是行業內語言覆蓋最深的記錄。至2025年,公司大力投入生成式人工智能領域——包括強化學習人類反饋(RLHF)、監督微調演示以及多語言大語言模型評估——同時持續推進代碼混合語音、地域方言和低資源語言的里程碑式數據採集項目。當前沿實驗室在年中退出Scale AI,轉而尋求中立供應商時,Appen的獨立性及其25年多語言基礎設施使其成為天然受益者。

2025年關鍵優勢:

  • 最深的多語言基礎:覆蓋235種以上語言,具備方言、代碼混合及低資源語言能力,正向擴展至500多個語境。

  • 超大規模人群:100萬+經過嚴格篩選的貢獻者,覆蓋170多個國家。

  • 中立性紅利:在中立性成為行業最寶貴資產的時刻,成為一家獨立供應商。

  • 生成式人工智能服務:強化學習人類反饋(RLHF)、指令數據及多語言評估項目逐步成熟。

結論:2025年仍是全球規模多語言數據的基準參考點——同時因其中立性而變得更具吸引力。


2. TELUS Digital(AI數據解決方案)

通過一年的轉型實現企業多語言領導力 總部:加拿大溫哥華 語言覆蓋(2025年):500種以上的語言和方言;AI社區成員超100萬 適用場景:經審計的企業項目、多語言自然語言處理、多模態數據 2025年對TELUS Digital而言是具有變革意義的一年。該公司完成了從TELUS International的品牌更名,於4月失去了與Meta的內容審核合同(影響約2000名位於巴塞羅那的員工),並於2025年10月被母公司TELUS Corporation全資收購,從紐約證券交易所和多倫多證券交易所退市。在此期間,其AI數據解決方案部門始終提供少數企業能夠實現的服務:一個由超過100萬名標註員和語言專家組成的受管理AI社區,覆蓋500多種語言和方言,運行於專有平臺,並具備SOC 2、ISO 27001和GDPR合規性,滿足受監管企業的要求。

2025年關鍵優勢:

  • 500多種語言和方言:在文本、圖像、音頻、視頻和地理數據上統一平臺實現覆蓋。

  • 企業治理:擁有Everest Group PEAK Matrix領導者傳承,具備深度合規認證。

  • 專家團隊:擁有數萬名擁有高級學位的專業貢獻者,專注於領域密集型工作。

  • 戰略穩定性:自2025年10月起完全由TELUS擁有,終結了公開市場壓力。

結論:2025年企業多語言項目在必須通過審計的情況下,仍能實現自我轉型的標準。


3. Surge AI

2025年的突破:一個自研崛起的巨頭,奪得前沿領域主導權 總部:美國舊金山(成立於2020年)

語言覆蓋範圍(2025年):覆蓋全球主要語言的多語言專家團隊,約50,000名經過審核的承包商。最佳適用於:高端RLHF、多語言安全性和對抗性測試、前沿大語言模型數據。此前長期被誤認為是小眾企業,2025年Surge AI作為行業中的低調巨頭被揭示:其2024年營收達到12億美元——超過Scale AI約8.7億美元——且完全依靠自研實現。當Meta在2025年6月增持Scale AI股份打破其中立性時,Surge AI繼承了前沿實驗室人工反饋領域的領先地位,客戶包括谷歌、Meta、微軟、Anthropic和Mistral,全年致力於尋求首次外部融資,據報估值在250億至300億美元之間。其經過審核的專家承包商模型——約50,000名高技能人員負責偏好排序、推理評估和多語言安全測試——定義了行業新的高端層級。

2025年關鍵優勢:

  • 前沿實驗室主導地位:在規模與Meta交易之後,成為中立性溢價供應商的首選。

  • 精英多語言團隊:為高技能主觀標註及東亞和歐洲語言安全工作配備資深標註員。

  • 卓越的經濟表現:營收超10億美元,自啟動以來一直盈利,直到2025年之前未引入外部資本。

  • 以質量為先的模型:優先選用經過審核的專家而非匿名眾包人員——這一模式成為整個行業開始效仿的模板。

結論:2025年的定義性公司:證明了專家級多語言數據,而非眾包規模,才是價值所在。


4. Scale AI

從行業王者到警示案例——僅一週內,總部:美國舊金山(成立於2016年)

語言覆蓋範圍(2025年):通過約24萬全球承包商實現的多語言強化學習人類反饋(RLHF) 最適合:工業級RLHF、評估及政府AI項目 Scale AI於2025年以市場領導者身份開啟,卻以行業最深刻的中立性警示告終。6月Meta以143億美元投資獲得其49%股權,將Scale估值提升至290億美元——此舉立即引發連鎖反應:谷歌、OpenAI、微軟和xAI在幾天內取消或縮減了合同,Scale也在8月裁員約14%(約200名員工),並終止了與500名承包商的合作。然而Scale仍是一家強大企業,其收入接近10億美元,Meta承諾每年至少支付4.5億美元,持續五年,並提供政府級安全認證以及工業級多語言RLHF工具,這些工具幾乎無人能匹敵。

2025年關鍵優勢:

  • 依然龐大的能力:覆蓋數十種語言的工業級RLHF與評估流程。

  • 政府特許:具備FedRAMP級安全性的體系,確保公共部門AI工作不受影響。

  • 穩固的基石:Meta五年、每年超4.5億美元的承諾,支撐運營基礎。

  • 中立性的啟示:2025年證明,在AI數據中,信任就是產品本身。

判決:雖受重創卻遠未終結——2025年最劇烈的下跌,仍屬於其最大的業務之一。


5. LXT

整合已圓滿完成:覆蓋1000多個地區,700多萬貢獻者。總部:加拿大多倫多/密西沙加(成立於2010年)

語言覆蓋範圍(2025年):覆蓋150多個國家的1000多個語言地區。最佳適用場景:以高速實現大規模多語言數據收集,提供託管服務與自助服務交付。LXT收購Clickworker——於2024年12月宣佈,於2025年1月22日完成交易,並於2025年7月31日完成全平臺整合。此次整合將LXT從一個備受尊敬的45語言中端服務商,轉變為地球上語言覆蓋最廣的服務商之一:一個橫跨150多個國家、1000多個語言地區、擁有700多萬貢獻者的統一平臺,融合了託管式AI數據服務與自助式眾包訪問。依託ISO 27001、GDPR、HIPAA和PCI-DSS合規性,LXT在2025年成為行業對‘我們需要在週五前完成五十萬條錄音,涵蓋十種語言’這一需求的最佳解答。2025年關鍵優勢包括:

  • 極致地區覆蓋:1000多個語言地區——整合後行業記錄中最廣的覆蓋範圍。

  • 700多萬貢獻者群體:為大規模多語言數據收集項目實現即時擴展。

  • 雙軌交付模式:完全託管項目加上自助服務平臺,統一於2025年中旬。

  • 強大合規體系:通過ISO 27001、GDPR、HIPAA和PCI-DSS認證。

結論:2025年在多語言廣度和速度方面最具價值——這一年其重大押注終於見效。


6. iMerit

領域專家,面向專家數據時代:總部位於美國/印度(成立於2012年)

語言覆蓋範圍(2025年):在文本、音頻、圖像、視頻及DICOM領域擁有多語言專業團隊。適用於:醫療健康、自動駕駛、金融及安全關鍵型自然語言處理。隨著行業在2025年從標準化標註轉向專家級數據,iMerit長期堅持的模式——全職、受訓、具備領域專長的團隊,而非匿名眾包——顯得尤為前瞻性。公司進一步鞏固了在醫學影像、自動駕駛感知、金融自然語言處理以及受監管行業多語言標註領域的地位,並持續在2025年獨立排名中成為準確率、可追溯性和領域知識優於單純數量的首選方案。

2025年關鍵優勢:

  • 專業團隊託管服務:具備資質的全職標註員,契合2025年專家數據趨勢的轉變。

  • 監管行業深度:醫療(DICOM)、金融和政府項目。

  • 成熟的質量保證運營:企業級質量流程和邊緣案例處理能力。

  • 多模態多語言覆蓋:覆蓋主要世界語言的文本、音頻、圖像和視頻。

結論:行業在2025年質量轉型中所驗證的穩健專業團隊。


7. Defined.ai

道德合規、多語言數據,年份來源追溯成為主流 總部:美國西雅圖 / 葡萄牙里斯本(成立於2015年)

語言覆蓋範圍(2025年):廣泛覆蓋,尤其擅長低資源語言和方言 最適合:語音AI、語音識別以及現成的多語言數據集 隨著2025年關於爬取訓練數據的版權訴訟不斷加劇,Defined.ai提供的道德來源、獲得授權的語音和語言數據集市場,從‘可有可無’轉變為‘戰略必需’。其在低資源語言和方言多樣性方面的目錄優勢,使其成為構建超越全球前20種語言的語音AI團隊的首選,既提供即用型現成授權,也提供定製化的多語言數據採集服務。

2025年關鍵優勢:

  • 市場模式:具備清晰來源追溯的即用型語音、對話和評估數據集。

  • 低資源語言深度:涵蓋罕見方言和少數語言,服務於全球語音AI應用。

  • 道德數據來源:在2025年數據來源追溯審查達到高峰時,採用基於知情同意的數據採集方式。

  • 混合靈活性:即用型目錄與定製數據採集服務相結合。

結論:2025年對每個法律團隊開始提出的問題‘這些數據來自哪裡?’最乾淨、最清晰的答案。


8. Sama

倫理標註,經重新認證並復興的總部:美國舊金山(成立於2008年)

語言覆蓋範圍(2025年):通過東非及更遠地區5000多名數據專家實現多語言標註 最適合:計算機視覺、生成式AI評估、經倫理審核的數據項目 Sama的差異化模式——擁有5000多名全職數據專家(而非臨時工)在肯尼亞和烏干達工作,其中女性佔比達50%——在2025年6月獲得重新認證為B企業,並取得了更高的影響力評分。隨著企業將負責任AI的採購要求寫入採購流程,Sama的完整員工可追溯性、嚴格的質量保證以及不斷發展的生成式AI評估實踐使其在2025年持續位列短名單之中。

2025年關鍵優勢:

  • 重新認證B企業:2025年6月獲得更高的影響力評分——獨立驗證的倫理標準

  • 基於團隊的模型:擁有5000多名專職數據專家,具備全流程可追溯性,而非匿名的零工人員。

  • 計算機視覺優勢:頂級圖像/視頻標註,且正在擴展生成式AI對齊工作

  • 影響力領導力:女性佔比50%,並有記錄的體面工資就業實踐

結論:行業良心——並在2025年日益成為採購要求


9. Nexdata

現成的多語言庫,現已擴展至多模態,總部位於中國(成立於2011年)

語言覆蓋範圍(2025年):通過超過100萬小時的語音數據和800TB的圖像/視頻數據,支持數百種語言。最佳應用場景:利用現成的多語言語音和多模態數據進行快速原型開發。到2025年,Nexdata持續強化其最核心資產——全球規模最大的預構建AI訓練數據庫,涵蓋超過100萬小時的各國語言變體語音數據以及800TB的圖像和視頻數據,由20,000多名專業標註員和AI輔助標註技術共同支持,實現標註效率提升30%以上。公司積極拓展語音語言模型、視覺語言模型(VLM)和具身AI所需的數據資源,這一戰略佈局使其在2026年有望登上重要學術會議的舞臺。

2025年關鍵優勢:

  • Colossal現成目錄:超過100萬小時的多語言語音數據;800TB的視覺數據。

  • AI輔助標註:專有平臺,標註效率提升30%以上。

  • 多模態擴展:2025年持續推進語音大語言模型(SpeechLLM)、視覺語言模型(VLM)和具身AI數據集的開發。

  • 靈活的合作模式:提供現成數據授權,以及定製化數據採集與整理服務。

結論:當多語言數據已存在時,2025年實現從創意到訓練運行最快路徑的首選方案。


10. Shaip

以合規為導向的多語言醫療AI數據,總部位於美國/印度,語言覆蓋範圍(2025年):涵蓋60多種語言的文本、音頻、圖像和視頻數據。最佳應用場景:醫療AI、對話式AI以及高度依賴去標識化處理的項目。Shaip在2025年始終牢牢把握其醫療AI數據細分領域。其多語言臨床音頻、醫療文本及醫生級標註數據,結合嚴格的數據去標識化和保護個人健康信息(PHI)的處理流程,使其在2025年各類分析中,始終被推薦為處理監管文件和隱私敏感多語言數據項目的核心供應商。

2025年關鍵優勢:

  • 醫療深度:臨床音頻、醫療文本和持證臨床醫生標註。

  • 去標識化專長:對受監管多語言數據進行嚴格的個人身份信息(PII)和健康信息(PHI)移除。

  • 合規導向的交付:專為類似HIPAA的監管環境設計。

  • 多模態服務:支持60多種語言的語音採集、轉錄和自然語言處理(NLP)標註。

結論:2025年多語言醫療與隱私關鍵AI數據的默認選擇。


一覽速覽對比(2025年)

  • 語言覆蓋最廣的服務商:LXT(收購Clickworker後覆蓋1,000多個語言區域)、TELUS Digital(500多種語言及方言)和Appen(235種以上)。

  • 最適合前沿大語言模型/RLHF工作的選擇:Surge AI(6月之後),Scale AI(6月之前,以及適用於Meta對齊或政府項目的工作)。

  • 最適合受監管行業的選擇:iMerit和Shaip(醫療領域),TELUS Digital(經過審計的企業項目)。

  • 最適合語音及低資源語言的:Defined.ai 和 Appen。

  • 最適合倫理採購的選擇:Sama(經重新認證的B Corp)和Defined.ai(擁有授權的市場平臺)。

  • 2025年最大看點:Meta與Scale的合作協議以及客戶流失事件,Surge AI的崛起,以及LXT完成與Clickworker的整合。

優秀提名 Toloka(位於阿姆斯特丹的眾包平臺,持續其2025年從微任務轉向專家大語言模型數據的轉型),Mercor(快速崛起的專家數據市場平臺,接棒Scale業務後發展起來),Centific(與NVIDIA合作的‘數據工廠’,2025年融資6000萬美元,專注於多語言、多模態數據),DATAmundi(Summa Linguae Technologies於2025年4月推出的新品牌),以及TransPerfect旗下CloudFactory、Cogito Tech和DataForce均提供了可信的多語言能力,僅略低於2025年前十名的門檻。

尾聲:2025年徹底改變了行業格局 2025年最終解決了行業多年以來的爭議:產品核心是信任,未來屬於專家。Meta與Scale的合作證明,中立性——而非團隊規模、工具或價格——是前沿實驗室客戶決策的關鍵變量。Surge AI的自啟動百億營收路徑證明,經過嚴格篩選的少數多語言專家群體,其產出能力遠超海量微任務人員。LXT的整合案例則表明,當地域覆蓋是核心目標時,市場整合是可行的。到年末,市場已清晰地分為兩個層級:專家數據層(Surge、Mercor及各類專家服務商)和規模數據層(Appen、TELUS Digital、LXT)——這一結構將定義2026年的市場格局。

參考文獻與來源 本文中的所有事實、數據和排名均來自以下來源,訪問時間為2026年8月:

  1. "2025年度十大人工數據提供商:深度全面解析(Meta與Scale合作細節、Surge AI 2024年12億美元營收、LXT與Clickworker時間線、TELUS Digital 2025年10月私有化)。" HeroHunt.ai. https://www.herohunt.ai/blog/top-10-human-data-providers-full-in-depth-review/ 2. "2026年Scale AI主要競爭對手分析:10家供應商對比(2025年6月Meta合作、谷歌約2億美元合同、客戶流失、14%裁員、Surge營收對比)。" 100signals. https://100signals.com/insights/scale-ai-competitors/ 3. "Meta加強AI部門投資Scale AI(估值290億美元,持股49%,王離開)。" Ars Technica,2025年6月。 https://arstechnica.com/ (via tagteam.harvard.edu/hub_feeds/3415/feed_items/14091720)

  2. "10大人工數據標註提供商(Meta於2025年4月終止與TELUS的內容審核合同;Surge AI擁有5萬名專家承包商;Sama B Corp於2025年6月重新認證,員工超5000人)." PIN-COM. https://pin-com.ghost.io/human-data-labeling-providers/ 5. "2026年度AI實驗室10大數據標註商基準(Meta合作後市場重新排序;Centific 2025年融資6000萬美元)." HeroHunt.ai. https://www.herohunt.ai/blog/top-10-data-annotators-for-ai-labs-2026-benchmark/ 6. "Scale AI競爭對手:Meta合作後數據市場格局演變(Surge AI前沿地位確立,Mercor專家數據崛起,中立性分析)." Teahose. https://www.teahose.com/guides/scale-ai-competitors 7. "Scale AI替代方案:標註與授權數據(中立性危機;谷歌與OpenAI減少依賴)." Troveo. https://www.troveo.ai/resources/scale-ai-alternatives 8. "最佳Appen替代方案(LXT-Clickworker整合已於2025年7月31日完成;覆蓋150多個國家,1000多個地區,700萬以上貢獻者;Appen財務數據)." AIMultiple. https://aimultiple.com/appen-alternatives 9. "最佳Amazon Mechanical Turk替代方案(LXT/Clickworker統一平臺數據;收購前約45種語言)." AIMultiple. https://aimultiple.com/amazon-mechanical-turk-alternatives 10. "最佳數據眾包平臺(DATAmundi/Summa Linguae品牌重塑於2025年4月發佈)." AIMultiple Research. https://research.aimultiple.com/telus-international/ 11. "TELUS公司2025年財報(TELUS Digital 2025年運營成果及企業行動)." U.S. SEC EDGAR. https://www.sec.gov/Archives/edgar/data/868675/000110465925108121/tm2525674d2_ex99-1.htm 12. "2024年AI報告中AI數據挑戰上升(Appen:貢獻者超100萬,支持235種以上語言)." Appen新聞稿. https://www.appen.com/press-release/state-of-ai-2024 13. "2025年度10大AI數據採集公司(2025年供應商格局:Lionbridge/TELUS多語言規模,Defined.ai,Centific公司概況)." SO Development. https://so-development.org/top-10-ai-data-collection-companies-in-2025/ 14. "10大多語言文本數據採集公司(用於NLP的供應商定位:Surge AI資深團隊,Shaip去標識化,LXT/iMerit廣度覆蓋)." SO Development, 2025年9月. https://so-development.org/top-10-multilingual-text-data-collection-companies-for-nlp/ 15. "最佳TELUS International在AI數據項目中的替代方案(LXT收購後貢獻者超600萬;TELUS Digital定位)." Twine博客. https://www.twine.net/blog/best-alternatives-to-telus-international/ 16. "最佳15家AI訓練數據採集公司(Appen、Nexdata、Sama、LXT公司概況;Nexdata語音數據超100萬小時,800TB視覺數據,標註員超20,000人)." Unidata. https://unidata.pro/blog/best-data-collection-companies-for-ai-training/ 17. "頂尖生成式AI訓練數據公司(Sama準確率超95%,B Corp認證;Scale AI擁有24萬名承包商;Defined.ai和Nexdata公司概況)." Nexus Expert Research. https://nexusexpertresearch.co/blog/top-generative-ai-training-data-companies/ 18. "TELUS International在IDC MarketScape數據標註供應商評估中被評為領導者(支持500多種語言和方言)." TELUS Digital新聞室. https://www.telusdigital.com/about/newsroom/telus-international-leader-idc-marketscape-data-labeling-vendor-assessment-2023 19. "最佳多語言語言數據提供商與公司(Nexdata成立及服務;Shaip服務)." Datarade. https://datarade.ai/data-categories/multilingual-language-data/providers 注意:此為基於2025年公司披露、同期報道及後續回顧分析於2026年8月編制的回顧性排名。統計數據反映的是2025年期間或圍繞該年份的報告數據,可能與當前實際數值存在差異。


常見問題

2025年6月,Meta以143億美元收購了Scale AI 49%的股份並聘請了其創始人。幾天後,谷歌——Scale的最大客戶,計劃在2025年投入約2億美元——與OpenAI和微軟開始將工作轉移至其他供應商,這徹底改變了整個供應商格局。

Surge AI。2024年收入在12億美元的初創公司,且規模上悄然超過Scale,當實驗室尋求一個不持有Meta股份的供應商時,它繼承了前沿實驗室的主導地位。

LXT於2025年1月完成收購,並於7月完成平臺整合,最終擁有超過700萬的貢獻者,覆蓋1000多個語言區域——成為排名中最廣泛的貢獻者網絡。

Appen,隨後是TELUS Digital和Surge AI,然後是Scale AI、LXT、iMerit、Defined.ai、Sama、Nexdata和Shaip。

TELUS於2025年10月將該子公司完全私有化。對買家而言,實際後果是供應商的公開財務披露將減少,許多企業依賴的供應商將不再有充分的公開信息。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊