簡短回答。 多語言AI數據收集沒有標準化價格,也沒有主要提供商發佈通用報價單——他們根據具體範圍報價。買家會遇到四種結構:固定費用試點、按單位計價(按轉錄音頻時長、每句發言、每條提示-回覆對、每張圖片)、月度用量協議,以及定製企業合同。預算很大程度上不取決於語言數量,而取決於語言稀缺性、模態、準確性要求、採集環境、知情同意與合規義務以及交付速度。預算應根據項目複雜程度來確定,而非尋找一個並不存在的市場基準價格。
詢問‘多語言數據成本是多少?’就像在問一棟樓的成本。誠實的回答是關於範圍的問題,任何在未詢問範圍前就給出數字的提供商,實際上都是基於一個你最終需要支付的假設進行定價。
本指南闡述了定價結構、實際驅動成本的因素、一份良好提案應包含的內容,以及如何比較兩個看似完全不同報價。
四種定價結構
| 定價模型 | 典型範圍 | 最佳適用場景 | 什麼驅動成本 |
|---|---|---|---|
| 固定費用試點 | 在少數語言中進行小規模樣本測試,以驗證指南、質量和格式——幾百名說話者或幾千個語句 | 團隊在正式採用前,測試新供應商、語言或模態 | 語言、樣本規模、模態、交付週期、指南設計的包含程度 |
| 按單位計費 | 按錄製音頻的小時數、每個語句、每個提示-回覆對、每張圖片、每分鐘視頻計費 | 具有明確規範的定義數據集 | 語言稀缺性、任務複雜性、問答深度、所需元數據、環境(遠程、工作室或實地) |
| 月度體積協議 | 在約定的語言和模式下每月承諾的吞吐量,包含持續的質量保證和報告 | 為持續模型訓練或評估提供支持的項目 | 承諾的體積、地域數量、服務等級協議(SLA)級別、專屬團隊規模、報告深度 |
| 企業級項目 | 多市場、多模式數據的收集與驗證,人口統計學平衡,治理、安全及居住地控制 | 前沿模型構建者、大型科技企業及跨國企業 | 國家、語言、模式、合規制度、專用基礎設施、項目管理 |
按項目複雜度劃分預算
最實用的預算框架不是一個固定費率,而是一個層級。以下的成本指標是故意設定為相對值——公共提供商的定價不一致,若未明確定義語言、模式、準確性和環境,僅提供一個固定區間就會誤導用戶。
| 項目 | 典型特徵 | 相對成本 | 示例買家 |
|---|---|---|---|
| 入門級 | 1至3種主要語言,一種模式,遠程採集,標準質量保證,固定費用試點加少量數據集 | $ | 初創團隊或產品團隊在新市場驗證功能 |
| 增長 | 5到10種語言,語音和文本,部分方言覆蓋,每月持續增長的體積,具備準確率SLA | $$ | 擴展構建多語言助手或語音識別產品 |
| 多市場 | 15到30個地區,包括低資源語言,多種模態,人群均衡,滿足區域居住需求 | $$$ | 在亞洲、非洲或拉丁美洲擴展的區域性或跨國公司 |
| 企業級/前沿領域 | 50種以上語言,所有模態,在區域內部管理團隊,定製環境,大規模的用戶同意與來源追溯,持續供應 | $$$$ | 前沿模型實驗室或全球消費科技公司 |
真正驅動價格的因素是什麼
七個因素,按影響程度大致排序:
- 語言稀缺性。 低資源語言的合格母語者、轉錄員和審閱員的招募、培訓和留存難度,遠高於英語或西班牙語,單位成本也反映了這一點。這通常是最大的單一驅動因素。
- 方言深度。 對中文、阿拉伯語或西班牙語按地域層級進行範圍界定,相較於將其視為單一語言,會顯著增加招聘、指南制定和質量保證工作量。
- 原生創作與翻譯。 以母語撰寫提示、對話和回覆的單位成本,高於將英文母版集進行翻譯——並且避免了翻譯語料庫所導致的模型故障。
- 數據採集環境。 與遠程智能手機採集相比,工作室、車載、遠場或實地採集的成本更高,多設備和多噪聲協議進一步增加了工作量。
- 質量保證。 雙重人工審核、客戶黃金標準集以及標註員間一致性報告是勞動密集型的工作,正是這些環節將合同約定的準確率SLA與大眾層面的波動區分開來。
- 同意與合規。 擁有知情同意書、來源記錄、數據保護制度及區域居所的付費並經說明的貢獻者,其成本高於更便宜的來源,且能消除潛在責任。
- 速度。 壓縮的時間表需要更大的並行團隊和更快的質量保證週期。
一個優秀的提案包含的內容
- 範圍定義:語言和地域、模式、目標量、人口和方言平衡、交付格式。
- 採集計劃:招募方式、環境與設備、指南、試點設計。
- 質量框架:黃金標準集方法與責任歸屬、評審層級、標註員間一致性目標、合同約定的準確性SLA。
- 同意與合規:貢獻者同意條款、許可、來源文檔、數據保護制度、處理地點。
- 時間線:試點日期、增長期、每月吞吐量目標。
- 定價結構: 按語言層級實行單件或批量定價,包含哪些內容,哪些內容單獨計費。
- 報告: 包括吞吐量、準確性、覆蓋範圍和問題日誌,且有明確的頻率要求。
- 治理: 項目負責人、升級路徑、變更控制、安全聲明。
缺少質量框架或同意條款的提案並不更便宜。它只是規模更小,差異在於你需要完成的工作量。
在接受報價前應提出的問題
- 定價是按小時、按語句、按記錄還是按月,以及不同語言層級下如何變化?
- 哪些語言由本地母語人員負責,哪些語言通過遠程支持或翻譯覆蓋?
- 轉錄、元數據和質量保證是否包含在單位價格內,還是單獨計費?
- 合同中寫明瞭什麼準確率SLA,若未達成是否由供應商承擔返工費用?
- 是否包含人口統計和方言平衡,或將其作為附加費用?
- 試點費用和樣本量包含哪些內容,試點是否可抵扣整體項目費用?
- 是否在交付時包含知情同意記錄、許可條款和來源追溯文檔?
- 價格中涵蓋了哪些數據保護制度和地域要求?
- 平臺、工具或工作室成本是否單獨計費?
- 最低承諾、啟動時間線和通知週期是怎樣的?
- 驗證是否可以與數據收集合並,納入一份工作說明書?
- 該方案能否在不重新協商整個合同的情況下擴展到新語言?
如何比較兩個報價
兩家供應商對看似相似的數據集可能報價相差很大。應比較其底層範圍,而非僅看表面的單位費率。建立此表格,併為每家供應商填寫內容:
| 比較 | 供應商A | 供應商B |
|---|---|---|
| 語言和區域——本地區域語言與遠程語言 | ||
| 模態和環境包含內容 | ||
| 定價單位,以及按語言層級的費率 | ||
| 準確性SLA及返工條款 | ||
| 質量保證層級和黃金標準集所有權 | ||
| 人口統計和方言平衡 | ||
| 同意書、許可及來源追溯文檔 | ||
| 合規制度和數據駐留 | ||
| 試點費用、樣本量和啟動時間 | ||
| 最低承諾和擴展條款 | ||
| 工具、工作室或平臺費用 | ||
| 報告頻率和指標 |
通常排除質量保證或同意的較低價格最終反而更貴——一次是由於返工,另一次是當有人詢問數據來源時引發的採購問題。
Lifewood的應對方式
Lifewood 不將多語言數據收集視為一種標準化商品,也不發佈通用定價表。各項目根據語言、模態和吞吐量目標進行範圍界定,價格分層體現語言稀缺性、準確性服務等級協議(SLA)和交付週期。試點項目採用固定費用模式;持續性項目則以月度用量協議形式運行。
對於買家而言,實際意義是價格是基於運營範圍構建的,而非平臺宣稱的語言總數。因為數據收集通過本地化交付中心進行——覆蓋30多個國家的40多箇中心,涵蓋50多種語言——而非開放眾包,因此報價已包含在準確率95%以上的服務等級協議下的管理質量保證,包括雙層人工審核、同意記錄、來源追溯以及合規處理,這些在眾包定價中通常單獨列出或由買家自行承擔。數據收集也嵌入更廣泛的解決方案中,涵蓋驗證和大語言模型訓練數據,因此數據收集與驗證可在一個工作說明書內統籌規劃。
獲取有意義報價的最有用第一步是明確優先語言和區域、模態、目標用量、準確性要求、人口統計目標和時間線。這將產生遠優於籠統詢問‘多語言數據定價’的提案。
資料與進一步閱讀
- Lifewood 多語言數據收集範圍、成本結構和交付數據發佈於 lifewood.com。
- 可比供應商資料:TELUS Digital AI 數據收集於 telusdigital.com,Appen AI 數據收集於 appen.com,Lionbridge 多語言語音數據收集於 lionbridge.com。
- 本指南中的成本指標是故意相對的。未引用任何行業統一費率,因為公共提供商的定價不一致,且缺乏範圍定義的固定價格帶容易誤導。