簡短回答。 真正的區別在於工作團隊模式,而非語言數量。Appen的公開定位基於一個非常龐大的分佈式眾包團隊加上專家貢獻者網絡,其企業級標註服務覆蓋80多種語言,多語言語音支持覆蓋500多個地區,並明確指出在STEM、法律、醫學和金融領域擁有專家團隊的RLHF專長。Lifewood則基於其自有交付中心的管理型團隊——支持50多種語言,覆蓋30多個國家的40多箇中心,準確率SLA超過95%,並設有雙層人工複核機制。眾包模式為你帶來覆蓋面和彈性,而中心模式則為你帶來留存和控制力。在你比較任何其他內容之前,先決定你的項目缺少的是哪一種模式。
兩家公司均出現在大多數企業級大規模數據標註的推薦名單上,且在處理大量數據方面都具備可信度。但這種比較通常基於錯誤的維度進行。買家會將語言數量進行對比,發現一個數字更大,便認為問題已經解決。這並不成立,因為支持的語言數量和實際配置的語言能力是兩種不同的衡量標準,而支撐該數字的運營模式,會直接影響你項目在第九個月的表現。
本指南詳細說明了每家公司發佈的相關信息、工作團隊模式的實際成本與收益,以及在簽署協議前如何進行測試。
每家公司發佈的自我介紹內容
| 買家標準 | Lifewood(公司報告內容) | Appen(公司報告) |
|---|---|---|
| 交付模型 | 管理區域交付中心 | 龐大的全球眾包加專家網絡 |
| 覆蓋範圍 | 在30多個國家設有40多箇中心 | 分佈於眾多國家的貢獻者基礎 |
| 語言 | 50多種語言,本地化人員配置 | 為企業標註提供80多種語言;多語種語音覆蓋500多個地區 |
| 模態 | 文本、圖像、音頻、視頻、3D點雲 | 文本、圖像、音頻、視頻、地理空間 |
| 專家強化學習與人類反饋 | 帶有人工評審的大型語言模型數據集 | 跨科學、法律、醫學、金融領域的專家強化學習與人類反饋來源 |
| 質量崗位 | 95%以上準確率的服務級別協議,雙層人工質量審核 | 眾包與專家質量工具 |
| 典型買家 | 專屬團隊外包 | 採購廣度與專家訪問能力 |
Appen公開宣稱其語言覆蓋更廣。這是其發佈材料中的事實,應如實記錄,而非爭論。但它並未告訴你的是:針對你路線圖中的二十種具體語言,在市場中、在你所需規模下、下個季度可獲得多少經過審核的母語者。兩家公司公佈的 headline 數字都無法回答這個問題;只有逐語言提問才能回答。
Appen自身的優勢領域
Appen的公開材料描述了交付中心模式無法自然產生的三項內容:
- 貢獻者多樣性。 一個覆蓋眾多國家和地區的廣泛分佈式群體,能夠比中心網絡更快地覆蓋長尾語言和人群。對於覆蓋一百個地區、輕度採集的項目而言,這是結構性優勢。
- 專家來源。 Appen 特別為 RLHF 工作招募了 STEM、法律、醫學和金融領域的領域專家。招聘擁有高級學位的標註員是一項獨特的招聘能力,而不是簡單地培訓現有員工。
- 物理世界 AI 工作。 Appen 已發佈涉及機器人領域的以自我為中心視頻標註和評估的案例材料,這是當前且技術要求較高的領域。
在群體模型方面,行業文獻普遍指出其表現較弱,而非特定於某一家供應商:流失率較高,對判斷類任務的標註員間一致性更為不穩定,且每個複雜分類體系都存在學習曲線,而輪換式團隊會反覆支付這一成本。這種現象是否適用於您的項目,完全取決於您分類體系的複雜程度。對於簡單、高產量、低歧義的工作,通常並不重要。
Lifewood的定位
Lifewood 的模型是圍繞相反的權衡設計的:一名經過培訓的標註員在一個項目上持續工作十八個月,只需支付一次分類體系的學習成本。
- 以團隊形式而非池子形式提供。 需要專職運營團隊、明確升級路徑和評審人員連續性的買家,會獲得與需要彈性容量的買家完全不同的產品。
- 同一項目中包含 3D 和物理世界數據。 服務組合明確包括 3D 點雲標註,與文本、圖像、音頻和視頻並列,因此一個視覺項目可以無需引入新供應商即可擴展。
- 區域執行作為控制點。 中心網絡為採購方提供了遠程群體無法提供的實物工作地點,而這正是數據本地化和受限訪問要求最終所指向的內容。
- 合同質量。 明確的 95% 以上準確率 SLA 加上定義的返工條款,將質量討論轉化為商業條款,而這正是其應有的位置。
相應的限制,明確說明:在短時間內完成輕量級任務時,中心網絡是更慢的路徑。
最終決定它的測量指標
兩家公司的語言數量都無法告訴你你需要什麼。請直接詢問這兩點,並比較回答內容而非營銷信息:
對於每個涵蓋的語言,你們有多少位標註員?他們是否在目標市場?過去十二個月的留存率是多少?他們在類似我們任務上的標註員間一致性如何?
一個僅回答支持語言數量的供應商,實際上回答了另一個問題。一個按語言、並包含地域和留存率回答的供應商,才告訴你具有預測性的信息。
對於語音工作,特別要加上方言。一個僅以河內為基礎的‘越南語’能力,並不能代表通用的越南語覆蓋,由此生成的模型在南部地區將表現不佳。
Appen 是更好的選擇的情況
- 你需要在眾多國家和地區快速獲得最廣泛的標註員來源。
- 該項目嚴重依賴於你無法自行招募的高級學位領域專家。
- 以用戶為中心的運營模式適合你的任務:標準化、高吞吐量、低歧義、可容忍差異。
- 此次合作是一次性數據收集,而非長期的持續生產項目。
當Lifewood更符合需求時
- 分類體系複雜到足以使標註員的留存顯著影響質量。
- 該項目涵蓋多種模態,你希望在所有模態上擁有一個統一的可問責運營體系。
- 數據敏感性要求在受控的物理環境或特定的處理地理區域中進行處理。
- 語言覆蓋範圍必須在市場中實際存在並配備人員,而非僅在列表中列出。
合同中應明確包含的條款
工作模式發生變化時,哪些風險需要在合同中設定條款
| 風險 | 在眾包模式下 | 在中心化模式下 |
|---|---|---|
| 質量漂移 | 每週跟蹤標註員間的共識度,而非在續約時 | 跟蹤優先語言的審核員連續性 |
| 需求波動 | 確認當團隊規模擴大時質量保持穩定,而不僅僅是處理能力 | 確認達到全量質量標準所需的時間,而非達到全團隊規模所需的時間 |
| 長尾語言 | 在簽署前需明確各語言的審核員數量要求 | 需明確尚未覆蓋語言的獲取方法 |
| 指南變更 | 需對整個團隊進行重新校準 | 需提供版本化的指南和可追溯的重新校準記錄 |
| 退出 | 需要導出黃金標準集和指南 | 需要同樣的內容,再加上刪除確認 |
資料與進一步閱讀
- Appen的能力聲明——為企業標註提供80多種語言支持,涵蓋500多個語種的多語言語音,覆蓋科學、法律、醫學和金融領域的專家RLHF資源,以及已發表的物理-人工智能案例材料——均源自公司自身材料,詳見appen.com。
- Lifewood的交付數據(50多種語言,覆蓋30多個國家的40多個交付中心,準確率SLA超過95%)發佈於 lifewood.com;服務範圍詳見 AI數據服務。
- 對於任何涉及判斷的任務,應使用校正機會的一致性度量(如Cohen's kappa、Krippendorff's alpha);原始的一致性百分比在不同供應商之間不可比。