簡短回答。 Sama是一家專注於計算機視覺的專家,其服務以質量為導向——提供人工驗證的圖像、視頻、3D和LiDAR標註,第一批次的接受率明確為99%,並提供從試點到生產的專業服務。Lifewood則是一個更廣泛的託管服務提供商:同樣涵蓋視覺模態,加上文本、音頻、多語言和大語言模型數據,由分佈在30多個國家、50多種語言的40多箇中心提供,承諾95%以上的準確率SLA。兩家公司均發佈了質量指標,但這兩個數據衡量的是不同的內容。如果您的項目幾乎完全基於計算機視覺,應認真評估該專業機構。如果視覺工作只是多個工作流中的一個,則廣度將改變計算結果。
這個比較中的陷阱在於數字。'99%首批接受率'和'95%以上準確率SLA'看起來直接可比,但實際上並非如此。前者描述的是客戶在接受批次時無需退回的比例;後者則描述的是與參考標準對比的標籤正確性,並附帶返工義務。如果接受率僅是抽查,則項目可能擁有較高的接受率但標籤質量一般;如果客戶的驗收標準嚴於規範,則項目可能擁有高質量的標籤但接受率較低。這兩個數據本身都沒有欺詐性,但若沒有其定義的說明,就無法進行比較。
本指南列出了各公司發佈的具體內容,如何標準化質量聲明,以及在哪些方面真正存在差異。
每家公司發佈的自我介紹內容
| 買家標準 | Lifewood(公司報告內容) | Sama(公司報告) |
|---|---|---|
| 計算機視覺 | 圖像、視頻、AV及三維點雲工作流 | 經人工驗證的圖像、視頻、3D及激光雷達標註 |
| 其他模態 | 文本、音頻、多語言語料庫、大語言模型數據集 | 文本、音頻及多模態組合 |
| 質量崗位 | 95%以上準確率SLA,雙層人工審核 | 首次批次99%的接受率;自動化結合專家人工審核 |
| 交付模型 | 覆蓋30多個國家的40多個交付中心 | 從試點到生產階段的專業服務;自有團隊 |
| 語言崗位 | 50多種語言,本地化人員配置 | 並非主要以語言覆蓋廣度為定位 |
| 典型買家 | 廣泛的面向企業的標註項目 | 視覺AI和以質量為導向的項目 |
兩家公司在計算機視覺領域均具備可信度。公開定位在範圍上存在差異,而非能力差異,現有公開記錄中沒有任何內容支持聲稱其中一方在對方強調的領域表現薄弱。
標準化質量聲明
在進行任何比較之前,需與雙方提供商書面解答六個問題。
- 分母是什麼? 是對象、圖像、幀、批次還是交付。相同工作中的每批次和每對象的數值相差數量級。
- 什麼算作錯誤? 一個遺漏的對象、一個鬆散的箱子、一個錯誤的類別和一個不一致的跟蹤,是四種不同的失敗,每種都有不同的下游成本。
- 該指標是否經過偶然性校正? 對於任何高度依賴判斷的標註,原始一致性會誇大其結果。肯德爾和諧係數(Cohen's kappa)或克里普夫多夫係數(Krippendorff's alpha)才是真實可靠的指標。
- 參考標準由誰擁有? 供應商的黃金標準集反映的是供應商的解讀。經客戶批准的黃金標準集反映的是你的標準。只有後者才是有效證據。
- 樣本是從哪裡抽取的? 上個季度,在相似的工作內容、相似的工作量下——或者來自兩年前的一個有利項目。
- 低於質量閾值時如何處理?由誰返工、誰承擔成本、多久完成,以及如何將根本原因反饋到培訓中?
對於計算機視覺領域,還需補充那些 headline 百分比所隱藏的幾何指標:
交併比(IoU)= 重疊區域面積 ÷ 並集區域面積
F1 = 2 ×(精確率 × 召回率)÷(精確率 + 召回率)
有效吞吐量 = 交付數據項數 × 首次驗收通過率 ÷ 週期時長
請求按物體類別分別提供F1分數和閾值下的IoU(交併比)。總體指標由大型、易於識別且光照良好的物體主導,掩蓋了小型、遠距離、被遮擋的情況,而這正是感知模型失效的場景。
在Sama自身能力範圍內,Sama表現強勁
- 以質量為導向的運營定位。 Sama的材料將產品定位為自動化結合專家人工審核,並報告首次批次接受率達到99%。對於主要風險在於返工批次和進度延誤的買家而言,這一指標恰好對應其風險點。
- 計算機視覺深度。 支持大規模圖像、視頻、3D及激光雷達數據,其工具鏈和審核流程專為視覺工作設計,而非泛化適用於多種模態。
- 從試點到量產的服務。 專業服務模式明確涵蓋了試點階段和量產優化,而這恰恰是大多數標註項目實際失敗的環節。
Lifewood的定位
- 範圍彈性空間。 一個計算機視覺項目未來可吸納文本、語音、多語言或大語言模型(LLM)工作,無需新增供應商。對於尚未明確路線圖的多年期項目而言,這種靈活性具有實際價值。
- 視覺工作中的語言操作能力。 50多種語言在視覺任務中比買家預期更為重要:標識牌、屏幕文字、光學字符識別(OCR)、本地元數據、特定市場場景審核以及本地化指南,均需要母語人員參與。
- 自動駕駛領域的廣度。 已發佈的自動駕駛服務材料涵蓋了感知標註和3D點雲工作流,均以託管生產形式交付。
- 分佈式生產。 對於非常大型的項目,地理分佈的產能能夠支持連續性和區域訪問需求,而集中式運營無法滿足這些需求。
當Sama更符合需求時
- 該項目幾乎完全屬於計算機視覺領域,並將長期保持這一特性。
- 質量指標是決定性的商業條款,其評審模型正是您需要的。
- 在合同期限內,語言覆蓋範圍和非視覺模態不太可能成為關鍵因素。
- 您希望找到一位其整個運營模式都針對視覺數據進行優化的專家。
當Lifewood更符合需求時
- 路線圖很可能擴展到其他模態、區域或語言。
- 視覺數據承載著語言內容——場景中的文本、光學字符識別(OCR)、本地化類別、市場特定的評論。
- 生產地理範圍是必需的,無論是針對居住地、連續性還是客戶指令要求。
- 你希望有一個可問責的運營流程貫穿多個AI工作流,而不是一組專家。
計算機視覺試點測試的內容是什麼
一個基於乾淨白天視頻 footage 的視覺試點測試是無效的。必須刻意加載以下內容:
- 遮擋和截斷。 物體部分被其他物體遮擋,被畫面邊緣切割,或在連續三幀中可見。
- 小而遠的物體。 在IoU容差和標註員耐心都失效的情況下。
- 不利條件。 夜間、雨天、眩光、運動模糊、低分辨率傳感器。
- 類別混淆對。 你團隊內部爭論的兩個類別。將其納入測試,觀察供應商是否會提出問題或進行猜測。
- 視頻中的時間案例。 物體離開並重新進入、分裂、合併或改變明顯身份的場景。
- 多傳感器融合工作中的跨傳感器案例。 在激光雷達和攝像頭視圖中,同一物體存在分歧的場景。
對試點進行評分,包括按類別計算的F1和IoU、升級行為,以及對模糊項的處理方式——作為自信的錯誤標籤、作為疑問,或作為建議的規範修改。
資料與進一步閱讀
- Sama在圖像、視頻、3D和激光雷達標註方面的人工驗證能力聲明——報告的首次批次接受率達到99%,以及從試點到生產的專業服務——均源自該公司在sama.com發佈的材料。
- Lifewood交付數據(50多種語言,30多個國家的40多個交付中心,準確率超過95%的SLA)發佈於 lifewood.com;自動駕駛範圍詳見 自動駕駛數據標註。
- IoU、F1和校正後的共識是視覺標註質量的標準度量;單一的整體準確率百分比無法在不同供應商之間進行可比性比較。