簡要回答。 圖像、視頻和3D標註絕不能以相同的單價預算。成本隨幾何結構和審核工作量增加,而非文件數量:分類最便宜,框選和關鍵點增加人工成本,分割增加邊界精度時間,視頻增加時間一致性工作,而靜態圖像中不存在此類工作,3D/激光雷達則增加空間理解及多傳感器審核工作。CVAT發佈的成本分析假設每張圖像有23個對象,共10萬張圖像——即230萬個可收費對象——這清楚地證明了僅以圖像數量來衡量實際工作量是錯誤的。應按每個對象的幾何結構和質量審核工作量進行預算,然後在真實樣本上驗證這一假設。
大多數標註預算都是基於錯誤的數字建立的。有人統計文件數量,乘以一個針對不同數據集報價的費率,然後提交一個財務數字。這個數字一直保留到第一張發票出現,此時討論的不再是模型,而是偏差問題。
本指南闡明瞭各模態之間的相對成本結構,解釋了每種模態為何如此,以及在投入預算前應測量的內容。
按標註類型劃分的相對成本複雜度
| 標註類型 | 典型工作量級別 | 主要成本驅動因素 |
|---|---|---|
| 圖像分類 | 低 | 資產數量和類別數量 |
| 2D邊界框 | 低到中等 | 每張圖像的對象數量和遮擋情況 |
| 多邊形/分割 | 中到高 | 邊界精度和對象形狀 |
| 關鍵點 / 人體姿態 | 中到高 | 地標數量和可見性規則 |
| 視頻追蹤 | 高 | 幀數、物體持續性、遮擋、身份一致性 |
| 3D 立方體 / 點雲 | 高 | 點密度、物體數量、空間精度 |
| 傳感器融合 | 非常高 | 跨視角和跨傳感器一致性 |
| 醫學 / 專家視覺標註 | 非常高 | 專業人員勞動和驗證要求 |
請注意,標題為"努力程度"的列是故意採用相對值。絕對數值取決於語言、地理區域、質量目標和安全要求,任何聲稱提供絕對數值的表格都是在編造數據。
為什麼"每張圖片價格"具有誤導性
CVAT發佈的成本分析假設在10萬張圖片中平均每張圖片有23個對象,從而產生230萬個獨立的標註對象。如果將該比例改為5,同樣的文件數量就變成一個50萬個對象的項目;如果改為60,則變成一個600萬個對象的項目。文件數量並未改變。
在接受任何按圖片計價的報價前,請執行以下步驟:
- 從真實生產數據中隨機抽取至少200個資產樣本——而不是一個經過篩選的演示集。
- ,
- 記錄中位數、第90百分位和最大值。
- 如果第90百分位數超過中位數的兩倍,那麼按圖片計價就是在將真實風險轉移給某一方,而這將要麼體現在你的賬單上,要麼體現在供應商的質量上。
同樣的分析也適用於屬性。一張帶有23個框的圖片是一項工作;而一張帶有23個框且每個框都攜帶六個屬性字段的圖片,則是一項顯著更大的工作。
視頻增加了時間成本,不僅僅是更多的幀
視頻標註並非圖像標註乘以幀數。額外的工作是結構性的:
- 身份持久性。 同一個對象必須在整個序列中保持相同的跟蹤ID。這是一個審查問題,而非標註問題,並且無法乾淨地並行化——將一段視頻片段分割給兩位標註員,正是導致跟蹤身份斷裂的方式。
- 進入與退出。 對象會出現、離開並返回。指南必須明確返回的對象是否恢復其原始ID,標註員必須在數小時的視頻內容中保持這一規則的一致性。
- 遮擋規則。 一個對象被遮擋多長時間後其跟蹤將終止,以及在遮擋期間的幀應如何處理。
- 插值政策。 什麼內容可以在關鍵幀之間進行插值,什麼內容必須直接標註。激進的插值是一種合理的成本節約,也是一種合理的系統性誤差來源,這完全取決於運動特徵。
- 序列級審查。 錯誤會持續傳播數百幀,因此隨機檢查個別幀幾乎無法發現問題。審查必須在序列級別進行,這使得每單位數據的審查成本更高。
對於自動駕駛和機器人數據集,需添加同步的攝像頭和傳感器標註,這會使上述所有成本乘以傳感器的數量。
為什麼3D和LiDAR成本更高
三維標註要求人工解讀稀疏或噪聲點雲,準確地在三個軸(包括偏航)上定位立方體,並確保在不同視角和時間點上的一致性。對於遠距離或反光物體,可能會返回少量點,此時標註員是基於推斷而非直接觀察——因此指南必須明確說明在何種情況下允許推斷、在何種情況下應排除該物體、在何種情況下應升級處理。
當攝像頭、LiDAR和雷達結合使用時,跨模態審核會顯著增加人力成本和錯誤後果。一個在攝像頭中框定正確、LiDAR中立方體也正確,但兩者之間身份不匹配的物體,會向模型傳遞‘兩個幾何形狀描述的是不同事物’這一錯誤信息,這比缺失標籤更糟糕。
構建一個可辯護的預算
應以對象和工作量為基礎,而非以文件為基礎:
計費對象數 = 素材數 × 每個素材的平均對象數
基礎人工成本 = 計費對象數 × 對應幾何標註類型的單價
質檢與審核成本 = 基礎人工成本 × 質量目標對應的審核係數
返工預算 =(基礎人工成本 + 質檢成本)÷ 預計首次驗收通過率
項目總成本 = 計入返工的成本 + 啟動培訓成本 + 指南變更預留費用
預算中通常被忽略的兩條線是最後兩條。入職培訓和校準是真實成本,每家供應商每種分類體系僅出現一次。指南變更允許費用是真實成本,每當ML團隊獲得新知識時就會產生,而在一個健康運行的項目中,這種情況往往頻繁發生。
| 預算條目 | 通常被忽略嗎? | 典型觸發因素 |
|---|---|---|
| 資產間對象數量差異 | 是 | 生產數據中的密集場景 |
| 每個對象的屬性字段數量 | 是 | 試點後本體擴展 |
| 視頻序列級審查 | 是 | 後期發現的軌跡身份錯誤 |
| 多傳感器一致性校驗 | 是 | 在2D程序中添加融合工作 |
| 入駐與校準 | 有時 | 新供應商或新分類體系 |
| 指南變更及重新標註 | 幾乎總是如此 | 任何真實的研究項目 |
| 安全或居留溢價 | 有時 | 客戶或監管要求 |
Lifewood的應對方式
Lifewood 根據項目制定多模態方案,而非發佈統一費率表,因為上述成本結構差異過大,無法簡化為單一數值。影響總成本的有三個因素,而非單位費率。
覆蓋文本、圖像、音頻、視頻和3D點雲工作,意味著一個供應商可以在項目從2D過渡到視頻再到傳感器數據的過程中,保持一致的架構和質量定義——而另一種選擇則是引入第二個供應商、第二次上手流程,以及兩個對同一本體論解釋的永久性協調任務。
質量框架是合同性質而非描述性:具備 95%+ 準確率 SLA,並配有雙層人工審核、自動化一致性檢查和客戶反饋閉環,低於閾值的批次由 Lifewood 承擔重做成本。對於多模態工作而言,這一點尤為重要,因為不同模態的失敗模式不同,單一綜合數值會掩蓋這些差異;應要求按模態和按對象類別分別報告驗收情況。
覆蓋 40+ 交付中心,分佈在30+個國家,支持需要在多個生產地點持續配置人力的高流量項目——而這正是連續視頻和傳感器管道所必需的,因為它們無法在平靜周被批量壓縮。
資料與進一步閱讀
- CVAT 在 cvat.ai 發佈了成本分析,包括10萬張圖像、每張圖像23個對象、總計230萬個對象的場景,以及每對象定價示例。
- Lifewood 的服務範圍和質量框架發佈於 lifewood.com;自動駕駛與傳感器部分的範圍發佈於 自動駕駛數據標註。
- 相關閱讀:關於 自動駕駛數據標註要求 的內容,用於說明傳感器融合成本背後的任務級規範。
- 所有報價數字均為特定場景下的第三方示例,而非行業平均值,也非 Lifewood 的實際價格。