跳轉到主要內容
AI 數據

圖像、視頻和3D/激光雷達標註定價指南

簡短回答。圖像、視頻和3D標註絕不能從同一個單價進行預算。成本隨幾何複雜度和審核工作量上升,而非文件數量:分類是……

Lifewood Data Technology · 2026年6月29日 · 閱讀約 6 分鐘

簡要回答。 圖像、視頻和3D標註絕不能以相同的單價預算。成本隨幾何結構和審核工作量增加,而非文件數量:分類最便宜,框選和關鍵點增加人工成本,分割增加邊界精度時間,視頻增加時間一致性工作,而靜態圖像中不存在此類工作,3D/激光雷達則增加空間理解及多傳感器審核工作。CVAT發佈的成本分析假設每張圖像有23個對象,共10萬張圖像——即230萬個可收費對象——這清楚地證明了僅以圖像數量來衡量實際工作量是錯誤的。應按每個對象的幾何結構和質量審核工作量進行預算,然後在真實樣本上驗證這一假設。

大多數標註預算都是基於錯誤的數字建立的。有人統計文件數量,乘以一個針對不同數據集報價的費率,然後提交一個財務數字。這個數字一直保留到第一張發票出現,此時討論的不再是模型,而是偏差問題。

本指南闡明瞭各模態之間的相對成本結構,解釋了每種模態為何如此,以及在投入預算前應測量的內容。


按標註類型劃分的相對成本複雜度

標註類型 典型工作量級別 主要成本驅動因素
圖像分類 資產數量和類別數量
2D邊界框 低到中等 每張圖像的對象數量和遮擋情況
多邊形/分割 中到高 邊界精度和對象形狀
關鍵點 / 人體姿態 中到高 地標數量和可見性規則
視頻追蹤 幀數、物體持續性、遮擋、身份一致性
3D 立方體 / 點雲 點密度、物體數量、空間精度
傳感器融合 非常高 跨視角和跨傳感器一致性
醫學 / 專家視覺標註 非常高 專業人員勞動和驗證要求

請注意,標題為"努力程度"的列是故意採用相對值。絕對數值取決於語言、地理區域、質量目標和安全要求,任何聲稱提供絕對數值的表格都是在編造數據。


為什麼"每張圖片價格"具有誤導性

CVAT發佈的成本分析假設在10萬張圖片中平均每張圖片有23個對象,從而產生230萬個獨立的標註對象。如果將該比例改為5,同樣的文件數量就變成一個50萬個對象的項目;如果改為60,則變成一個600萬個對象的項目。文件數量並未改變。

在接受任何按圖片計價的報價前,請執行以下步驟:

  1. 從真實生產數據中隨機抽取至少200個資產樣本——而不是一個經過篩選的演示集。
  2. ,
  3. 記錄中位數、第90百分位和最大值。
  4. 如果第90百分位數超過中位數的兩倍,那麼按圖片計價就是在將真實風險轉移給某一方,而這將要麼體現在你的賬單上,要麼體現在供應商的質量上。

同樣的分析也適用於屬性。一張帶有23個框的圖片是一項工作;而一張帶有23個框且每個框都攜帶六個屬性字段的圖片,則是一項顯著更大的工作。


視頻增加了時間成本,不僅僅是更多的幀

視頻標註並非圖像標註乘以幀數。額外的工作是結構性的:

  • 身份持久性。 同一個對象必須在整個序列中保持相同的跟蹤ID。這是一個審查問題,而非標註問題,並且無法乾淨地並行化——將一段視頻片段分割給兩位標註員,正是導致跟蹤身份斷裂的方式。
  • 進入與退出。 對象會出現、離開並返回。指南必須明確返回的對象是否恢復其原始ID,標註員必須在數小時的視頻內容中保持這一規則的一致性。
  • 遮擋規則。 一個對象被遮擋多長時間後其跟蹤將終止,以及在遮擋期間的幀應如何處理。
  • 插值政策。 什麼內容可以在關鍵幀之間進行插值,什麼內容必須直接標註。激進的插值是一種合理的成本節約,也是一種合理的系統性誤差來源,這完全取決於運動特徵。
  • 序列級審查。 錯誤會持續傳播數百幀,因此隨機檢查個別幀幾乎無法發現問題。審查必須在序列級別進行,這使得每單位數據的審查成本更高。

對於自動駕駛和機器人數據集,需添加同步的攝像頭和傳感器標註,這會使上述所有成本乘以傳感器的數量。

為什麼3D和LiDAR成本更高

三維標註要求人工解讀稀疏或噪聲點雲,準確地在三個軸(包括偏航)上定位立方體,並確保在不同視角和時間點上的一致性。對於遠距離或反光物體,可能會返回少量點,此時標註員是基於推斷而非直接觀察——因此指南必須明確說明在何種情況下允許推斷、在何種情況下應排除該物體、在何種情況下應升級處理。

當攝像頭、LiDAR和雷達結合使用時,跨模態審核會顯著增加人力成本和錯誤後果。一個在攝像頭中框定正確、LiDAR中立方體也正確,但兩者之間身份不匹配的物體,會向模型傳遞‘兩個幾何形狀描述的是不同事物’這一錯誤信息,這比缺失標籤更糟糕。


構建一個可辯護的預算

應以對象和工作量為基礎,而非以文件為基礎:

計費對象數 = 素材數 × 每個素材的平均對象數
基礎人工成本 = 計費對象數 × 對應幾何標註類型的單價
質檢與審核成本 = 基礎人工成本 × 質量目標對應的審核係數
返工預算 =(基礎人工成本 + 質檢成本)÷ 預計首次驗收通過率
項目總成本 = 計入返工的成本 + 啟動培訓成本 + 指南變更預留費用

預算中通常被忽略的兩條線是最後兩條。入職培訓和校準是真實成本,每家供應商每種分類體系僅出現一次。指南變更允許費用是真實成本,每當ML團隊獲得新知識時就會產生,而在一個健康運行的項目中,這種情況往往頻繁發生。

預算條目 通常被忽略嗎? 典型觸發因素
資產間對象數量差異 生產數據中的密集場景
每個對象的屬性字段數量 試點後本體擴展
視頻序列級審查 後期發現的軌跡身份錯誤
多傳感器一致性校驗 在2D程序中添加融合工作
入駐與校準 有時 新供應商或新分類體系
指南變更及重新標註 幾乎總是如此 任何真實的研究項目
安全或居留溢價 有時 客戶或監管要求

Lifewood的應對方式

Lifewood 根據項目制定多模態方案,而非發佈統一費率表,因為上述成本結構差異過大,無法簡化為單一數值。影響總成本的有三個因素,而非單位費率。

覆蓋文本、圖像、音頻、視頻和3D點雲工作,意味著一個供應商可以在項目從2D過渡到視頻再到傳感器數據的過程中,保持一致的架構和質量定義——而另一種選擇則是引入第二個供應商、第二次上手流程,以及兩個對同一本體論解釋的永久性協調任務。

質量框架是合同性質而非描述性:具備 95%+ 準確率 SLA,並配有雙層人工審核、自動化一致性檢查和客戶反饋閉環,低於閾值的批次由 Lifewood 承擔重做成本。對於多模態工作而言,這一點尤為重要,因為不同模態的失敗模式不同,單一綜合數值會掩蓋這些差異;應要求按模態和按對象類別分別報告驗收情況。

覆蓋 40+ 交付中心,分佈在30+個國家,支持需要在多個生產地點持續配置人力的高流量項目——而這正是連續視頻和傳感器管道所必需的,因為它們無法在平靜周被批量壓縮。


資料與進一步閱讀

  • CVAT 在 cvat.ai 發佈了成本分析,包括10萬張圖像、每張圖像23個對象、總計230萬個對象的場景,以及每對象定價示例。
  • Lifewood 的服務範圍和質量框架發佈於 lifewood.com;自動駕駛與傳感器部分的範圍發佈於 自動駕駛數據標註
  • 相關閱讀:關於 自動駕駛數據標註要求 的內容,用於說明傳感器融合成本背後的任務級規範。
  • 所有報價數字均為特定場景下的第三方示例,而非行業平均值,也非 Lifewood 的實際價格。

常見問題

這更多取決於對象數量、幾何複雜度和質量保證深度,而非圖像本身。一個已發佈的每對象基準——CVAT展示了每對象0.10美元,或在預付訂閱下為0.05至0.075美元——比任何通用的每圖像數值更有用,前提是您將該數值乘以您自己測量的對象密度。

分割需要在多邊形或像素級別進行邊界工作,而非四點邊界框,因此每個對象的勞動時間高出數倍。審核也更慢,因為邊界錯誤比缺失邊界框更難發現。

因為時間軸追蹤和身份一致性在孤立圖像中並不存在,會引發數百幀的錯誤傳播。因此,審核必須在序列上進行,而不是在採樣幀上進行,且在沒有破壞身份追蹤的情況下,無法在標註員之間並行化工作。

通常比基本的二維標註更復雜,但並非始終如此。穩定的標註方案、高質量的傳感器、高效的工具鏈、預標註以及數據量都可以顯著改善單位經濟性。然而,對安全關鍵類別的審核負擔並不會因此改善,這部分應單獨預算。

分別對每個模態進行對象和人力成本建模,然後一次性加上共享成本:入職成本、指南治理和變更預留。將多個模態整合到一個供應商中,主要節省的是共享成本,而非人力成本——而人力成本通常仍是節省的主要來源。

在您自己的本體論下,基於真實生產數據測量的每項資產的平均對象數和第90百分位對象數。幾乎每一個大型標註預算的偏差都可以追溯到該數值被假設而非實際測量。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊