跳轉到主要內容
AI 數據

自動駕駛數據標註要求

簡短回答。自動駕駛標註的評判標準是那些幾乎不會發生的場景。一個供應商若對普通白天高速公路幀標註達到 99% 準確率,卻在處理遮擋場景時出錯……

Lifewood Data Technology · 2026年6月24日 · 閱讀約 7 分鐘

簡短回答。 自動駕駛標註是基於幾乎不會發生的案例進行評判的。一個供應商將普通白天高速公路幀標註到99%準確率,但在黃昏時對遮擋行人處理不當,就交付了一個會訓練模型在最關鍵失敗場景下出錯的數據集。需要六項要求:特定任務的質量閾值(如立方體的IoU、跟蹤中的身份持久性,而非一個混合準確率數值),明確的邊緣案例和ODD覆蓋設計攝像頭、激光雷達和雷達之間的傳感器融合一致性序列間的時間一致性保留經過培訓的專業團隊而非開放眾包,以及可審計的來源追溯與數據本地化控制。每對象價格是談判中最不具信息量的數字。

感知數據是商業應用中最苛刻的標註類別。其幾何結構是三維的,標籤必須在時間上保持一致,多個傳感器必須達成一致,系統性錯誤的後果是安全問題,而非質量層面的問題。

本指南明確了企業買家應指定和驗證的內容。


工作實際包含的內容

任務 輸出 出錯的地方
2D邊界框 對象類別和圖像空間框 緊密貼合不一致;在幀邊緣截斷
點雲上的3D長方體 位置、尺寸、方向在三維空間中 遠距離或稀疏對象的朝向誤差
語義分割 每個像素的類別 邊界精度;模糊表面類別的問題
實例分割 每個對象的掩碼 重疊和遮擋的實例
車道和道路結構 多段線、拓撲結構、屬性 褪色標記;施工;車道合併與分離
交通標誌和信號 類別、狀態、相關性 哪個信號控制哪條車道;狀態在轉換期間的情況
跨幀追蹤 持久身份 身份在遮擋情況下切換
傳感器融合 不同攝像頭、激光雷達、雷達之間的標籤一致性 校準漂移;各模態間存在分歧
行為與意圖 主體狀態、預測動作 本質上是主觀的;需要最嚴格的指導方針

每種任務都有不同的失效模式,因此一個交付結果中的單一準確率幾乎毫無意義


1. 任務特定的質量閾值

在工作開始前,需為每個任務明確具體的指標和閾值

交併比(IoU)= 重疊區域面積 ÷ 並集區域面積
F1 = 2 ×(精確率 × 召回率)÷(精確率 + 召回率)
  • 立方體和框 —— 近距離和遠距離分別設定IoU閾值。遠距離物體在點雲中稀疏,單一全局閾值要麼過度懲罰遠距離,要麼低估近距離
  • 分割 —— 按類別計算平均IoU,而非整體平均值。稀有類別的表現才是關鍵;整體數值則被道路和天空類主導
  • 跟蹤 —— 在遮擋情況下的身份持續性,以及每個序列中的身份切換次數。這種度量無法逐幀進行,因此那些逐幀審計的供應商會完全遺漏這一點
  • 分類與屬性 —— 每個類別的F1值,以及混淆矩陣。哪些類別會相互混淆,比整體數值更具可操作性
  • 主觀任務 —— 獨立標註員之間經校正的共識度,因為在意圖和行為方面沒有黃金標準答案,只有可辯護的共識

詢問供應商在閾值以下做了什麼:以下——誰承擔重做費用,處理週期是多久,以及根本原因如何反饋到標註員培訓中,而不是被沉默地逐批修復

2. 極端情況與運營設計域覆蓋

規格中最重要且最常被隱含的部分。需明確定義運營設計域(ODD),並要求數據集針對該域進行分層,而非簡單地從已記錄內容中採樣:

  • 光照 —— 白天、黃昏、黎明、夜晚、傳感器直射低角度陽光、隧道入口和出口
  • 天氣 —— 雨天、噴霧、霧、雪、溼滑反光表面
  • 密度 —— 從空曠道路到密集城市交通
  • 主體 —— 包括兒童在內的行人、騎行者、摩托車、輪椅、動物、特殊車輛、攜帶或推動物體的人
  • 遮擋 —— 部分遮擋、嚴重遮擋以及完全遮擋後重新出現
  • 道路結構 —— 施工區域、臨時標記、未標記道路、複雜交叉路口、環形道路
  • 區域差異 — 標誌、標識、車輛類型和駕駛習慣因國家而異,一個在某一地區訓練的模型在其他地區會表現退化。
分層覆蓋率 = 該分層已標註的序列數 ÷ 該分層目標序列數

報告 最小值 而非平均值。平均值表明項目按計劃進行;最小值則指明模型將失效的條件。

3. 多模態一致性

當多個模態描述同一場景時,標籤必須一致。應在規範中明確三項檢查:

  • 跨模態身份一致性 — 相同物體在攝像頭和激光雷達中的身份必須一致。
  • 投影一致性 — 一個3D長方體投影到圖像平面上應落在對應物體上。該檢查易於自動化,且能可靠檢測校準漂移。
  • 分歧處理 — 當模態之間出現衝突時,應有明確定義的規則,而非標註員的臨時選擇。衝突是具有信息價值的,應被記錄,而不是被靜默解決。

4. 時間一致性

序列數據存在單幀審計無法發現的故障模式:身份在遮擋中切換、尺寸在幀間脈動、方向在對稱物體上翻轉180度,以及在關鍵幀之間插值的幀偏離現實。

要求進行序列級審查,並明確詢問插值是如何使用和驗證的。關鍵幀之間的插值是一種合理的效率手段,也是靜默錯誤的常見來源。

5. 標註團隊模型與人員留存

感知分類體系複雜,學習需要數週時間。開放眾包會反覆經歷這一學習曲線;而保留並培訓的團隊只需經歷一次。

要求提供在類似項目週期內標註員的留存情況,並說明團隊更替時質量如何變化。然後詢問安全關鍵類別的專家複核——誰來裁定模糊案例,以及‘我不確定’是否有明確的升級路徑。缺乏這一路徑的項目會產生自信的錯誤標籤,這類錯誤比空白更危險,因為它們通過了驗收檢查。

6. 來源追溯、地域歸屬與安全

駕駛數據記錄於公共空間,通常包含人臉和車牌信息。

  • 地域歸屬 — 工作能否被限制在某個特定司法管轄區或設施內?記錄於公共空間的數據通常無法跨越某些邊界。
  • 隱私處理 — 人臉和車牌的模糊處理在哪個階段進行,原始數據是否保留以及在何種控制下保留。
  • 訪問模型 — 最小權限原則、權限撤銷、審計日誌;在必要時實施物理控制,包括安全房間和禁止使用可移動介質。
  • 每項數據的來源追溯 — 由誰標註,由誰複核,依據的是哪個版本的規範。
  • 認證 — 要求提供證書及其範圍說明,而非僅提供標誌。範圍通常才是失敗之處:一份覆蓋總部的認證,通常無法說明交付中心實際工作的情況。

如何運行試點

一份提案無法展示上述任何一項內容。一個付費的試點可在大約三週內完成。

有意識地構建試點數據集: 大部分為常規序列,加上刻意設置的少數困難序列——夜間雨天、嚴重遮擋、施工區、特殊人物、一個包含長時間完全遮擋後重新出現的序列。至少包含一個你已內部標註並信任的標準序列,並且不要告訴供應商是哪一個。

評分標準: 各任務指標是否達到你的閾值;在遮擋序列中身份切換情況;各模態間的投影一致性;稀有類別的每類F1得分;模糊案例的升級與記錄情況;以及供應商提出的問題——供應商在第一週就提出尖銳問題,說明其已正確理解分類體系。


Lifewood的應對方式

Lifewood 提供感知標註——包括自動駕駛和醫學影像中的 2D 和 3D 邊界框、語義分割以及關鍵點標註——通過自有交付中心的管理團隊而非開放眾包,這種模式適用於複雜分類體系,其中學習曲線即為成本。

該類別有兩個結構性要點。在 40 多個地點、30 多個國家 範圍內的自有交付中心,使其能夠將處理工作限制在特定司法管轄區,而這正是公開駕駛數據通常所要求的。同時,覆蓋亞洲、歐洲、北美和非洲的區域佈局,意味著數據可以由熟悉當地標誌、標記和駕駛慣例的人進行標註,而非通過推斷來完成。汽車與視覺領域的合作涵蓋 AI 計算供應商、自動駕駛移動性開發者以及計算機視覺供應商。

參見 自動駕駛標註AI數據服務AI數據驗證質量保證流程邊緣智能


資料與進一步閱讀

常見問題

應採用任務特定的閾值而非綜合準確率:對立方體的近距和遠距分別設定 IoU 閾值,各類別的分割平均 IoU,跟蹤序列中的身份切換次數,分類任務的每類 F1 指標結合混淆矩陣,以及主觀任務(如意圖判斷)的校正一致性指標。然後,明確低於閾值工作的重做政策。

因為模型在它見過最少的條件下會失敗。一百萬張普通的白天高速公路幀無法教會模型處理低陽光下部分遮擋的行人。覆蓋範圍應設計為對操作設計域的分層,並以各分層的最小覆蓋作為報告指標,而非平均值。

一致性——跨模態和跨時間。物體在攝像頭和激光雷達中必須保持同一身份,立方體必須正確投影到圖像平面,身份在遮擋情況下必須持續存在而不會切換。這些失敗在單幀審核中是不可見的,因此序列級審核是必要要求,而非可選升級。

幾乎在所有情況下都應採用管理團隊。感知分類體系需要數週時間學習,而開放眾包會反覆支付這一學習成本。在類似項目中,人員留存率比宣傳的吞吐量更能預測交付質量。

假設視頻中包含人臉和車牌,因為其是在公共區域錄製的。明確數據的存儲和處理位置,是否可以限制在特定司法管轄區,模糊處理在哪個階段應用,原始數據是否保留以及在何種控制下,以及哪些子處理方接觸數據。要求提供帶有範圍說明的證書,而非僅提供標誌。

對於複雜分類體系,預期需要數週的爬坡期——在此期間吞吐量存在但一致性尚未穩定。要求提供類似項目的爬坡曲線,並將聲稱從第一天就達到完全質量的供應商視為尚未運行過複雜分類體系的供應商。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊