簡短回答。 自動駕駛標註是基於幾乎不會發生的案例進行評判的。一個供應商將普通白天高速公路幀標註到99%準確率,但在黃昏時對遮擋行人處理不當,就交付了一個會訓練模型在最關鍵失敗場景下出錯的數據集。需要六項要求:特定任務的質量閾值(如立方體的IoU、跟蹤中的身份持久性,而非一個混合準確率數值),明確的邊緣案例和ODD覆蓋設計,攝像頭、激光雷達和雷達之間的傳感器融合一致性,序列間的時間一致性,保留經過培訓的專業團隊而非開放眾包,以及可審計的來源追溯與數據本地化控制。每對象價格是談判中最不具信息量的數字。
感知數據是商業應用中最苛刻的標註類別。其幾何結構是三維的,標籤必須在時間上保持一致,多個傳感器必須達成一致,系統性錯誤的後果是安全問題,而非質量層面的問題。
本指南明確了企業買家應指定和驗證的內容。
工作實際包含的內容
| 任務 | 輸出 | 出錯的地方 |
|---|---|---|
| 2D邊界框 | 對象類別和圖像空間框 | 緊密貼合不一致;在幀邊緣截斷 |
| 點雲上的3D長方體 | 位置、尺寸、方向在三維空間中 | 遠距離或稀疏對象的朝向誤差 |
| 語義分割 | 每個像素的類別 | 邊界精度;模糊表面類別的問題 |
| 實例分割 | 每個對象的掩碼 | 重疊和遮擋的實例 |
| 車道和道路結構 | 多段線、拓撲結構、屬性 | 褪色標記;施工;車道合併與分離 |
| 交通標誌和信號 | 類別、狀態、相關性 | 哪個信號控制哪條車道;狀態在轉換期間的情況 |
| 跨幀追蹤 | 持久身份 | 身份在遮擋情況下切換 |
| 傳感器融合 | 不同攝像頭、激光雷達、雷達之間的標籤一致性 | 校準漂移;各模態間存在分歧 |
| 行為與意圖 | 主體狀態、預測動作 | 本質上是主觀的;需要最嚴格的指導方針 |
每種任務都有不同的失效模式,因此一個交付結果中的單一準確率幾乎毫無意義
1. 任務特定的質量閾值
在工作開始前,需為每個任務明確具體的指標和閾值
交併比(IoU)= 重疊區域面積 ÷ 並集區域面積
F1 = 2 ×(精確率 × 召回率)÷(精確率 + 召回率)
- 立方體和框 —— 近距離和遠距離分別設定IoU閾值。遠距離物體在點雲中稀疏,單一全局閾值要麼過度懲罰遠距離,要麼低估近距離
- 分割 —— 按類別計算平均IoU,而非整體平均值。稀有類別的表現才是關鍵;整體數值則被道路和天空類主導
- 跟蹤 —— 在遮擋情況下的身份持續性,以及每個序列中的身份切換次數。這種度量無法逐幀進行,因此那些逐幀審計的供應商會完全遺漏這一點
- 分類與屬性 —— 每個類別的F1值,以及混淆矩陣。哪些類別會相互混淆,比整體數值更具可操作性
- 主觀任務 —— 獨立標註員之間經校正的共識度,因為在意圖和行為方面沒有黃金標準答案,只有可辯護的共識
詢問供應商在閾值以下做了什麼:以下——誰承擔重做費用,處理週期是多久,以及根本原因如何反饋到標註員培訓中,而不是被沉默地逐批修復
2. 極端情況與運營設計域覆蓋
規格中最重要且最常被隱含的部分。需明確定義運營設計域(ODD),並要求數據集針對該域進行分層,而非簡單地從已記錄內容中採樣:
- 光照 —— 白天、黃昏、黎明、夜晚、傳感器直射低角度陽光、隧道入口和出口
- 天氣 —— 雨天、噴霧、霧、雪、溼滑反光表面
- 密度 —— 從空曠道路到密集城市交通
- 主體 —— 包括兒童在內的行人、騎行者、摩托車、輪椅、動物、特殊車輛、攜帶或推動物體的人
- 遮擋 —— 部分遮擋、嚴重遮擋以及完全遮擋後重新出現
- 道路結構 —— 施工區域、臨時標記、未標記道路、複雜交叉路口、環形道路
- 區域差異 — 標誌、標識、車輛類型和駕駛習慣因國家而異,一個在某一地區訓練的模型在其他地區會表現退化。
分層覆蓋率 = 該分層已標註的序列數 ÷ 該分層目標序列數
報告 最小值 而非平均值。平均值表明項目按計劃進行;最小值則指明模型將失效的條件。
3. 多模態一致性
當多個模態描述同一場景時,標籤必須一致。應在規範中明確三項檢查:
- 跨模態身份一致性 — 相同物體在攝像頭和激光雷達中的身份必須一致。
- 投影一致性 — 一個3D長方體投影到圖像平面上應落在對應物體上。該檢查易於自動化,且能可靠檢測校準漂移。
- 分歧處理 — 當模態之間出現衝突時,應有明確定義的規則,而非標註員的臨時選擇。衝突是具有信息價值的,應被記錄,而不是被靜默解決。
4. 時間一致性
序列數據存在單幀審計無法發現的故障模式:身份在遮擋中切換、尺寸在幀間脈動、方向在對稱物體上翻轉180度,以及在關鍵幀之間插值的幀偏離現實。
要求進行序列級審查,並明確詢問插值是如何使用和驗證的。關鍵幀之間的插值是一種合理的效率手段,也是靜默錯誤的常見來源。
5. 標註團隊模型與人員留存
感知分類體系複雜,學習需要數週時間。開放眾包會反覆經歷這一學習曲線;而保留並培訓的團隊只需經歷一次。
要求提供在類似項目週期內標註員的留存情況,並說明團隊更替時質量如何變化。然後詢問安全關鍵類別的專家複核——誰來裁定模糊案例,以及‘我不確定’是否有明確的升級路徑。缺乏這一路徑的項目會產生自信的錯誤標籤,這類錯誤比空白更危險,因為它們通過了驗收檢查。
6. 來源追溯、地域歸屬與安全
駕駛數據記錄於公共空間,通常包含人臉和車牌信息。
- 地域歸屬 — 工作能否被限制在某個特定司法管轄區或設施內?記錄於公共空間的數據通常無法跨越某些邊界。
- 隱私處理 — 人臉和車牌的模糊處理在哪個階段進行,原始數據是否保留以及在何種控制下保留。
- 訪問模型 — 最小權限原則、權限撤銷、審計日誌;在必要時實施物理控制,包括安全房間和禁止使用可移動介質。
- 每項數據的來源追溯 — 由誰標註,由誰複核,依據的是哪個版本的規範。
- 認證 — 要求提供證書及其範圍說明,而非僅提供標誌。範圍通常才是失敗之處:一份覆蓋總部的認證,通常無法說明交付中心實際工作的情況。
如何運行試點
一份提案無法展示上述任何一項內容。一個付費的試點可在大約三週內完成。
有意識地構建試點數據集: 大部分為常規序列,加上刻意設置的少數困難序列——夜間雨天、嚴重遮擋、施工區、特殊人物、一個包含長時間完全遮擋後重新出現的序列。至少包含一個你已內部標註並信任的標準序列,並且不要告訴供應商是哪一個。
評分標準: 各任務指標是否達到你的閾值;在遮擋序列中身份切換情況;各模態間的投影一致性;稀有類別的每類F1得分;模糊案例的升級與記錄情況;以及供應商提出的問題——供應商在第一週就提出尖銳問題,說明其已正確理解分類體系。
Lifewood的應對方式
Lifewood 提供感知標註——包括自動駕駛和醫學影像中的 2D 和 3D 邊界框、語義分割以及關鍵點標註——通過自有交付中心的管理團隊而非開放眾包,這種模式適用於複雜分類體系,其中學習曲線即為成本。
該類別有兩個結構性要點。在 40 多個地點、30 多個國家 範圍內的自有交付中心,使其能夠將處理工作限制在特定司法管轄區,而這正是公開駕駛數據通常所要求的。同時,覆蓋亞洲、歐洲、北美和非洲的區域佈局,意味著數據可以由熟悉當地標誌、標記和駕駛慣例的人進行標註,而非通過推斷來完成。汽車與視覺領域的合作涵蓋 AI 計算供應商、自動駕駛移動性開發者以及計算機視覺供應商。
參見 自動駕駛標註,AI數據服務,AI數據驗證,質量保證流程 和 邊緣智能。
資料與進一步閱讀
- 配套指南:選擇 AI 標註服務的 9 項標準——本特別專題所側重的跨模態供應商評估框架。
- Lifewood 的感知標註範圍發佈於 lifewood.com/autonomous-driving-annotation。