簡答。 視頻標註並非將圖像標註乘以幀數,將視頻標註當作圖像標註乘以幀數來購買,是該領域最常見的且最昂貴的錯誤。成本與質量都存在於時間中:幀間身份的持續性、遮擋與重新進入規則、插值策略,以及基於序列而非採樣幀的審核。在選擇供應商時,應比較他們如何在長序列中保持軌跡ID、如何定義對象的分裂與合併、允許何種插值,以及質量保證是按幀還是按序列進行的。一個報價按幀、審核也按幀的供應商,顯然沒有真正理解交付內容。
被追蹤的對象是一個貫穿時間的單一標籤,視頻標註的所有困難都源於此。靜態圖像中的錯誤僅影響一張圖像,而軌跡中的錯誤則會影響該軌跡所覆蓋的每一幀,這就是為什麼一個視頻數據集即使通過了幀級抽查,仍然可能無法使用。
本指南涵蓋服務內容、需要比較的要點、如何設計一個能夠暴露時間維度失敗的試點項目,以及合同中應包含的具體條款。
大規模視頻標註包含的內容
- 邊界框追蹤 —— 跨幀追蹤對象,並保持持久標識符。
- 跨幀分割 —— 在運動和遮擋情況下保持語義或實例掩碼。
- 關鍵點追蹤 —— 跟蹤姿態和關鍵點,幀與幀之間可見性發生變化。
- 活動與行為識別 —— 標註正在發生的事情,而不僅僅是標註存在什麼。
- 時間事件標籤 — 事件的起始和結束邊界,這比聽起來更難判斷。
- 行為與意圖標籤 — 需要具備時間上下文訓練的標註員進行上下文判斷,而不僅僅是幾何判斷。
- 多攝像頭同步 — 同一個物體在不同視角和時間戳下需保持一致的識別。
買家應比較的內容
| 買家標準 | 為何重要 | 優質交付應呈現的樣貌 |
|---|---|---|
| 時間一致性 | 一個物體必須在幀之間保持同一身份 | 跟蹤規則和身份持久性明確驗證 |
| 幀密度 | 高幀率會迅速增加工作量 | 插值和採樣在不丟失所需精度的前提下使用 |
| 遮擋處理 | 物體消失又重新出現 | 指南明確了重新識別和軌跡延續 |
| 行為標籤 | 動作和意圖需要結合上下文進行判斷 | 標註員接受的是時間上下文訓練,而不僅僅是幾何信息 |
| 視頻問答 | 錯誤會持續傳播數百幀 | 審查是針對序列進行的,而非隨機單個幀 |
| 並行化處理 | 長視頻片段會產生巨大的任務量 | 片段並行化處理時不會破壞軌道身份或指南一致性 |
| 傳感器同步 | 融合工作需要跨模態身份對齊 | 通過時間戳對相機、LiDAR、雷達和音頻標籤進行對齊 |
在第一個片段之前必須存在的規則
視頻指南在特定且可預測的地方存在缺陷。需明確解決全部七個問題:
- 跟蹤ID持久性。 如果一個對象離開畫面後又返回,它是否恢復其原始ID?在什麼條件下?
- 遮擋時長。 一個對象被遮擋多少幀後,其跟蹤將終止而非繼續?
- 分裂與合併。 兩個相互重疊後分離的對象——如何確定其身份歸屬?
- 插值策略。 什麼內容可以在關鍵幀之間進行插值,什麼內容必須直接標註。這是一項合理的成本節約,也是一項合理的系統性誤差來源,具體是哪一種,完全取決於運動特徵。
- 事件邊界。 一個動作的開始和結束位置,帶有容差。如果沒有明確的容差,不同標註員對事件標籤的一致性將很差,沒有人會知道這種不一致是源於指南問題還是標註員問題。
- 入口與出口。 物體在幀邊緣部分進入,以及開始標註的可見比例閾值。
- 剪輯邊界。 當一個長視頻被分割給多個標註員時,身份如何被協調——這是並行工作中最常見的軌跡損壞來源。
視頻標註質量的測量
幀級準確性是必要且不充分的。還需要時間維度的度量:
- 軌跡碎片化 —— 一個真實對象被分割成多個軌跡的頻率。
- ID切換 —— 兩個對象交換身份的頻率,通常發生在交叉或遮擋之後。
- 軌跡純度和完整性 —— 真實軌跡中有多少被一個預測軌跡覆蓋,反之亦然。
- 序列級接受標準,而非幀級。一個包含三次ID切換的序列可能幀級正確率達到99%,但仍不可用。
- 事件標籤邊界誤差,以幀或毫秒為單位,對比所陳述的容差範圍。
Effective throughput = Sequences delivered × Sequence-level acceptance ÷ Cycle time
請注意單位:序列,而非幀。一個在跟蹤任務上報告幀級驗收的提供商,實際上是在報告一個掩蓋其真實失敗模式的指標。
設計一個視頻試點以發現失敗情況
在一個乾淨、光照良好、場景稀疏的視頻片段上進行試點,將無法測出任何結果。必須刻意包含:
- 一個序列,其中兩個相似物體交叉並分離。
- 一個序列,其中物體被部分遮擋一段時間後重新出現。
- 一個序列,其中物體反覆進入和離開幀邊緣。
- 惡劣條件:夜間、雨天、反光、運動模糊、低分辨率。
- 一個擁擠場景,其中正確粒度的判斷實際上存在爭議。
- 至少一段長序列 — 長到必須跨標註員分割。
- 如果傳感器在範圍內,一段攝像頭和LiDAR視圖不一致的片段。
然後評估軌跡碎片化、ID切換和升級行為,而不僅僅是框質量。
如何定價
幀數作為跟蹤工作的計費單位是不合適的,因為成本主要由審核和身份解析構成,而這兩項都不隨幀數線性增長。實際操作中:
| 情況 | 更好的計費單位 |
|---|---|
| 畫面一致、對象數量可預測 | 按視頻或按幀 |
| 在遮擋和場景變化情況下的追蹤 | 按小時或按項目計費 |
| 長週期連續流程 | 帶預留容量的訂閱服務 |
| 事件與行為標註 | 按小時計費 |
| 多傳感器同步工作 | 按序列或按項目計費 |
無論單位如何,簽署前必須就‘被跟蹤對象’的含義達成一致。一個對象跨越200幀,意味著一個標籤在時間維度上的延伸——但它同時也意味著200幀的審核工作,雙方必須對同一解釋進行定價。
Lifewood的應對方式
Lifewood 將視頻標註作為一項受管理的生產流程交付,而非工具,這一點在時間維度的工作中尤為重要:連續的視頻流程需要持續的人力投入,無法在平靜周進行批量縮減,且跟蹤的一致性依賴於標註員的留存,而非彈性資源的調配。
已發表的自動駕駛相關工作涵蓋感知、預測和駕駛員監控數據——這些是時間上覆雜的視覺任務,其交付成果是身份持久性和行為標籤,而非細節的優化。視頻工作與靜態圖像、文本、音頻和3D點雲工作並列,因此一個標註方案可以在不同模態間延續,無需重新標註,也無需對語義體系進行二次解讀。
質量治理是隨著視頻項目增長而控制漂移的關鍵環節:通過多階段人工參與閉環審核,達成 95%+ 準確率的SLA,低於閾值的批次由 Lifewood 承擔重做成本。交付覆蓋 40+ 箇中心,分佈在 30+ 個國家,支持 50+ 種語言,這對於在場景慣例、標識牌和語音內容方面具有本地特徵的市場中,行為與事件標註尤為重要。
其他可信供應商包括 Sama,其已發佈的視頻標註指南強調對時間維度的理解、對象跟蹤和一致性,以保障關鍵安全領域的計算機視覺應用;iMerit,適用於機器人、自主系統及特定領域視頻,其中多模態傳感器上下文至關重要;TELUS Digital,適用於希望在 Ground Truth Studio 內部進行視頻標註的買家。選擇在技術視頻感知領域具有專長的供應商,並在受控試點中證明其表現優於項目需求。
資料與進一步閱讀
- Sama 在 sama.com 發佈的關於時間理解與對象跟蹤的視頻標註指南;iMerit 在 imerit.net 提供的機器人及多模態標註資料;TELUS Digital 在 telusdigital.com 提供的數據標註服務。
- Lifewood 的服務範圍與交付數據發佈於 lifewood.com;自動駕駛標註範圍詳見 自動駕駛數據標註。
- 相關閱讀:圖像、視頻及3D/LiDAR標註價格,說明時間維度工作如何改變預算。