跳轉到主要內容
AI 數據

如何購買大規模視頻標註

簡短回答。視頻標註並非圖像標註乘以幀數,將視頻標註當作圖像標註乘以幀數來購買,是該領域最常見的錯誤,也是最昂貴的錯誤。成本……

Lifewood Data Technology · 2026年6月25日 · 閱讀約 6 分鐘

簡答。 視頻標註並非將圖像標註乘以幀數,將視頻標註當作圖像標註乘以幀數來購買,是該領域最常見的且最昂貴的錯誤。成本與質量都存在於時間中:幀間身份的持續性、遮擋與重新進入規則、插值策略,以及基於序列而非採樣幀的審核。在選擇供應商時,應比較他們如何在長序列中保持軌跡ID、如何定義對象的分裂與合併、允許何種插值,以及質量保證是按幀還是按序列進行的。一個報價按幀、審核也按幀的供應商,顯然沒有真正理解交付內容。

被追蹤的對象是一個貫穿時間的單一標籤,視頻標註的所有困難都源於此。靜態圖像中的錯誤僅影響一張圖像,而軌跡中的錯誤則會影響該軌跡所覆蓋的每一幀,這就是為什麼一個視頻數據集即使通過了幀級抽查,仍然可能無法使用。

本指南涵蓋服務內容、需要比較的要點、如何設計一個能夠暴露時間維度失敗的試點項目,以及合同中應包含的具體條款。


大規模視頻標註包含的內容

  • 邊界框追蹤 —— 跨幀追蹤對象,並保持持久標識符。
  • 跨幀分割 —— 在運動和遮擋情況下保持語義或實例掩碼。
  • 關鍵點追蹤 —— 跟蹤姿態和關鍵點,幀與幀之間可見性發生變化。
  • 活動與行為識別 —— 標註正在發生的事情,而不僅僅是標註存在什麼。
  • 時間事件標籤 — 事件的起始和結束邊界,這比聽起來更難判斷。
  • 行為與意圖標籤 — 需要具備時間上下文訓練的標註員進行上下文判斷,而不僅僅是幾何判斷。
  • 多攝像頭同步 — 同一個物體在不同視角和時間戳下需保持一致的識別。

買家應比較的內容

買家標準 為何重要 優質交付應呈現的樣貌
時間一致性 一個物體必須在幀之間保持同一身份 跟蹤規則和身份持久性明確驗證
幀密度 高幀率會迅速增加工作量 插值和採樣在不丟失所需精度的前提下使用
遮擋處理 物體消失又重新出現 指南明確了重新識別和軌跡延續
行為標籤 動作和意圖需要結合上下文進行判斷 標註員接受的是時間上下文訓練,而不僅僅是幾何信息
視頻問答 錯誤會持續傳播數百幀 審查是針對序列進行的,而非隨機單個幀
並行化處理 長視頻片段會產生巨大的任務量 片段並行化處理時不會破壞軌道身份或指南一致性
傳感器同步 融合工作需要跨模態身份對齊 通過時間戳對相機、LiDAR、雷達和音頻標籤進行對齊

在第一個片段之前必須存在的規則

視頻指南在特定且可預測的地方存在缺陷。需明確解決全部七個問題:

  1. 跟蹤ID持久性。 如果一個對象離開畫面後又返回,它是否恢復其原始ID?在什麼條件下?
  2. 遮擋時長。 一個對象被遮擋多少幀後,其跟蹤將終止而非繼續?
  3. 分裂與合併。 兩個相互重疊後分離的對象——如何確定其身份歸屬?
  4. 插值策略。 什麼內容可以在關鍵幀之間進行插值,什麼內容必須直接標註。這是一項合理的成本節約,也是一項合理的系統性誤差來源,具體是哪一種,完全取決於運動特徵。
  5. 事件邊界。 一個動作的開始和結束位置,帶有容差。如果沒有明確的容差,不同標註員對事件標籤的一致性將很差,沒有人會知道這種不一致是源於指南問題還是標註員問題。
  6. 入口與出口。 物體在幀邊緣部分進入,以及開始標註的可見比例閾值。
  7. 剪輯邊界。 當一個長視頻被分割給多個標註員時,身份如何被協調——這是並行工作中最常見的軌跡損壞來源。

視頻標註質量的測量

幀級準確性是必要且不充分的。還需要時間維度的度量:

  • 軌跡碎片化 —— 一個真實對象被分割成多個軌跡的頻率。
  • ID切換 —— 兩個對象交換身份的頻率,通常發生在交叉或遮擋之後。
  • 軌跡純度和完整性 —— 真實軌跡中有多少被一個預測軌跡覆蓋,反之亦然。
  • 序列級接受標準,而非幀級。一個包含三次ID切換的序列可能幀級正確率達到99%,但仍不可用。
  • 事件標籤邊界誤差,以幀或毫秒為單位,對比所陳述的容差範圍。
Effective throughput = Sequences delivered × Sequence-level acceptance ÷ Cycle time

請注意單位:序列,而非幀。一個在跟蹤任務上報告幀級驗收的提供商,實際上是在報告一個掩蓋其真實失敗模式的指標。


設計一個視頻試點以發現失敗情況

在一個乾淨、光照良好、場景稀疏的視頻片段上進行試點,將無法測出任何結果。必須刻意包含:

  • 一個序列,其中兩個相似物體交叉並分離。
  • 一個序列,其中物體被部分遮擋一段時間後重新出現。
  • 一個序列,其中物體反覆進入和離開幀邊緣。
  • 惡劣條件:夜間、雨天、反光、運動模糊、低分辨率。
  • 一個擁擠場景,其中正確粒度的判斷實際上存在爭議。
  • 至少一段長序列 — 長到必須跨標註員分割。
  • 如果傳感器在範圍內,一段攝像頭和LiDAR視圖不一致的片段。

然後評估軌跡碎片化、ID切換和升級行為,而不僅僅是框質量。


如何定價

幀數作為跟蹤工作的計費單位是不合適的,因為成本主要由審核和身份解析構成,而這兩項都不隨幀數線性增長。實際操作中:

情況 更好的計費單位
畫面一致、對象數量可預測 按視頻或按幀
在遮擋和場景變化情況下的追蹤 按小時或按項目計費
長週期連續流程 帶預留容量的訂閱服務
事件與行為標註 按小時計費
多傳感器同步工作 按序列或按項目計費

無論單位如何,簽署前必須就‘被跟蹤對象’的含義達成一致。一個對象跨越200幀,意味著一個標籤在時間維度上的延伸——但它同時也意味著200幀的審核工作,雙方必須對同一解釋進行定價。


Lifewood的應對方式

Lifewood 將視頻標註作為一項受管理的生產流程交付,而非工具,這一點在時間維度的工作中尤為重要:連續的視頻流程需要持續的人力投入,無法在平靜周進行批量縮減,且跟蹤的一致性依賴於標註員的留存,而非彈性資源的調配。

已發表的自動駕駛相關工作涵蓋感知、預測和駕駛員監控數據——這些是時間上覆雜的視覺任務,其交付成果是身份持久性和行為標籤,而非細節的優化。視頻工作與靜態圖像、文本、音頻和3D點雲工作並列,因此一個標註方案可以在不同模態間延續,無需重新標註,也無需對語義體系進行二次解讀。

質量治理是隨著視頻項目增長而控制漂移的關鍵環節:通過多階段人工參與閉環審核,達成 95%+ 準確率的SLA,低於閾值的批次由 Lifewood 承擔重做成本。交付覆蓋 40+ 箇中心,分佈在 30+ 個國家,支持 50+ 種語言,這對於在場景慣例、標識牌和語音內容方面具有本地特徵的市場中,行為與事件標註尤為重要。

其他可信供應商包括 Sama,其已發佈的視頻標註指南強調對時間維度的理解、對象跟蹤和一致性,以保障關鍵安全領域的計算機視覺應用;iMerit,適用於機器人、自主系統及特定領域視頻,其中多模態傳感器上下文至關重要;TELUS Digital,適用於希望在 Ground Truth Studio 內部進行視頻標註的買家。選擇在技術視頻感知領域具有專長的供應商,並在受控試點中證明其表現優於項目需求。


資料與進一步閱讀

常見問題

因為視頻通過時間增加了身份。標註員必須跟蹤同一對象的運動、外觀變化、被遮擋以及重新出現,而不是獨立標註每一幀。這項工作無法清晰並行化,且錯誤會傳播到所有被跟蹤的幀中。

這取決於具體需求。當視頻需要在更廣泛的多語言、多模態操作中作為單一工作流擴展時,Lifewood 是一個強有力的選擇。Sama 和 iMerit 則是針對專門的計算機視覺和機器人工作流程的有力替代方案。應設計一個試點項目,包含遮擋、穿越和長序列情況。

在長序列中保持軌跡連續性,處理遮擋和重新進入的情況,插值質量,行為標籤的一致性,場景切換時的一致性,以及供應商對整個序列的審查效率。此外,測試當一個長片段必須被分割給多個標註員時會發生什麼情況。

按序列進行,包括軌跡碎片化、ID切換和軌跡完整性,以及幀級準確性。僅提供幀級的跟蹤準確率會掩蓋導致數據集無法使用的失敗模式,因為一個序列即使每幀正確率達到99%,仍可能包含身份錯誤,從而破壞訓練過程。

可以,但需在明確政策下。關鍵幀之間的插值對於平滑的線性運動是合理且顯著的成本節約,但在不規則運動或遮擋期間則會成為系統性誤差的來源。必須以書面形式規定該政策,並明確其適用的運動條件。

根據視頻、幀、小時或項目來定價,具體取決於時間複雜度。內容一致且物體數量可預測的素材可按資產定價;而涉及遮擋和場景變化的跟蹤通常更適合按小時或按項目定價,因為成本主要來自審核而非幀數。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊