簡答。 並不存在單一的標註率,因為輸出成果所驅動的時間遠多於模態的影響。COCO自身的測量數據顯示,一個邊界框的繪製耗時為7秒,但每個實例的完整流程耗時為50.2秒——其中86%是尋找和分類對象,而非繪製。一個多邊形掩碼的完整流程耗時約為122秒,大約是邊界框的2.4×。對COCO train2017數據集進行標註,邊界框耗時493天,掩碼耗時1,204天,均基於相同圖像。而這些時間數據無法通過人員數量進行除法運算得出交付日期,因為審核、返工和啟動階段都存在於吞吐量與交付之間。
這個問題幾乎在每一次範圍討論中都會出現,通常被表述為:我們有400,000張圖像,你們最快需要多長時間完成?
這是一個完全合理的問題,但它沒有單一答案,因為誠實的回答取決於‘標註’在該數據集中的具體含義。同一張圖像,如果只是畫一個車的邊界框,可能只需七秒,而如果要求像素級精確的掩碼,則可能需要兩分鐘。這是同一模態、同一文件上的十七倍差異,也是交付時間線中最大的驅動因素。
因此,本文試圖以具體任務為單位,附上真實研究數據,來量化這一現象,並進一步解釋更重要的事實:為什麼你不能簡單地將這些時間乘以團隊規模,就得出一個交付日期。
各任務的具體耗時數據,附有真實研究支撐
目前最實用的公開時間數據來自COCO數據集的標註工作,因為研究人員精確記錄了每個實例的耗時,足以作為基準參考。
邊界框:使用極端點擊法,一旦物體被定位和分類,每個實例耗時約7秒,這是繪製時間的獨立部分。
完整流程的數據更具指導意義。在COCO協議中,標註一個實例的完整流程耗時50.2秒:
其中28.8秒用於分類標籤,14.4秒用於實例定位,7.0秒用於邊界框本身。邊界框僅佔總時間的14%。尋找和分類物體佔其餘86%。
這一比例令人驚訝,且對範圍估算至關重要,因為它意味著預先完成的物體定位與分類能節省大量時間,遠勝於預先完成的邊界框繪製。
多邊形掩碼:每個實例約79.2秒。COCO數據顯示,每1000個實例的多邊形掩碼標註耗時22小時。加上分類標籤和實例定位,一個完整的掩碼實例耗時122.4秒。
因此,與邊界框相比,掩碼在相同流程中的總成本約為2.4倍,而繪製成本約為11倍。
基於點的標註:在已有邊界框的前提下,給定10個點,每個實例約需9秒,研究人員指出這比基於多邊形的掩碼標註快八倍以上。
整體視角使差異變得具體。為了標註包含849,949個實例的118,287張COCO train2017圖像,研究人員計算出邊界框標註耗時493天,掩碼標註耗時1,204天,點標註耗時582天。相同圖像,相同對象,耗時是日曆時間的兩倍半。
不同模態的複雜度階梯
在計算機視覺領域之外,時間研究數據較少,但行業內的相對排序是一致的,這在規劃混合項目時是值得了解的。
對於圖像數據,從耗時最少到最耗時的順序為:分類、邊界框、多邊形標註,最後是語義分割和實例分割。
對於文本數據,從耗時最少到最耗時的順序為:文檔分類、命名實體識別、情感分析、關係抽取,最後是核心指代解析。
對於音頻數據,轉錄是基礎,隨後是說話人分離、情感標註和音素標註,按此順序逐步增加成本。
對於視頻,幀級任務需要將等效圖像標註成本乘以幀數,而跟蹤標註則在此基礎上增加了在序列間保持一致性的開銷。
對於3D數據,長方體和點雲標註需要顯著的幾何專業知識,且始終是每個項目中成本最高的標註類別。
定價數據證實了這一排序,因為價格基本上是時間的代理。基礎標籤如邊界框的單價大致在$0.03至$1.00之間,而複雜標籤如精確語義掩碼的單價則在$0.05至$5.00之間。在3D場景中,一個長方體的標註成本從約$0.121起步,而2D邊界框為$0.036,反映出建立深度、範圍和方向所需額外工作。分割、多邊形和3D點雲工作成本是基礎邊界框的10到50倍。
轉錄與語音。一名受過訓練的轉錄員需要三到六小時才能完成一小時的轉錄文本,這一數據決定了任何語音項目的時間線。語音分離和時間戳添加在該基礎上。
LiDAR幀。一名經驗豐富的標註員以生產節奏處理複雜城市場景時,每小時大約處理8到15幀,困難條件下則顯著減少。
偏好對。這是最不標準化且最難誠實評估的項目。針對簡短響應的單維度偏好判斷可以很快完成。而對長篇響應應用多維度評分表,評分者必須仔細閱讀兩個輸出並分別評分多個維度,每對響應耗時約為五到十分鐘。此處的變異性大於任何其他任務類型,任何未了解評分標準就引用固定數字的人都是在猜測。
為什麼不能簡單乘以人數
這部分實際上決定了交付日期,也是大多數初級估算錯誤所在的地方。
取一個勞動力數量,乘以每小時費率,再乘以工作時長。這會產生一個看似美麗卻幾乎與實際交付量毫無關係的數字。
四項因素造成了差距。
質量保證開銷是真實容量。如果一個項目同時進行同行評審並包含15%的質量採樣,勞動力中相當一部分工時將用於評審而非生產。這並非浪費,而是使輸出可用性的機制,但它必須從吞吐量計算中扣除。根據項目階段和採樣率的不同,評審可能消耗總可用工時的15%到30%。
返工並非免費。被拒的項目會返回並消耗兩倍時間。一個返工率為10%的項目在質量保證開銷之前,其實際交付能力僅為名義容量的約90%。
啟動並非即時。新團隊不會立即達到熟練工人的效率水平。新標註員在前幾週的工作速度會降低,並且需要更高的質量審核,因此一個在第一天就組建團隊的項目,其前一個月的實際產能將顯著低於名義容量。
並非每個人都能參與每個任務。一個橫跨多個國家和語言的工作力並非可互換的。Lifewood網絡中的56,788名貢獻者,並非56,788名隨時可參與任意任務的人;他們是一個池子,從中選出符合特定語言、模態和規範要求的子集。對於一項約魯巴語語音項目,相關能力是合格的約魯巴語使用者數量,而非網絡總數。
最後這一點對多語言工作最為重要,也正是它解釋了為什麼網絡總人數作為交付速度的代理指標是不合適的。決定時間線的是特定語言和任務的深度,而非網絡的廣度。
一個大致的規劃規則,能夠較為合理地成立:取名義上的每標註員費率,乘以70%到80%用於質量保證和返工開銷,併為任何處於首月的團隊再乘以一個啟動期折扣。這樣得到的數字比直接相乘更接近一個可辯護的數值。
真正加速項目進度的因素
考慮到所有這些,真正能夠推動時間線的槓桿因素值得了解。
預標註能夠發現對象,而不僅僅是畫出對象。鑑於COCO研究顯示,識別和分類佔實例處理時間的86%,一個能夠定位並分類候選對象的模型,其效率提升遠超僅對已發現對象進行幾何優化的模型。
任務鏈式處理。從已完成的立方體分割開始進行分割,或從粗略遍歷階段開始進行精細標註,可以減少重複工作。平臺功能在此方面比標註員速度更為關鍵。
在模型無需高精度的場景下,降低任務複雜度。這是最被忽視的槓桿。如果檢測模型在框上表現足夠,那麼指定多邊形掩碼將使標註時間成本增加2.4倍,因為模型無法利用這種精度。將標註的精細度與實際模型需求相匹配,是項目啟動前值得進行的一場範圍定義對話。
指南成熟度。模糊的規格說明會導致返工,而返工是大多數項目中最大的可回收性低效來源。前期投入的校準時間會直接轉化為後期的處理效率。
不要壓縮質量保證。反直覺的是,為了趕進度而削減質量保證,通常會拖慢交付進度,因為錯誤會在客戶評審階段暴露出來,並以更大的返工批次出現,且附帶更差的客戶關係。
如何正確地提出交付效率估算請求
如果你正在規劃一個項目,能夠產生有用答案而非僅是希望性答案的問題是:
標註任務的具體內容是什麼?在輸出成果層面,不是‘標註圖像’,而是‘每輛車、行人和騎行者一個邊界框,帶有遮擋標誌,最小尺寸閾值為20像素’。
平均每項內容包含多少個對象?僅知道實例率無法轉換為每張圖像的率,除非你知道實例密度。一個城市駕駛幀包含40個對象,而一個鄉村幀僅包含3個,這兩個任務並不相同。
準確率水平如何衡量?一個0.92的IoU閾值,是自動駕駛和醫療AI領域報告的行業最低標準,要求每個對象的標註投入顯著更多,遠超寬鬆容忍度的情況。
質量保證機制是什麼?抽樣率、同行評審和返工預期都源於團隊容量。
有多少名合格的參與者能夠承擔這項特定任務和語言?不是網絡規模。
增長曲線是怎樣的?如果項目需要新增團隊,那麼前一個月的交付率會低於預期水平。
一個在報價前就提出這些問題的供應商,說明他們已經執行過這類項目。而僅根據工作量直接報價的供應商,從未參與過此類項目。
關鍵要點
- 同一張圖像的標註時間可能從7秒到2分鐘不等,取決於輸出成果,這是交付時間中最主要的驅動因素。
- COCO研究顯示,邊界框繪製耗時約為每個實例7秒,完整實例標註流程耗時50.2秒:其中28.8秒用於分類標註,14.4秒用於實例識別,7.0秒用於繪製邊界框。
- 對象發現與分類佔實例處理時間的86%。預標註能夠發現對象,其效率提升遠超僅對已發現對象進行幾何優化的預標註。
- 多邊形掩碼每實例約需79.2秒,端到端約需122.4秒,約為邊界框標註的2.4倍。
- 基於10個點的點標註每實例約需9秒,比多邊形掩碼快超過八倍。
- 標註COCO train2017數據集的耗時計算為:邊界框標註493天,點標註582天,多邊形掩碼標註1,204天。
- 複雜度排序:圖像分類、邊界框、多邊形、分割;文本分類、命名實體識別、情感分析、關係抽取、核心引用;音頻轉錄之後是說話人分離、情感標籤、音素標註;3D立方體和點雲是所有類別中最複雜的。
- 基礎標籤每項成本為0.03至1.00美元,複雜掩碼為0.05至5.00美元;一個3D立方體標註成本約為0.121美元,而一個2D邊界框為0.036美元。
- 一名訓練有素的語音轉錄員每完成一小時音頻需要3到6小時。激光雷達標註員在複雜城市場景下每小時處理大約8到15幀。
- 名義容量並不等於實際交付容量:質量保證(QA)可能消耗15%到30%的工時,返工耗時是正常時間的兩倍,新團隊需要數週時間才能達到穩定狀態,且全球勞動力在不同語言和任務之間不可互換。
- 一個粗略的規劃規則是,在QA和返工之後,實際交付率約為名義速率的70%到80%,並且對於新團隊的首月,還需進一步打折。
- 真正影響效率的關鍵因素是預標註(spot objects)、任務鏈設計、將標註精度與實際模型需求相匹配,以及指南的成熟度。
資料與進一步閱讀
- "Pointly-Supervised Instance Segmentation" (arXiv),關於COCO數據集上邊界框、多邊形掩碼和點標註的單實例耗時,以及COCO train2017日計算
- DataVLab, "Data Annotation Pricing 2026",關於圖像、文本、音頻、視頻和3D模態複雜度排序的分析
- BasicAI, "How Much Do Data Annotation Services Cost?",關於基礎與複雜標籤價格層級的對比
- ANOSUPO AI, "3D Point Cloud Annotation for Autonomous Driving",關於3D立方體與2D邊界框單位費率的對比
- Lightly, "Best Data Annotation Companies in 2026",關於分割和3D點雲成本是基礎邊界框的10到50倍
- Precise BPO, "Bounding Box Annotation Benchmarks",關於自動駕駛和醫療AI中IoU閾值設定,以及MIT CSAIL關於mAP因標註錯誤而損失的研究發現
- ConvertAudioToText, "Cost of Transcription Per Hour in 2026",關於完成轉錄小時數與原始音頻小時數之間3到6小時比例的分析
- Lifewood, 公司時間線,關於2021年從20,000人增長到2024年56,788人的眾包資源規模及交付網絡
- 關於圖表的說明:單實例耗時數據來源於特定數據集和協議的已發表研究。實際速率會因任務定義、實例密度、工具、標註員經驗與準確性要求而異,應通過小規模試點驗證,而非簡單假設。