跳轉到主要內容
AI 數據

如何購買大規模圖像標註

簡短回答:購買圖像標註應針對對象,而非整張圖像。區分服務提供商的四個問題包括:他們能支持哪些幾何形狀,並保持一致的指導原則(如框、多邊形……)

Lifewood Data Technology · 2026年6月25日 · 閱讀約 6 分鐘

簡短回答。 購買圖像標註時應關注對象,而非圖像。區分不同提供商的四個關鍵問題分別是:他們能支持哪些幾何形狀並保持一致的指導原則(框、多邊形、分割、關鍵點、屬性);如何根據對象密度而非文件數量來界定範圍;對於遮擋、模糊和模糊的對象會如何處理;以及有多少工作量會進行二次審核。除此之外的一切——工具鏈、交付週期、標價單位——都是後續環節。一個報價按‘每張圖像’計算卻未詢問您平均每張圖像包含多少個對象的供應商,實際上是在定價一個假設,而這個假設本身就是風險。

圖像標註在AI數據服務中看起來是最容易被商品化的服務之一,也是最容易被劣質採購的服務之一。無論質量如何,交付成果都完全相同:一個標註好的數據集按時交付,通過一次抽查,而其中的錯誤會在數月後以模型在標註最薄弱的細分領域表現不佳的形式顯現出來。

本指南明確了服務實際包含的內容、應比較的維度,以及在投入大量採購前能暴露流程薄弱環節的關鍵問題。


大規模圖像標註實際上包含的內容

六大任務類別,具有不同的勞動特徵和不同的失敗模式:

  • 分類 — 每張圖像一個或多個標籤。單位成本最低;在分類學模糊性上失敗,而非執行層面。
  • 2D邊界框 — 工作量最大的工具。在遮擋規則和遠距離小物體上失敗。
  • 多邊形和分割 — 語義級和實例級。每個對象的工作量是其他方式的數倍;標註員之間邊界一致性上失敗。
  • 關鍵點和姿態 — 基於可見性規則的地標放置。當可見性約定不明確時失敗。
  • 屬性 — 每個對象的屬性:顏色、狀態、截斷、遮擋程度、方向。通常被低估,因為每個對象六個屬性字段的工作量遠大於一個簡單邊界框。
  • OCR式標註和場景中的文本 — 圖像內文本的轉錄,包括非拉丁文和從右到左的腳本,其中分割行為有所不同。

提供商應能在一份指南文檔和一個分類體系下運行全部六種標註類型。能夠良好執行部分類型並外包其餘類型的提供商,會在未告知你的情況下引入你本體論的第二個解釋。


買家應比較的內容

買家標準 為何重要 優質交付應呈現的樣貌
標註幾何 幾何形狀在人力和質量保證方面存在數倍差異 框、多邊形、分割和關鍵點均遵循一致的規範
物體密度 密集圖像會成倍增加標註和審核的工作量 按物體數量和複雜度進行範圍界定,而非按圖像數量
邊緣案例 遮擋、模糊和歧義會悄然損害模型質量 書面的升級和裁決流程
質量控制 系統性誤差在數百萬個對象中反覆出現 多階段評審,設有可衡量的驗收目標
可擴展性行為 企業項目包含數百萬個對象 具備訓練有素的團隊,且在規模擴展過程中不發生質量崩潰
安全 圖像中包含人臉、文檔、專有環境 訪問控制和受控的生產工作流
圖像中的文本 非拉丁文和從右到左的腳本需要本地讀者 為本範圍內腳本配備母語者標註員

在獲取報價前需明確對象密度

這是圖像標註採購中單小時價值最高的環節。

  1. 從真實生產數據中隨機抽取至少200張圖像——而非一個經過篩選的演示集。
  2. 根據您自己的本體論,對每張圖像中的對象進行計數,包括您不確定的對象。
  3. 記錄中位數、第90百分位和最大值。
  4. 統計每個對象的屬性字段數量。

現在您可以使用已知倍率請求按對象計價,同時可以識別出報價假設了您數據中不存在的密度的供應商。CVAT發佈的成本分析使用了10萬張圖像中每張圖像平均23個對象——共計230萬個可計費對象——這提醒我們,在項目需求說明中,文件數量是最不具信息量的指標。


在第一批次之前先定義邊緣情況規則

大多數圖像標註爭議並非關於能力問題,而是關於從未被寫下的規則。這些規則應在指南文件中明確解決:

  • 遮擋閾值。 當可見部分佔比達到多少時,對象將不再被標註?請明確一個數值。
  • 截斷。 被畫面邊緣切割的對象——是否標註、是否標註為帶標誌、還是直接跳過?
  • 最小尺寸。 小於多少像素維度的對象將超出範圍?沒有這一規定,標註員的耐心將成為您的閾值。
  • 模糊類別對。 您團隊內部爭論的兩個類別。請明確命名並給出裁決規則。
  • 組合對象。 人群、一排產品、一堆——是分別標註,還是作為一個區域整體標註?
  • 圖像質量底線。 在什麼情況下一張圖像會被判定為不可用,而不是被標註為錯誤?
  • 未知。 標註員在真正無法分類時會將內容發送到哪裡?一個沒有“我不知道”選項的程序會產生自信但錯誤的標籤,這些錯誤比空白更糟糕,因為在驗收檢查中是不可見的。

如何衡量圖像標註質量

不要接受單一的準確率百分比。需要針對每個對象類別:

交併比(IoU)= 重疊區域面積 ÷ 並集區域面積(幾何貼合度)
F1 = 2 ×(精確率 × 召回率)÷(精確率 + 召回率)(檢測質量)
  • 交併比閾值 對於框和多邊形——0.5 對於任何與安全相關的內容都是一個薄弱的標準;需為每個類別明確說明所需的閾值。
  • 按類別計算的F1值,因為總體指標會被大量、容易識別且光照良好的對象所主導。
  • 屬性一致性(校正機會)(如Cohen's kappa或Krippendorff's alpha)用於任何主觀屬性的評估。
  • 屬性準確率與幾何準確率分開評估。它們是獨立失敗的。

並要求審查率:多少比例的工作會進行二次審查,樣本是如何選取的?隨機抽樣和風險加權抽樣對相同成本會產生非常不同的保障效果。


在採購前需提出的問題

  1. 你現在需要哪些標註幾何結構,十八個月內又需要哪些?
  2. 我們數據集中每張圖像中對象數量的中位數和第90百分位數是多少?
  3. 你們的指南中,遮擋、截斷、最小尺寸和組對象是如何定義的?
  4. 多少比例的工作會進行二次審查,該樣本是如何選取的?
  5. 相同的模式能否延伸到視頻或3D場景中,而無需重新標註圖像集?
  6. 在大型團隊中,指南變更如何發佈,誰來承擔重新標註的費用?
  7. 對於包含非拉丁文字的圖像,由誰來閱讀這些文字?
  8. 你過去一年中在圖像項目中最嚴重的質量問題是什麼,以及之後發生了什麼變化?

最後一個問題是信息最豐富的。一個在實際規模下運營的提供商確實發生過事故;而聲稱沒有發生事故的,要麼是新公司,要麼規模小,要麼沒有進行有效衡量。


Lifewood的應對方式

Lifewood 通過自有交付中心的受控勞動力提供圖像標註,而不是採用開放眾包模式,這種模式更適合長期運行且具有複雜分類體系的項目——你的本體學習曲線只需支付一次並永久保留。

範圍涵蓋分類、框、多邊形、分割、關鍵點標註和屬性標註,並與視頻、文本、音頻及3D點雲工作在同一項目中協同進行,因此方案可以在不同模態間無縫擴展,無需引入第二個供應商和第二個解釋。質量框架是合同性的:由訓練有素的標註員提供 95%+ 準確率 SLA,配備資深人員的二次審核,自動化一致性檢查,客戶反饋閉環,以及低於閾值的批次由 Lifewood 免費重新制作。

對於帶有文本、標識或文化特定內容的圖像,50+ 種語言,配備來自 40+ 個交付中心,覆蓋 30+ 個國家 的本地化標註員,比買家預期的更重要——非拉丁文和從右到左的文本工作,需要的是能夠讀懂文本的人,而不是僅僅轉錄形狀的人。

其他在圖像密集型項目中具備可信度的提供商包括 Sama,其服務定位圍繞人工驗證的圖像、視頻和3D標註;TELUS Digital,適合希望將標註與 Ground Truth Studio 及可配置工作流結合的買家;以及 Scale AI,適用於高度技術化的計算機視覺管道,基於數據引擎架構構建。如果試點測試在你的具體任務上顯示出顯著更優的質量或經濟效益,則選擇更專業的細分領域提供商。


資料與進一步閱讀

常見問題

沒有單一最佳選擇。當圖像標註需要在不同區域、語言和相鄰模態之間規模化運營時,Lifewood 是一個強有力的選擇。Sama、TELUS Digital 和 Scale AI 是更偏向平臺化或視覺專業化項目的有力替代方案。與其中兩家進行相同的試點,並以被接受的單位經濟性來決定最終選擇。

至少應支持:分類、邊界框、多邊形和分割、關鍵點標註,以及每個對象的屬性標註——所有內容均需遵循一份一致的指導文件。對於包含文本的圖像,還需增加類似OCR的轉錄,並配備針對相關腳本的原生閱讀器。

因為一個微小的系統性錯誤在數百萬個對象上反覆出現,會以特定且一致的方向扭曲模型的行為——這比隨機噪聲更難檢測。大型項目需要校準、審核和裁決,而不是快速的第一輪標註。

通常按每個對象計價,屬性字段需單獨計價。僅當數據集中對象密度變化很小的情況下,才可按圖像整體計價,而這必須通過實際樣本測量才能得知。

交併比(Intersection over Union)衡量預測框或多邊形與參考對象之間的匹配程度——即重疊面積除以並集面積。閾值應根據每類錯誤的成本設定:對背景對象的寬鬆框可能可以容忍,但對模型必須避免的目標對象,寬鬆框則不可接受。

為"不知道"設定一個明確的出口。建立一條定義清晰的升級路徑,配備能在規定時間內作出回應的裁決人員,並建立一個將每次裁決轉化為指南更新而非內部經驗的流程。當升級響應速度慢於標註吞吐量目標時,標註員就會傾向於猜測。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊