簡短回答。 數據標註是為原始數據附加結構化意義的過程,以便模型能夠從中學習或與之進行衡量——例如,一個行人周圍的方框、一句話中的實體跨度、音頻文件中的說話者回合、兩個模型響應之間的排序。從商業角度來看,關鍵在於“錯誤標籤如何導致錯誤模型”,而這有兩種截然不同的表現形式。隨機標籤噪聲 會降低樣本效率:模型仍然能找到正確的邊界,只是需要更多的示例才能實現。系統性標籤噪聲 ——所有標註員都以相同的方式錯誤地應用模糊規則——會移動邊界本身,而無論增加多少額外數據都無法糾正它。後者成本更高,它在一致性統計中是不可見的,是由不明確的指導方針而非粗心的標註員所產生。
數據標註的買家通常將質量視為一個百分比:有多少標籤是錯誤的。這種表述掩蓋了更重要的問題,即錯誤是如何發生的。一個包含零散獨立錯誤的數據集和一個存在一致誤解的數據集,可能具有相同的缺陷率,卻會生成完全不同的模型。本指南將介紹數據標註實際上為模型提供了什麼,每種錯誤如何傳播,以及可測量準確率的上限來自何處。
數據標註為原始數據增加了什麼?
原始數據包含信息;它不包含目標。標註創建了一個目標。根據模型的不同,這個目標可以是類別、位置、跨度、時間戳、關係、排序或理由——而目標的選擇是一個設計決策,它會限制模型後續所能學習的一切內容。
| 模態 | 典型的目標 | 模型實際接收的內容 |
|---|---|---|
| 圖像 | 分類、方框、多邊形、分割、關鍵點 | 一個對象開始和結束位置的定義 |
| 視頻 | 追蹤、動作分割、事件邊界 | 對象身份在時間上的持續性,達到指定容差 |
| 音頻 | 轉錄、說話人分離、事件和情感標籤 | 聲音與意義之間的對齊 |
| 文本 | 實體、意圖、情感、關係、相關性 | 應用於語言的決策規則 |
| 大語言模型輸出 | 評分標準、排序、事實性檢查、失敗標籤 | 一個關於質量的判斷,而非內容的事實 |
最下面一行是變化最大的。對於生成式系統而言,標註工作不再僅僅是給輸入打標籤——它越來越側重於對輸出進行評分、對不同選項進行排序、驗證陳述、重寫薄弱響應以及標記失敗模式。從事這項工作的人員需要能夠 識別 目標質量,而這是一項與準確畫出一個方框相比通常更為稀缺且不同的能力。
在所有這些內容之下,有一個值得明確陳述的想法: 一個標註數據集是一個操作化的定義。 "標註所有車輛" 是一個主題。一個定義會說明自行車是否被包含,一輛僅二十百分比可見且位於圍欄後方的車輛是否被標註,以及當真正不確定時,標註員應當如何操作。每一個標註員都會回答這些問題,無論指南是否明確說明。
一個錯誤的標籤如何演變為一個錯誤的模型?
訓練過程最小化了模型輸出與標籤之間的分歧。因此,標籤並非建議——它在訓練期間是正確的定義。錯誤以三種可區分的方式進入模型。
隨機噪聲:對樣本效率的一種稅收。 如果錯誤與輸入無關——比如誤點擊、注意力缺失、一個真正模糊的項目通過拋硬幣解決——那麼這些錯誤不會產生一致的方向。在足夠多的示例上平均後,它們會部分抵消,模型會使用比實際需要更多的數據,收斂到大致正確的邊界。這是良性情況,也是人們在聽到‘標籤噪聲’時所想像的情況。
系統性噪聲:邊界被移動了。 如果錯誤與輸入相關——例如,每個標註員都將反射視為實例,因為指南從未說明不應如此;每個評分者更偏好較長的回答,因為評分標準從未提及長度——那麼這些錯誤不會抵消。它們是持續的信號,模型會忠實地學習這些錯誤。隨著數據量增加,模型會變得 更加 有信心地遵循錯誤規則。這種失敗無法通過下游方法修復,它不會表現為標註員之間的分歧,而是源於指南定義不足的直接結果。
覆蓋錯誤:一個從未被畫出的邊界。 從未被標註的項目,因為抽樣計劃中並未包含它們,對模型沒有任何教學作用。模型在這些區域表現任意,且在相同分佈上計算的任何指標都無法揭示這一問題。
實際後果是,最常報告的兩個質量指標——缺陷率和一致率——都忽略了最具破壞性的錯誤類別。那些共享誤解的標註員之間會完全達成一致。
最便宜的診斷成本為一小時:選取二十個真正困難的項目,讓三位標註員依據現行指南獨立標註,並閱讀他們的分歧。只要他們存在分歧,就說明指南不夠明確;只要他們達成一致,而該結果被資深評審員認為是錯誤的,你就已經發現了系統性噪聲,而無需為一百萬次實例的噪聲買單。
為什麼標註質量限制了你能測量的內容
還存在一個容易被忽視、一旦發現就令人尷尬的效應。評估標籤也是標註,如果它們與訓練標籤由相同流程產生,那麼它們也具有相同的錯誤率。
可測量的準確率上限 ≈ 1 − 評估標籤的錯誤率
如果你測試標籤中的部分是錯誤的,那麼一個完美的模型在這些項目上會被評分錯誤。測量的準確率不會超過上限,而且——更有用的是——當兩個模型都接近這個上限時,它們之間的差異是無法被信任的。
由此產生兩個後果:
- 評估集應比訓練集擁有更高的標註標準,由資深評審員裁定,而非以生產速率生成。它們規模較小,因此是可行的,且它們是所有其他決策的依據。
- 一個看似超越上限的模型,通常只是在記憶標註員的個人習慣,而非真正掌握了任務。當同一團隊同時產生訓練標籤和測試標籤時,兩者共享偏見,模型在本應被測試的項目上得分被誇大。
標籤方案應該細化到什麼程度?
方案設計是系統性噪聲最常產生的環節,它是一種與真實最優解的權衡,而非‘細節越多越好’的漸進趨勢。
| 方案過於寬泛 | 方案過於精細 |
|---|---|
| 模型需要區分的內容被合併到一個類別中 | 標註員無法一致地應用邊界 |
| 模型無法學習你從未編碼的行為 | 一致性下降;裁決負擔上升 |
| 便宜、快速、一致——但仍然不足 | 昂貴、緩慢,且比粗糙的方案更嘈雜 |
| 修復方法:僅一次地將類別拆分,並使用示例說明 | 修復方法:合併類別,或添加屬性而非新增類別 |
該測試是經驗性的而非理論性的:在一小部分刻意多樣化的樣本上進行試點。 如果經過訓練的評審員無法一致地應用指令,那麼是分類體系本身錯誤,而不是評審員的問題。 修改一個分類體系在五十個樣本後花費一個上午;修改後五十萬個樣本則意味著需要逐一識別並重新判斷受影響的項目,而兩個版本之間未記錄的漂移,正是數據集在構造過程中變得內部不一致的原因。
一個有用的中間步驟:當一個區分是真實的但難以應用時,將其編碼為一個較粗粒度類別的屬性,而不是作為一個獨立的類別。屬性在不確定時可以留空;而類別則強制做出選擇。
自動化能幫助的地方,以及它悄然造成傷害的地方
預先使用模型進行標註,然後由標註員糾正輸出,是標準做法,且實際效率提升顯著。其代價是具體的:當標註員看到一個合理的建議時,他們更可能接受它,而不是在未提示的情況下自行產生;這種效應在模糊項目上最為明顯——而這恰恰是獨立判斷的本意所在。結果是,數據集記錄了預標註模型的盲點,而所有的一致性統計指標依然保持健康,因為標註員彼此之間在接受相同建議方面達成了一致。
自動化可以被表述為規則且可確定性驗證的內容:模式合規性、缺失字段、無效範圍、重複項、解析和長度檢查、文件完整性。將不確定性交由人工處理。保留未輔助控制的批次,以便可測量其與輔助流之間的差異,抑制低置信度建議而非展示猜測,並且絕不預先使用被評估的模型進行標註。模型輔助標註的機制詳見 大規模多模態數據標註。
Lifewood的應對方式
Lifewood 將指南視為交付成果,將標註視為其輸出。邊緣案例的裁定會附帶具體示例並進行版本管理,分歧由資深評審員裁決而非簡單平均處理,並將雙重人工參與閉環審查的準確率維持在 95%以上——因為評估材料是判斷一切其他內容的基準,因此其處理標準高於生產材料。
在多語言和多模態工作中,關鍵約束是當某項細微錯誤出現時,誰能夠聽到或閱讀。擁有 50多種語言,覆蓋 30多個國家的40多個交付中心 和 56,788 名註冊貢獻者,意味著裁決在本地市場內完成,而非通過翻譯後的指南進行,而這正是全球項目中系統性噪聲通常被引入的節點。AI數據遺產可追溯至2004年,公司目前成立於2018年。
參見 全球AI數據、質量保證流程、AI數據驗證 和 AI數據服務。
資料與進一步閱讀
- Ouyang 等人,"通過人類反饋訓練語言模型遵循指令",arXiv:2203.02155,2022 — 關於演示和排序數據作為語言模型的監督方法。
- NIST, 人工智能風險管理框架 (AI RMF 1.0, 2023年1月)。
- 配套指南:大規模多模態數據標註如何運作 和 您應從標註供應商處要求何種準確率標準?