簡短回答。 在謹慎使用中,labelling 是為整個記錄分配一個類別或值——這條消息是一條賬單查詢,這張圖片是在室內——而 annotation 是一個更廣泛的概念,涵蓋標籤及其結構:信號出現的位置、它所具有的屬性、發生的時間、與其他內容的關係,以及判斷依據。在商業使用中,這兩個詞是可互換的,而供應商使用它們的不一致性足以讓買家無法明確自己究竟在購買什麼。實際後果是,術語本身並非規格說明,無法在不同報價之間進行比較。可以比較的是輸出結構:幾何結構、屬性集合、邊緣案例規則以及審核標準。把這些寫下來,術語問題就消失了。
兩家供應商描述相同的工作流程時會使用不同的術語,而同一供應商在同一頁面上也會同時使用這兩個詞。這並非迴避——而是不同模式、工具和公司歷史之間真實存在的術語漂移。只有當買家將某個詞當作定義交付成果時,它才會變成商業問題,此時報價不再可比,範圍爭議便開始出現。
為什麼這兩個術語會被互換使用?
兩者都描述了在原始數據上添加監督,且每一個標註任務本質上也是標註任務。一個團隊將圖像標記為"貓"或"狗",就是在進行標註。在大多數使用場景中,兩者之間的區別在於粒度:
- 標註通常描述對整個記錄的決策,該決策來自一組固定的選項。
- 標註通常描述對記錄的部分的決策,或者對帶有額外結構的決策——一個跨度、一個多邊形、一個時間戳、一個屬性、一個關係、一個理由。
請注意,美式拼寫labeling和英式拼寫labelling是同一個詞,兩者都沒有技術上的區別。同一市場中的供應商都使用這兩種拼寫。
在實際應用中,術語的差異主要體現在模態上,而這很大程度上是歷史原因造成的:
| 模態 | 通常使用的詞 | 原因 |
|---|---|---|
| 圖像和視頻 | 標註 | 輸出幾乎總是包含位置信息,而不僅僅是類別 |
| 語音和音頻 | 轉錄,或標註 | 輸出是帶有時間戳的文本流,而不是一個類別 |
| 文本 | 兩者,大致均等 | 文檔分類是標註;實體抽取是標註 |
| 表格形式 | 標註 | 按記錄級別設定目標 |
| 大語言模型輸出審核 | 評估、評分或標註 | 目標是一個判斷,而非輸入屬性 |
當這種區別確實包含真實信息時
有一個地方,這種差異並非表面現象,而這正是它在商業上仍然重要性的原因:兩者意味著不同的可計費單位。
一個記錄級別的標籤按每條記錄計價,價格穩定,因為每條記錄的處理時間大致相同。而子記錄標註則按對象、按跨度或按小時計價,成本由密度驅動——即圖像中的對象數量或文檔中的實體數量——這些在文件列表中外觀相同的資產之間差異巨大。
因此,一個報價按圖像計費卻未詢問您平均每個圖像中的對象數量的供應商,實際上只是基於假設而非您的實際工作量。任何進行報價比較的人應先閱讀如何比較標註供應商報價和標註定價模型,在進行標準化之前,因為計價單位正是報價差異的主要來源。
規範中實際需要表達的內容
用八個字段替代該術語。如果八個字段都填寫完整,各方無需就詞彙達成一致;如果任一字段為空,則合同中的詞語將由各方以不同方式填寫。
- 輸出結構。 一個交付項的字面結構——字段名稱、類型、允許值。這不是對其的描述:是結構本身。
- 幾何結構或粒度。 整個記錄、跨度、框、多邊形、掩碼、關鍵點、長方體、時間範圍,或候選項中的排名。
- 分類體系。 類別列表,每個類別配有包含與排除測試,而非一條簡短描述。
- 屬性。 附加到實例上的可選屬性——遮擋、截斷、可見性、置信度、方言、說話者角色。屬性是記錄真實區別的方式,而標註員無法一致地將其作為類別應用。
- 邊緣情況規則。 部分可見對象、重疊語音、混合語言文本、意圖模糊等情況下的處理方式——並且關鍵的是,標註員在真正不確定時應如何操作。帶有跳過並標記路徑且有仲裁機制的方案,優於強制猜測,後者會製造噪聲並掩蓋它。
- 密度預期。 每個資產中對象、實體或語句的平均數量和範圍。這個數值決定了成本。
- 質量標準。 指標、閾值、雙標註工作的重疊率,以及誰來裁決分歧。
- 格式與交付。 文件格式、座標約定、編碼、數據劃分結構,以及數據配套的內容——指南版本、協議圖表、來源追溯。
那份列表背後有兩個經驗法則。 不要收集模型永遠不會使用的細節 —— 每增加一個字段都會帶來成本,並增加不一致性的機會。而且 在擴大規模前,先在一小部分刻意多樣化的樣本上原型測試方案:如果訓練過的評審員無法一致地應用指令,說明分類體系需要修訂,而這種發現是在五十個樣本之後才出現,不過是早晨的工作,而非一次重新評審項目。
項目實際需要的是什麼?
從模型必須預測的內容倒推。
| 如果模型必須... | 你需要 | 按價格計 |
|---|---|---|
| 為一條完整記錄選擇一個類別 | 記錄級標註 | 每條記錄 |
| 找到某內容並說明其位置 | 定位標註 | 按對象 |
| 跨時間跟蹤某內容 | 具有持久身份的時間標註 | 每個對象每序列,或每小時 |
| 將兩件事關聯起來 | 關係標註 | 每份文檔,通常每小時 |
| 判斷輸出是否良好 | 評分標準或偏好排序 | 每項比較 |
| 解釋為何做出該判斷 | 帶有理由的標註 | 每項內容按最高費率計算 |
最底層的兩行是企業支出轉移的主要方向,而在此處‘標註’這一概念也最不適用——沒有人對任何內容進行分類。評估員是將評分標準應用於開放性輸出,其質量問題在於獨立評估員之間是否達成一致,而非標籤本身是否正確。這部分工作在 購買指南:RLHF、SFT 或蒸餾 中有單獨說明。
當詞彙體系不同時,如何比較供應商
忽略標題術語,轉而比較運營方式。六個方面可以明確判斷,且其中任何一個都不要求供應商使用你的術語:
- 一個可比項目的交付樣本文件,因此其結構可見而非僅被描述。
- 該項目的評審說明,包括邊緣情況部分——這部分在項目過程中不斷擴展,是項目產出的最高價值成果。
- 質量方法:重疊率、指標、閾值、仲裁路徑、黃金標準集註入。
- 預標註階段:哪些環節是自動化的,置信度如何,以及是否保留未輔助的控制批次。
- 升級流程 用於不確定和超出範圍的項目。
- 指南變更的響應週期,因為生產標註是迭代的,響應速度比初始速率更為重要。
紅燈信號: 一個提案通過重新陳述你的術語來回答你的規範。這意味著供應商同意的是術語而非交付成果,且分歧被推遲到了第一個爭議批次,而非被避免。
Lifewood的應對方式
Lifewood 的工作範圍基於輸出模式而非服務名稱——包括幾何結構、分類體系(含包含與排除測試)、屬性集、邊緣案例裁定路徑,在首個批次之前即達成一致,並隨著裁定的積累進行版本化。質量標準按任務類型分別陳述,而非單一數值,且人工參與閉環審查的準確率要求達到 95%+。
範圍涵蓋分類、記錄級標註,直至分割、追蹤、轉錄、關係抽取以及大語言模型響應評估,覆蓋 50+ 種語言 和 40+ 個交付中心,分佈在 30+ 個國家,擁有 56,788 名註冊貢獻者——這對需要依賴母語使用者聽讀材料進行判斷的任務尤為重要。AI 數據遺產可追溯至 2004 年,當前公司成立於 及 2018 年。
參見 全球AI數據、AI數據服務、質量保證流程 和 AI數據驗證。
資料與進一步閱讀
- NIST,人工智能風險管理框架(AI RMF 1.0,2023年1月)——關於生命週期內數據決策的記錄。
- 配套指南:如何比較標註供應商報價 和 數據標註定價模型。