簡短回答。 人工參與閉環標註並非‘一個人檢查所有內容’——它是一種路由設計,即機器處理其能夠自信解決的內容,其餘內容則被提升至匹配難度的人類層級。決定該設計是否有效的是置信度閾值的設定,而這一設定本質上是經濟決策而非技術決策:當機器出錯的概率乘以該錯誤的成本超過審核成本時,才進行審核。該閾值根據類別、風險等級和市場不同而有所差異。默認情況下,閾值由工具提供商設定,導致審核流程要麼處理本無需審核的內容,要麼導致本應被攔截的錯誤被髮送出去。
所有超過一定規模的標註項目本質上都是混合型項目。值得關注的問題並非是否要自動化,而是應優先自動化哪些工作、在何處實現交接、誰在人工側參與,以及審核後的修正內容將被如何利用——而這恰恰是大多數項目完全浪費的部分。
人工參與閉環實際上意味著什麼
關鍵特徵是:流程遇到不確定項時,未經人工決策就不能完成,而且必須記錄該決定。這不同於事後由人審核輸出,後者是檢查而非閉環;也不同於讓人審核所有內容,後者根本沒有對流程作出設計。
一個有效的手動參與閉環(HITL)管道包含四個關鍵組成部分:
- 一個置信度信號。 機器在提供答案的同時生成的某種信號,其強度與答案正確性相關。若缺乏該信號,路由決策將變得任意無序。
- 一個閾值,或多個閾值——按類別、風險等級、市場劃分。
- 一個分級的人工審核結構,使得複雜問題與僅存在不確定性的項目不會消耗同一位審核員。
- 一個反饋路徑,因此修正會改變指南、模型或路由,而不僅僅是單條記錄。
大多數項目通常只構建前三個部分,而跳過第四個,這使得質量保證變成了一個持續性的成本,而非逐漸減少的成本。
置信度閾值應設置在何處?
這是整個設計,應該明確闡述而非繼承。
轉交人工的條件:機器出錯概率 × 錯誤成本 > 審核成本
有三件事立即隨之而來,而所有這三點都常常被忽視。
閾值是按類別設置的,而不是按管道設置的。 一個誤分類的產品標籤和一個漏檢的行人,其錯誤成本並不相同,因此它們不應共享一個閾值。設置一個全局閾值意味著對低成本類別進行過度審查以保護高成本類別,從而在所有地方都付出代價。
當錯誤成本發生變化時,閾值也隨之變化。 一個安全關鍵型部署、一個受監管的市場、一個新客戶群體、一個高風險時期——每一個都會改變比較的右側部分,而不會改變模型本身。閾值應由承擔風險的人來調節,而不是由構建集成的人在配置文件中固定下來。
審查成本也不是恆定的。 專家審查的成本是普通審查的數倍。將一個項目路由到錯誤的層級是一種真實成本,這正是支持分層級而非單一審查隊列的理由。
當錯誤成本真正未知時,退而求其次的做法是將閾值設得較高,測量覆蓋率,然後逐步降低閾值,直到覆蓋率變得罕見——這是一種經驗性的方法,至少能產生一個可辯護的數值,而不是一個默認值。
自動化應該優先處理什麼?
自動化那些可以明確表述為規則且能被確定性驗證的內容。這項工作並不引人注目,但幾乎所有的可靠節省都來自這裡:
- 模式符合性、缺失字段、無效範圍和枚舉值
- 文件完整性、分辨率、時長、採樣率、編碼
- 重複和近重複檢測
- 明顯異常值以及空或截斷的記錄
- 直接的初步標註,其中置信度高且類別明確無歧義
- 優先級設定本身——通過置信度或新穎性對隊列進行排序,使有限的評審員時間被用於真正改變答案的環節
最後一條是使用最少的。即使自動化無法對任何內容做出判斷,它也可以決定首先查看什麼,而在大量積壓任務中,這一點本身就改變了人工層的經濟性
邊界值得明確指出:自動化應負責分類,而非製造確定性。 一個模型在從未見過類似內容的情況下報告高置信度,實際上只是生成了一個數字而非一個判斷,而若路由規則不包含分佈外檢測就信任該模型,就會將所有新穎案例直接繞過人工審核。
還有一項成本被記錄下來且容易被忽視。標註員看到一個合理的機器建議時,會比在沒有提示的情況下更頻繁地接受它,而這種影響在模糊項上尤為明顯,因為人工環節正是關鍵所在。保持未受協助的控制批次以測量差異,不要展示低置信度的猜測,而是予以抑制;將極高的‘無需修改即接受’率視為警告而非效率成果。相關機制在 大規模多模態數據標註 中有詳細說明。
人類層級應該如何分級?
將所有內容發送到一個審核池,意味著要麼為常規工作支付專家費用,要麼對專業內容應用一般性判斷。分級結構會為每個決策定價,使其反映實際所需。
| 分層 | 處理 | 由決定 | 優化用於 |
|---|---|---|---|
| 1 — 生產審核 | 低於置信度閾值的項目;普通模糊性 | 經過訓練的一般化標註員 | 快速實現一致的指導原則應用 |
| 2 — 仲裁 | 一級標註員之間的分歧;標記出不確定性 | 高級評審員 | 正確性,以及將模糊性轉化為裁決 |
| 3 — 專家 | 領域依賴的判斷:臨床、法律、金融、工程、方言特定 | 經驗證的專家 | 一般專家無法評估的正確性 |
| 4 — 指南 | 無先例的新型案例 | 指南負責人 | 存在回溯至文檔的先例 |
有兩個特性使這成為一個系統而非升級階梯。 第4級決策必須回溯到指南 —— 一個未被記錄下來的新情況,由某人本週解決,下一週就會被另一個人以不同方式解決。而且 專家時間應花在黃金示例和裁決上,而不是在數量上,因為一個經過裁決的判例配以具體示例,能改善後續每一個項目,而一個專家標註的記錄僅能改善一個記錄。
當標籤本身需要專業知識,而審查人員通常不具備這種知識時,就需要領域專業知識——例如具有特定領域含義的術語、有順序要求的程序、特定司法管轄區的規則、方言判斷。對於明確的任務,一般審查員完全足夠,而將專家用於所有情況,是HITL預算最常見被浪費的方式。
需要衡量的內容
五個數值,按類別和市場分別報告,而非彙總報告。
| 指標 | 定義 | 它所傳達的信息 |
|---|---|---|
| 自動化率 | 無需人工審查的項目數 ÷ 總項目數 | 該流程在經濟上是否可行 |
| 升級率 | 高於一級層級的項目數量 ÷ 審核項目總數 | 指南或分類體系是否規定不足 |
| 覆蓋率 | 人類修改了機器答案的項目數量 ÷ 審核項目總數 | 閾值是否設置得當 |
| 裁決工作量 | 發送至高級審核員的項目數量 ÷ 標註項目總數 | 項目定價錯誤的最早信號 |
| 缺陷類別分佈 | 按原因的修正份額 | 應在流程層面而非記錄層面進行修復 |
人工修改率 = 人工修改的數據項數 ÷ 人工審核的數據項數
覆蓋率為管道中最少計算的診斷指標,且其讀取方向雙向。 在大量審核樣本中,覆蓋率為低意味著閾值過於保守——人類在確認機器答案時,這些答案本已正確,這純粹是成本浪費。覆蓋率為極高則意味著閾值過於寬鬆,或預標註模型對某類任務不適用。這兩個指標均無法從吞吐量報告中獲取,但均可在一週內採取行動。
追蹤缺陷 類別 而非通過/失敗率。錯誤類型的上升指向具體原因:輸入數據漂移、新用戶行為、某語言中指南表述模糊、模型在某類任務上的弱點。
修正項的後續處理
每一次人工修正,都是機器判斷錯誤的標註示例,由具備資質的人完成。這是管道中最寶貴的數據,而在大多數項目中,這些數據被寫入輸出文件後便被遺忘。
四種用途,按回報程度由低到高排序:
- 修正記錄。 最基本的,也是大多數程序都會採用的方案。
- 在修正集上重新訓練預標註模型,從而提升在原本耗費人工審核時間的案例上的自動化率。
- 修改指南,當修正反映出的是模糊性而非錯誤時——這可以防止該問題在所有標註員之間反覆出現,而不是逐個修復。
- 進行有針對性的數據收集。 一個反覆出現的修正類別通常表明訓練數據中對該條件的覆蓋不足,而該類別會精確地命名這一條件。
判斷一個‘人工參與閉環’項目是系統還是成本中心的標準,是其自動化率是否隨時間上升。如果在前幾個月之後,審核量的增長比例與輸入量的增長比例一致,那麼回報路徑就未被打通。
Lifewood的應對方式
Lifewood 將人工審核視為一個設計好的層級,而非最終關卡:基於置信度的路由進入分層工作團隊,由資深人員進行裁決並形成指南性裁決,而非單次修正;並且設有雙重層級的人工參與閉環質量保證,要求準確率達到 95%以上,並跟蹤缺陷類別而非單一通過率。
在專業領域和多語言層級,交付模式最為關鍵,因為判斷無法通過通用方式獲取。 50多種語言, 覆蓋30多個國家的40多個交付中心 和 56,788 名註冊貢獻者,使審核員能夠基於母語使用者的聽讀體驗做出決策,而 414,120小時 的2025年孟加拉國員工培訓時間,確保了在用戶群體更迭時指南應用的一致性。此處的結構性要求是:採用自有交付中心的管理型勞動力,而非開放眾包。因為判斷的積累需要數月時間,一旦人員離職便隨之消失。AI-數據遺產可追溯至2004年,公司目前成立於2018年。
資料與進一步閱讀
- Ouyang等,《通過人類反饋訓練語言模型遵循指令》,arXiv:2203.02155,2022年。
- NIST, 人工智能風險管理框架 (AI RMF 1.0, 2023年1月)。
- 配套指南:大規模人工參與閉環內容審核 和 大規模多模態數據標註如何運作。