跳轉到主要內容
AI 數據

模型輔助標註與主動學習:預標註何時有助於決策,何時導致偏差

簡短回答。這兩個決策是獨立的,被合併在一起。主動學習決定將哪些未標註項發送給標註;預標註決定標註員……

Mumu D. · 2026年9月1日 · 閱讀約 8 分鐘

簡短回答。 這是兩個獨立的決策,被合併在一起。主動學習決定哪些未標註項目需要送交標註;預標註決定標註員在項目到達時看到的內容。關於預標註的證據確實積極——一項臨床命名實體識別研究發現,每個實體的時間節省為13.85%至21.5%,且標註一致性或標註員表現無顯著差異——但有一個關鍵前提:經過預標註流程後產生的錯誤是系統性的,而人工標註的錯誤是隨機的,且一致性評分可能因每個標註員都看到相同的建議而高估了質量。


為何將選擇與預標註分開?

因為它們在相反方向上失效。一個會扭曲您數據集中存在的示例;另一個會扭曲這些示例標籤的內容。

主動學習基於一個簡單原則:如果戰略性地選擇最具有信息量的樣本進行訓練,模型就能在較少標註樣本的情況下達到較高的準確率。與其隨機標註文檔以構建全面語料庫,學習者會主動挑選那些預期能為其帶來最大收益的實例——通常通過不確定性採樣實現,該方法測量模型對未標註樣本的置信度,並向置信度最低的樣本發起查詢。

預標註是一種完全不同的干預方式。一個訓練好的模型首先進行推理,標註員隨後收到一個已填充的界面,可以接受、修正或拒絕這些標註。兩者結合效果良好,但需要分別進行評估:一種主動學習策略若過度採樣特徵空間中的某一個區域,會導致訓練集無法代表底層數據分佈;而一個微小錯誤的預標註則會產生一個標註員從未獨立考慮過的標籤。這些問題在對方的評估指標中均不會顯現。


預標註在什麼情況下真正有益?

在高吞吐量、需求明確的任務中,當已有勝任的模型存在,並且實際收益可被測量時。

最強有力的證據來自一項JAMIA研究,該研究從1400條隨機選擇的臨床試驗公告中構建了黃金標準,對診斷、體徵、症狀和臨床編碼進行了雙重標註,預標註採用基於詞典的方法,並通過F值、方差分析和Bonferroni校正進行測試。

另一項研究在更困難的任務上得出了兼容的結論。研究分析了依存句法標註——屬於中等複雜度,預標註使用高精度解析器完成——研究人員發現預標註是一種高效的工具,能夠加快人工標註進程,並提升最終標註的一致性,而不會降低其質量。早期Penn Treebank的研究也指向相同方向,半自動方法不僅顯著減少了標註時間,還提升了標註員間的一致性和準確性。

因此,效率方面的論點得到了充分支持。關鍵的細微差別在於,'質量'是通過何種指標來衡量的。


它們在什麼情況下會偏移數據?

當模型以一致的方式自信地錯誤時,且僅使用一致性來檢查時

預標註何時有幫助,何時會引入偏差

  • 任務定義清晰且標籤集穩定

  • 模型在某個子群體上系統性錯誤

  • 已存在一個勝任的模型或詞典

  • 任務具有主觀性——如情感、毒性、偏好

  • 工作量大且重複性高

  • 遺漏很重要:缺失的片段是不可見的

  • 錯誤是可見的——錯誤的片段在屏幕上是顯而易見的

  • 每一位標註員看到的都是相同的建議

  • 標註員被訓練去拒絕,而不僅僅是接受

  • 質量僅通過一致性的判斷來衡量,模型負責輸入文本的打字。

預標註錯誤是系統性的;僅由人類產生的錯誤是隨機的。系統性錯誤在平均後依然存在。

每個實體節省13.85%至21.5%的時間,一致性在93.4%至95.5%之間。

有兩個發現值得一起閱讀。第一,測量問題:許多研究通過標註前的互評一致性來推斷高質量,但當多個標註員受到相同預標註影響時,這種測量方式可能會高估質量。兩個標註員因為都接受了相同的模型建議而達成一致,並不能構成獨立的驗證。第二,錯誤形態問題:源於預標註流程的錯誤呈現出更系統性的模式,而僅由人類完成的標註錯誤則更偏向隨機——隨機錯誤在整體上會被抵消,而系統性錯誤則直接傳遞給模型。

這種認知機制也已被記錄下來。人工參與閉環的審核並非中立的過濾器;它會引入額外的偏見,因為標註員自身也帶有認知偏見。一項在真實胰腺癌數據集上模擬行為偏見(包括錨定效應)的實驗發現,當人類決策受到這些偏見影響時,分類性能顯著下降,相較於一個無偏見的參考案例。錨定效應正是一個被填充的屏幕所引發的。


你應該如何選擇下一個要標註的內容?

刻意地,並確保你所選擇的數據集仍然與現實世界相符合。

選擇策略,以及每種策略所帶來的代價 STRATEGY 選擇方式 所承擔的風險 評估 RANDOM SAMPLING 從池中均勻採樣 效率低下 —— 將預算花在模型本已掌握的示例上 你的基準集和對照集 UNCERTAINTY SAMPLING 模型置信度最低;位於決策邊界附近的點 過度或不足採樣,導致訓練集代表性不足 高效,但需關注覆蓋範圍 DIVERSITY / GRADIENT-BASED 批量選擇,平衡信息量與在空間中的分佈 更高的計算開銷;仍無法保證子群體覆蓋 適用於批量標註 HYBRID + SEMISUPERVISED 活躍查詢加上未標註數據迴流到學習過程中 增加了流程複雜性 已證明可減少採樣偏差的影響 證據並非單方面:一項實證研究發現,使用深度模型後驗熵進行活躍集選擇,對採樣偏差和查詢規模及策略選擇具有魯棒性,與早期文獻結論相反。請在自己的數據上進行測試,而非假設結果成立。

複合風險值得明確指出。主動獲取假設其收集的標籤是可靠的,但許多主動學習應用依賴於人類生成的標籤,而這些標籤極易存在偏差——關於在標籤偏差下主動數據獲取的研究指出,數據量增加反而可能導致模型偏離,而非改進。數據量無法糾正有偏的選擇規則;反而會強化這種偏差。

針對多語言項目再增加一條警示:用於預標註的模型幾乎總是對低資源語言表現更差,因此在英語中節省20%時間的同一流程,可能在其他語言中悄然將標註員鎖定在錯誤建議上。在啟用預標註前,必須對每種語言的模型進行評估,並由母語者審查被接受的標籤,這正是Lifewood在50多種語言和方言中應用的人工參與閉環紀律。

在信任預標註模型之前,必須對其錯誤分佈進行評估,按類別和子群體劃分——一個整體準確率為92%的模型,可能在真正重要的案例上僅達到40%的準確率。

保留一個盲法對照集。有一部分數據應從頭開始標註,不使用任何建議,並進行對比。這是唯一能檢測到‘錨定’現象的方法。

不要僅憑一致性來判斷預標註數據。共享建議會人為抬高一致性;應將其與獨立標註的參考數據的準確性結合使用。

將接受率作為預警信號進行跟蹤。接近100%的接受率意味著標註員已停止審查。

保持隨機抽樣的參與。在活躍查詢旁邊加入一個隨機切片,可以保持一個具有代表性的視角,併為你提供一個無偏的評估集。

審查覆蓋範圍,而不僅僅是準確性。在每次獲取輪次後,檢查所選集合是否仍然覆蓋你的子群體、語言和罕見類別。

對於主觀性任務,關閉預標註。情感、毒性及偏好判斷是錨定效應造成最大損害且表現最差的領域。

按語言分別評估預標註模型。僅在模型已證明其能力時才啟用建議。


關鍵要點

  • 主動學習決定哪些數據需要標註;預標註則塑造標註員所看到的內容。應將二者分別進行評估。
  • 預標註在一項包含1400份臨床文檔的命名實體識別研究中,為每個實體節省了13.85%至21.5%的標註時間,標註者間一致性(IIA)為93.4%至95.5%,且在一致性和性能方面無統計學顯著差異。
  • 在依存句法標註方面,預標註提升了標註一致性,而未降低質量;賓州樹庫研究也發現了類似的時間、一致性和準確性提升。
  • 需要注意的是:當所有標註員看到相同的建議時,一致性可能會高估實際質量。
  • 預標註錯誤是系統性的,而僅靠人工的錯誤是隨機的——系統性錯誤在聚合後依然存在。
  • 在主動學習循環中模擬錨定效應及相關偏差,顯著降低了模型準確性,相較於無偏參考基準。
  • 不確定性採樣可能導致區域過度或不足採樣,產生不具代表性的訓練集;半監督方法已被證明可緩解這一問題。
  • 證據存在矛盾:在一項大規模實證研究中,深度模型的後驗熵採樣被證明對採樣偏差具有魯棒性,因此需在自己的數據上進行測試。

資料與進一步閱讀

常見問題

直接測量結果顯示不會——臨床命名實體識別和依存句法研究均未發現質量下降,後者的一致性反而有所提升。一個開放性問題是,當標註員共享相同建議時,基於共識的指標是否能完全反映質量。

從頭開始對一個預留的子集進行標註,且不提供任何建議,然後將其與相同項目的預標註輸出進行對比。

不會。在主動學習範式中,採樣偏差是一個已知問題,但一項大規模實證研究發現,後驗熵選擇在不同查詢規模和策略下均具有抗性。應將其視為一個可測量的屬性,而非默認假設。

你可以這樣做,但錯誤是相關的:模型會選擇它感到不確定的項目,然後在這些項目上直接向標註員提供自己的猜測作為錨點。保留一個隨機切片和一個盲控集作為抵消項。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊