跳轉到主要內容
AI 數據

標註員間一致性:科亨卡帕、克里普多夫阿爾法以及這些數值的含義

簡短回答。不同標註員對同一數據進行標註的一致性稱為標註間一致性。最廣泛使用的兩個指標是Cohen's kappa,它對原始一致性進行了校正……

Mumu D. · 2026年9月1日 · 閱讀約 7 分鐘

簡答。 標註員間一致性衡量不同人員對同一數據的標註是否一致。最廣泛使用的兩個指標是Cohen's kappa,它校正了兩個標註員之間因偶然性導致的原始一致性部分,以及Krippendorff's alpha,它適用於任意數量的標註員,處理缺失數據,並支持不同測量類型。兩者均產生0到1之間的數值,但關鍵閾值完全取決於具體任務,且兩者衡量的是可靠性而非正確性。得分越高,說明標註員一致;但這並不意味著他們是對的。


為什麼原始百分比一致性不夠?

因為偶然性會放大它,而偶然性放大正是你試圖衡量的問題所在。

設想兩個標註員對一個二分類任務進行標註,其中90%的項目屬於類別A。兩個標註員僅通過每次猜測類別A,就能達到81%的原始一致性,而無需真正查看數據內容。原始百分比看起來合理,但這種一致性毫無意義。

這正是Cohen's kappa最初設計要解決的問題。Jacob Cohen於1960年提出kappa統計量,專門用於衡量兩位精神科診斷師對患者症狀的評分一致性,校正了因基礎率導致的偶然性一致性膨脹問題。

在多語言標註中也存在相同的通脹問題。在情感、毒性及意圖分類任務中,一個標籤類別佔主導的語料庫,即使標註員在應用標籤時存在不一致性,也會產生較高的原始一致性。只有機會校正的指標才能揭示這一現象。


柯亨 kappa 實際上計算的是什麼?

觀測到的一致性與機會水平之比與最大可能的一致性之比。它回答的問題是:在無法由偶然因素導致的一致性中,實際達成了多少?

公式非常直接。Kappa 等於觀測一致性減去預期一致性,再除以一減去預期一致性。預期一致性是根據每個標註員標籤的邊際分佈計算得出的:如果標註員 A 對 60% 的項目打上積極標籤,標註員 B 對 55% 的項目打上積極標籤,那麼兩個獨立標註員在這些分佈下會落在相同標籤上的概率,就是預期偶然一致性。

柯亨 kappa 的取值範圍是從 -1(完全不一致)到 1(完全一致),0 表示的是偶然水平的一致性。

需要了解的關鍵侷限性:

柯亨 kappa 僅適用於恰好兩名標註員。弗萊斯 kappa 通過相同的公式結構將其擴展到多名標註員,但要求每位標註員都必須對所有項目進行標註。當弗萊斯 kappa 不適用時,例如在標註員子集可變的情況下(並非所有項目都由相同的人標註),則使用克里普多夫夫 alpha。

Kappa對標籤分佈敏感。這被稱為kappa悖論:當某一標籤在分佈中佔主導地位時,即使標註員之間一致性很高,kappa值也可能很低,因為期望的一致性非常高,而實際一致性很難超過這一水平。在分佈嚴重偏斜的任務上kappa為0.40,其背後的一致性可能與在分佈均衡任務上kappa為0.70的情況相同。

它僅在標準形式下測量名義類別。順序尺度、連續評分和範圍需要不同的處理方式。


什麼是Krippendorff的alpha,以及在什麼情況下應該使用它?

Alpha是更通用的度量標準。它能夠處理任意數量的標註員,容忍缺失數據,並適用於名義、順序、區間和比率尺度。在大規模標註流程中,它幾乎總是最佳選擇。

Klaus Krippendorff於1970年為通信研究中的內容分析開發了alpha,當時多個編碼員對媒體內容進行分類。他在2004年的正式化確立了alpha作為最通用的可靠性度量標準,能夠處理任意數量編碼員、缺失數據以及多種測量層級,這些是現實世界標註項目中常見的條件。

Alpha的計算方式是1減去觀察到的分歧與偶然情況下預期分歧的比值。與kappa的關鍵區別在於,alpha使用一個統一的分歧函數,可以根據測量尺度進行調整:相鄰順序類別的分歧權重較小,極端類別的分歧權重較大;對於連續評分,保留區間距離;對於名義類別,所有不匹配情況被同等對待。

Krippendorff的alpha是一個數據集級別的度量,用於量化不同標註員之間的可靠性。與其他一致性度量不同,它特別適用於混亂、真實世界的數據集,其中並非所有標註員都對每個項目進行評分。

何時使用哪種方法:

當只有兩個標註員、名義類別且需要成對一致性檢查時,使用Cohen的kappa。當超過兩個標註員且所有標註員都對每個項目進行了標註時,使用Fleiss的kappa。對於其他所有情況,使用Krippendorff的alpha:大規模標註池中存在部分重疊、順序或連續尺度、存在缺失數據,或需要一個在不同任務結構間可比的單一度量標準。

在生產級多語言標註中,alpha 幾乎總是最佳選擇,因為標註員的分配很少是均勻的。


你如何理解這些數字?

需仔細閱讀,並參考具體任務。閾值源自 Landis 和 Koch(1977)對 kappa 的定義;Krippendorff 對 alpha 的標準則更為保守。

對於 Cohen 的 kappa:0.0 到 0.20 為輕微,0.21 到 0.40 為公平,0.41 到 0.60 為中等,0.61 到 0.80 為顯著,0.81 到 1.00 為幾乎完美的共識。根據 Randolph(2008)的另一種約定,低於 0.40 為較差,0.40 到 0.75 為中等至良好,0.75 及以上為優秀。

Krippendorff 建議對 alpha 小於 0.667 的數據持謹慎態度,對小於 0.800 的數據則認為不可靠用於得出結論,儘管可接受水平取決於具體任務。

一個 kappa 值為 0.60 在不同任務中含義不同。在毒性分類的模糊邊緣案例中,當專家語言學家對相同示例存在分歧時,0.60 可能反映的是任務本身的難度,而非標註員的失誤。而對於明確的二分類任務,0.60 則應引起擔憂。

真實的標註報告通常將總體指標與各分類的細分數據及混淆矩陣結合呈現,因為這些數據能揭示分歧的具體位置,而不僅僅是分歧的總量。


分歧實際上告訴我們什麼?

它告訴你任務在哪些地方是模糊的,指南在哪些地方是不明確的,有時類別本身是錯誤的。分歧是信息,而不僅僅是失敗。

對超過100個自然語言處理數據集論文的標註質量實踐分析發現,質量保證通常被嚴重低估。大多數論文僅報告一個總體的標註者間一致性(IAA)數值,而沒有提供按類別細分的分解數據,這些數據能夠揭示哪些標籤引發了分歧。這隱藏了真正能提升數據集質量的信息。

系統性分歧通常意味著三點:

指南模糊性。在同一個類別上持續出現分歧,說明指令不明確。解決方法是更新指南並重新標註有爭議的項目,而不是進行性能討論。

類別設計問題。持續的分歧可能意味著某個標籤混淆了兩個截然不同的概念,或者邊界被錯誤地劃定。

真實任務難度。對於情感、諷刺和反諷等主觀性任務,標註者間一致性(IAA)衡量的是任務的爭議程度,而非標註質量。保留數據集中的分歧可能比強行達成共識更有用。

在多語言標註中,某語言分歧高而另一語言分歧低,可能表明某個類別在翻譯上存在問題,或某個文化概念無法清晰映射。單一的總體IAA數值無法揭示這一點;需要按語言細分的分析,例如Lifewood的人工參與閉環模型所生成的分析。


關鍵要點

  • 原始的百分比一致率會被偶然因素誇大;Kappa和Alpha係數對此進行了修正。
  • 柯亨卡帕係數僅適用於名義類別的兩個標註員,通過從觀察到的一致性中減去預期的偶然一致性來計算。
  • 卡帕悖論:當標籤分佈傾斜時,即使標註員之間一致,卡帕值也會很低,因為預期的偶然一致性本已很高。
  • 克里普多夫阿爾法系數可處理任意數量的標註員,能夠容忍缺失數據,並適用於名義、有序、區間和比率尺度。
  • 蘭迪斯和科奇(1977):0.0到0.20為輕微,0.21到0.40為公平,0.41到0.60為中等,0.61到0.80為顯著,0.81到1.00為幾乎完美。
  • 克里普多夫建議將0.800作為可靠結論的最低標準,並對低於0.667的數據保持謹慎態度。
  • 相同的評分在不同難度的任務中含義不同。始終在主要指標之外報告各類別細分結果。
  • 系統性分歧可以揭示指南模糊性、類別設計問題或真正的感知難度;保留這種分歧可能比強行達成共識更有用。
  • 按語言的標註一致性(IAA)細分可以揭示在不同語言之間翻譯效果不佳的類別。
  • 超過100篇自然語言處理數據集論文被發現經常遺漏質量保證信息。

資料與進一步閱讀

常見問題

Cohen's kappa僅適用於恰好兩個標註員和名義類別,而Krippendorff's alpha可推廣到任意數量的標註員,能夠處理缺失數據,並適用於不同測量尺度。在大規模標註流程中,alpha幾乎總是最佳選擇。

這取決於具體任務。Landis和Koch的量表將0.61到0.80定義為顯著,0.81及以上為幾乎完美,但Krippendorff建議可靠結論的最低門檻為0.80。對於難度大、主觀性強的任務,分數可能較低,但並不表示標註失敗。

當某一標籤佔主導地位時,預期的偶然一致性較高,因此即使標註員一致,kappa也可能較低。這在偏斜數據集上會低估可靠性。

不是。它通常表明指南模糊或分類設計存在問題。在主觀任務上真正存在的感知分歧,可能值得保留而非強行達成共識。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊