簡短回答。 四種任務類型主導文本標註,且每種類型失敗方式不同。命名實體識別(NER)在跨度邊界和模糊類別上出錯。情感分析在諷刺、混合觀點和領域上下文上失效。意圖識別在類別重疊和混亂的對話語言上失敗。關係標註在隱含和方向性鏈接上出錯。好消息是,這些問題已有成熟的解決方案,只要具備適當的培訓、工具和迭代指南,標註員之間就能實現高度一致——一項關於德語關係標註的研究達到了Cohen's κ為0.92的水平。
這四種任務類型是什麼?
不同任務採用不同的標籤結構——而從一開始就選擇合適的結構,是使流程順暢且模型準確的關鍵。
文本標註沒有通用解決方案。命名實體識別(NER)是一項詞元級別的工作,通常採用開始-內部-外部(BIO)方案進行標註,它支撐著信息檢索、問答系統和事件提取。情感分析分配極性,或在更豐富的方案中,明確表達諸如喜悅、憤怒或挫敗等離散情緒。意圖分類確定說話者的需求,驅動虛擬助手和客服路由。關係標註對自由形式的文本片段及其相互關聯進行標註,是知識圖譜構建的基礎。
文獻中的一個鼓舞人心的發現是:難度並非命運。關於在電子健康記錄中標註神經學體徵的研究——此前研究曾認為這類任務的共識度會很低——發現,在經過對標註流程、工具和支撐本體的培訓後,三位標註員在文本片段和類別標籤上的相互一致性均很高。作者得出的結論值得在任何項目中採納:通過適當的培訓和標註工具,人類標註員之間可以達到高水平的一致性。
每種任務類型中,標註員最容易在哪裡出錯?
可預見且不同——這正是為什麼一套指南無法適用於所有四種任務類型。
四種任務類型及其典型失敗點 任務 類型中標註員最容易出錯的地方 修正建議 判斷結論 NER 文本片段邊界、嵌套實體、部分詞元選擇,以及‘PER’、‘LOC’和‘ORG’等通用類別的表現普遍優於‘MISC’類 逐詞控制文本片段邊界;取消或拆分‘MISC’類別;對每個實體計算F1分數以識別薄弱類型 通過設計標註方案可解決 SENTIMENT 俏皮話、混合觀點、文化差異以及中性邊界;醫療領域的情感與零售領域情感不同 明確定義正/負/中性類別,並提供邊緣案例示例;提供領域特定指導 四種任務中一致性最低的 INTENT 類別重疊或高度相似;口語表達增加了不連貫性、中斷和隱含的填充語句 採用互斥的類別定義;為真正的模糊情況設置標記並升級處理 通過標註方案的規範性可解決 RELATION 隱含與顯式關係、方向性,以及長文檔中‘無關係’或中性關係的普遍主導現象 首先制定關於隱含關係的規則;顯式標註否定關係;使用F1而非κ來評估關係質量 最難、價值最高 標註質量設定了上限:當標註員之間的一致性達到80%時,模型達到83%的性能,已接近人類水平。
關係標註尤其值得重點關注,因為其難度在單一標註方案內部是不均勻的。在一項多語言關係抽取研究中,自動標註結果被與2000條人工標註句子進行比對:部分關係幾乎完美,而另一些則完全崩潰。
由此得出兩點啟示。第一,該方案整體的宏觀F1值為0.79,掩蓋了某個關係類別的表現僅為0.33;必須將質量指標按類別拆解分析。第二,該研究中的人類標註員達到了0.92的Cohen's κ值,所有分歧均被逐個討論並解決——強有力地證明了難題在於指南的清晰度和裁決流程,而非人類能力本身。
情感分析處於另一端。使用Krippendorff's alpha的基準研究發現,在相同語料庫中,情感分析任務的一致性低於命名實體識別任務,其實際原因在於‘中性’類別很少是清晰明確的。在一項分析文本研究中,要求標註員僅標註正或負關係時,他們實際上在內部劃分出一個第三類‘中性’類別,該類別最終主導了數據——一個偽裝成標註員問題的方案缺陷。
你應該為哪個任務使用哪個指標?
將指標與標籤結構匹配,否則你的質量分數將誤導你。
採用正確指標,避免這些誤區
- Cohen's κ — 兩名標註員,分類標籤:
情感、意圖
在命名實體識別(NER)中使用Cohen's κ — 它需要負例,並嚴重低估了共識
Krippendorff's α — 多名標註員,存在缺失數據,有序或層級標籤
報告所有類別上的一個平均分數
詞元級成對F1(排除O)— NER的正確內部一致性評估指標
關係上的F1分數 — 在關係抽取任務中,當κ指標不適用時
Gwet的AC2指標 — 當類別嚴重不平衡時;臨床數據集通常在發佈前要求α大於0.90;一般目標則接近80%的一致性水平。
數據類型對應的α設置錯誤,這可能會使結果朝任一方向產生偏差
將低分視為標註員能力不足,而非指南存在空白
僅進行一次測量而非持續對樣本進行評估;在Tweebank NER語料庫中,κ值為0.347,而適當的F1指標顯示了一致性為0.71。
實踐中存在兩個關鍵操作點。對子集持續監控一致性,能早期發現指南中的模糊之處,此時修正成本較低;指南幾乎總是需要優化,生物醫學領域的黃金標準文獻表明,通過收緊規則和建立語義等價標準,經過多次迭代後可達到可接受的一致性。同時,NER任務中的每類F1指標能精確指出標註員在哪些實體類型上存在困難,將一個模糊的質量問題轉化為有針對性的培訓環節。
多語言工作引入了一層現有指標無法捕捉的複雜性。諷刺、禮貌和否定在不同語言中表現各異,用英語撰寫的指南很少能直接遷移。本地語言專家、每種語言的試點批次以及每種語言的一致性跟蹤,正是Lifewood在50多種語言和方言中應用的人工參與閉環機制。
你應該先解決什麼?
按此順序,因為每一步都為下一步設定了更高的門檻。
在全面生產前先運行一個試點批次。使用兩名至三名標註員對相同數據進行標註,目標達成80%以上的共識,並將分歧視為你的指導性待辦事項清單。
將邊緣案例寫入指南,而不僅僅是定義。為正面、負面和中性情況明確邊界,並提供可量化的具體示例,能顯著提升標註一致性。
選擇與標籤結構相匹配的指標。對於命名實體識別(NER),使用詞元級F1;對於分類任務,使用κ或α;對於關係標註任務,則使用關係層面的F1。
將每一個質量評分按類別拆解。一個宏觀得分為0.79可能掩蓋某個關係類型僅為0.33,而某個實體類型則急劇下滑的情況。
根據領域匹配標註員。專家配對在ARFBench數據中成功通過了可接受性閾值,而非專家配對則未能達到。
先用模型進行預標註,再由人工審核。大語言模型(LLM)在基礎情感分析和分類任務中可實現低成本預標註,但在專業領域知識和主觀判斷方面表現不佳——因此應保持‘初步標註加專家驗證’的兩階段工作流程。
僅重新標註模糊地帶,而非整個數據集。將最難處理的5%至10%內容通過優化後的規則重新進行質量審核,其成本遠低於對整個數據集進行重新標註。
針對每種語言運行試點並進行一致性檢查。用一種語言撰寫的指南不能未經檢驗地直接應用於另一種語言。
關鍵要點
- 四種任務類型主導文本標註——命名實體識別(NER)、情感分析、意圖識別和關係標註——每種任務都有其特有的失敗點。
- 高一致性是可實現的:電子健康記錄(EHR)標註研究發現,在適當培訓後,標籤在跨度和類別上達到了高度一致性,一項德國的關係研究達到了κ = 0.92。
- NER在跨度邊界、嵌套實體和通用類別上容易出錯;PER、LOC和ORG在一致性上優於MISC。
- 情感分析在相同語料庫中的共識程度低於NER,主要因為中性邊界和諷刺表達規定不明確。
- 在同一個標註方案中,關係質量差異巨大——從出生日期的F1值0.99到死亡地點的F1值0.33——因此應報告每個類別的得分。
- NER使用詞元級F1,分類任務使用κ或Krippendorff的α,關係任務使用關係的F1;κ在一項NER語料庫中低估了0.347,真實值應為0.71。
- • 使用大語言模型(LLM)進行初步標註再結合人工審核對簡單任務有效,但在領域專業知識和主觀判斷方面表現不佳。
資料與進一步閱讀
- Oommen, Howlett-Prieto, Carrithers & Hier, "電子健康記錄中神經學體徵和症狀標註的評分一致性", Frontiers in Digital Health (2023), DOI 10.3389/fdgth.2023.1075771 — 通過培訓和工具支持,可實現跨度和類別上的高一致性
- "多語言關係抽取數據的引導遠監督", arXiv:2403.17143 — 每個關係的F1分數對比黃金標準集,覆蓋2000條人工標註句子,以及兩位母語者標註員之間的Cohen's κ為0.92
- "ARFBench", arXiv:2604.21199, 附錄F.1 — 域專家與非專家標註員之間的成對Cohen's κ和Krippendorff's α,以及α ≥ 0.667的可接受性約定
- "在Tweebank語料庫上進行命名實體識別的標註", arXiv:2201.07281 — 在NER中以token級成對F1作為正確的IAA度量標準,κ值為0.347低估了實際一致性,而F1值為0.71,且MISC類別比PER、LOC和ORG更難
- "在實際場景中分析數據標註質量管理體系", arXiv:2307.08153 — 關於Krippendorff's α如何處理缺失標註和多位標註員的情況,以及適用於NER和關係抽取等跨度任務的標準化α
- "從分析文本中提取情感態度", arXiv:1808.08932 — 標註員在內部應用了一個未標記的中性類別,該類別最終主導了數據
- "從生物醫學文獻中構建語義謂詞的黃金標準", BMC Bioinformatics — 在多次迭代中通過更嚴格的指南和語義等價性標準達成可接受的一致性
- Appen, "Krippendorff's Alpha如何提升數據可靠性" — 在相同語料庫中,情感分析的一致性低於NER,臨床α > 0.90的要求,以及錯誤設置會扭曲α
- HitechDigital, "文本標註中的5個關鍵質量控制指標" — κ適用於分類任務,F1適用於關係提取,針對訓練的實體級F1,不平衡情況下的Gwet's AC2,以及持續監控
- 標註您的數據,"情感分析:方法、挑戰以及2026年實際有效的解決方案" — 關於共識模型準確率的約定(80%一致,83%模型準確率),以及重新標註最困難的5%至10%
- 標註您的數據,"文本標註工具:2026年指南" 和 "文本標註:2及2026年技術" — 關於80%以上一致性的目標,雙輪標註加專家驗證,大語言模型預標註的限制,BIO方案以及逐token跨度控制。labelyourdata.com/articles/data-annotation/text-annotation-tool Annotera,"文本標註用於自然語言處理:實體識別、情感、意圖及更多" — 關於諷刺和文化差異在情感分析中的表現,以及對話中槽位填充中的不流暢表達和隱含引用
- Cogito Tech,"2026年自然語言處理數據標註詳解" — 關於指南、試點批次、多級審核、互注一致性測量、黃金標準集和人工參與閉環驗證的問答框架
- Lifewood,AI數據與標註服務
- 圖1和圖3中的圖表由Lifewood根據下文每張圖表引用的同行評審文獻中的數據製作而成。