跳轉到主要內容
AI 數據

自然語言處理中的文本標註:實體識別、情感、意圖和關係標註

簡短回答。四種任務類型主導文本標註,且每種任務失敗方式不同。實體識別在跨度邊界和模糊類別上失效。情感分析在諷刺、混合觀點……上失效。

Mumu D. · 2026年9月1日 · 閱讀約 8 分鐘

簡短回答。 四種任務類型主導文本標註,且每種類型失敗方式不同。命名實體識別(NER)在跨度邊界和模糊類別上出錯。情感分析在諷刺、混合觀點和領域上下文上失效。意圖識別在類別重疊和混亂的對話語言上失敗。關係標註在隱含和方向性鏈接上出錯。好消息是,這些問題已有成熟的解決方案,只要具備適當的培訓、工具和迭代指南,標註員之間就能實現高度一致——一項關於德語關係標註的研究達到了Cohen's κ為0.92的水平。


這四種任務類型是什麼?

不同任務採用不同的標籤結構——而從一開始就選擇合適的結構,是使流程順暢且模型準確的關鍵。

文本標註沒有通用解決方案。命名實體識別(NER)是一項詞元級別的工作,通常採用開始-內部-外部(BIO)方案進行標註,它支撐著信息檢索、問答系統和事件提取。情感分析分配極性,或在更豐富的方案中,明確表達諸如喜悅、憤怒或挫敗等離散情緒。意圖分類確定說話者的需求,驅動虛擬助手和客服路由。關係標註對自由形式的文本片段及其相互關聯進行標註,是知識圖譜構建的基礎。

文獻中的一個鼓舞人心的發現是:難度並非命運。關於在電子健康記錄中標註神經學體徵的研究——此前研究曾認為這類任務的共識度會很低——發現,在經過對標註流程、工具和支撐本體的培訓後,三位標註員在文本片段和類別標籤上的相互一致性均很高。作者得出的結論值得在任何項目中採納:通過適當的培訓和標註工具,人類標註員之間可以達到高水平的一致性。


每種任務類型中,標註員最容易在哪裡出錯?

可預見且不同——這正是為什麼一套指南無法適用於所有四種任務類型。

四種任務類型及其典型失敗點 任務 類型中標註員最容易出錯的地方 修正建議 判斷結論 NER 文本片段邊界、嵌套實體、部分詞元選擇,以及‘PER’、‘LOC’和‘ORG’等通用類別的表現普遍優於‘MISC’類 逐詞控制文本片段邊界;取消或拆分‘MISC’類別;對每個實體計算F1分數以識別薄弱類型 通過設計標註方案可解決 SENTIMENT 俏皮話、混合觀點、文化差異以及中性邊界;醫療領域的情感與零售領域情感不同 明確定義正/負/中性類別,並提供邊緣案例示例;提供領域特定指導 四種任務中一致性最低的 INTENT 類別重疊或高度相似;口語表達增加了不連貫性、中斷和隱含的填充語句 採用互斥的類別定義;為真正的模糊情況設置標記並升級處理 通過標註方案的規範性可解決 RELATION 隱含與顯式關係、方向性,以及長文檔中‘無關係’或中性關係的普遍主導現象 首先制定關於隱含關係的規則;顯式標註否定關係;使用F1而非κ來評估關係質量 最難、價值最高 標註質量設定了上限:當標註員之間的一致性達到80%時,模型達到83%的性能,已接近人類水平。

關係標註尤其值得重點關注,因為其難度在單一標註方案內部是不均勻的。在一項多語言關係抽取研究中,自動標註結果被與2000條人工標註句子進行比對:部分關係幾乎完美,而另一些則完全崩潰。

由此得出兩點啟示。第一,該方案整體的宏觀F1值為0.79,掩蓋了某個關係類別的表現僅為0.33;必須將質量指標按類別拆解分析。第二,該研究中的人類標註員達到了0.92的Cohen's κ值,所有分歧均被逐個討論並解決——強有力地證明了難題在於指南的清晰度和裁決流程,而非人類能力本身。

情感分析處於另一端。使用Krippendorff's alpha的基準研究發現,在相同語料庫中,情感分析任務的一致性低於命名實體識別任務,其實際原因在於‘中性’類別很少是清晰明確的。在一項分析文本研究中,要求標註員僅標註正或負關係時,他們實際上在內部劃分出一個第三類‘中性’類別,該類別最終主導了數據——一個偽裝成標註員問題的方案缺陷。


你應該為哪個任務使用哪個指標?

將指標與標籤結構匹配,否則你的質量分數將誤導你。

採用正確指標,避免這些誤區

  • Cohen's κ — 兩名標註員,分類標籤:

情感、意圖

  • 在命名實體識別(NER)中使用Cohen's κ — 它需要負例,並嚴重低估了共識

  • Krippendorff's α — 多名標註員,存在缺失數據,有序或層級標籤

  • 報告所有類別上的一個平均分數

  • 詞元級成對F1(排除O)— NER的正確內部一致性評估指標

  • 關係上的F1分數 — 在關係抽取任務中,當κ指標不適用時

  • Gwet的AC2指標 — 當類別嚴重不平衡時;臨床數據集通常在發佈前要求α大於0.90;一般目標則接近80%的一致性水平。

  • 數據類型對應的α設置錯誤,這可能會使結果朝任一方向產生偏差

  • 將低分視為標註員能力不足,而非指南存在空白

  • 僅進行一次測量而非持續對樣本進行評估;在Tweebank NER語料庫中,κ值為0.347,而適當的F1指標顯示了一致性為0.71。

實踐中存在兩個關鍵操作點。對子集持續監控一致性,能早期發現指南中的模糊之處,此時修正成本較低;指南幾乎總是需要優化,生物醫學領域的黃金標準文獻表明,通過收緊規則和建立語義等價標準,經過多次迭代後可達到可接受的一致性。同時,NER任務中的每類F1指標能精確指出標註員在哪些實體類型上存在困難,將一個模糊的質量問題轉化為有針對性的培訓環節。

多語言工作引入了一層現有指標無法捕捉的複雜性。諷刺、禮貌和否定在不同語言中表現各異,用英語撰寫的指南很少能直接遷移。本地語言專家、每種語言的試點批次以及每種語言的一致性跟蹤,正是Lifewood在50多種語言和方言中應用的人工參與閉環機制。


你應該先解決什麼?

按此順序,因為每一步都為下一步設定了更高的門檻。

在全面生產前先運行一個試點批次。使用兩名至三名標註員對相同數據進行標註,目標達成80%以上的共識,並將分歧視為你的指導性待辦事項清單。

將邊緣案例寫入指南,而不僅僅是定義。為正面、負面和中性情況明確邊界,並提供可量化的具體示例,能顯著提升標註一致性。

選擇與標籤結構相匹配的指標。對於命名實體識別(NER),使用詞元級F1;對於分類任務,使用κ或α;對於關係標註任務,則使用關係層面的F1。

將每一個質量評分按類別拆解。一個宏觀得分為0.79可能掩蓋某個關係類型僅為0.33,而某個實體類型則急劇下滑的情況。

根據領域匹配標註員。專家配對在ARFBench數據中成功通過了可接受性閾值,而非專家配對則未能達到。

先用模型進行預標註,再由人工審核。大語言模型(LLM)在基礎情感分析和分類任務中可實現低成本預標註,但在專業領域知識和主觀判斷方面表現不佳——因此應保持‘初步標註加專家驗證’的兩階段工作流程。

僅重新標註模糊地帶,而非整個數據集。將最難處理的5%至10%內容通過優化後的規則重新進行質量審核,其成本遠低於對整個數據集進行重新標註。

針對每種語言運行試點並進行一致性檢查。用一種語言撰寫的指南不能未經檢驗地直接應用於另一種語言。


關鍵要點

  • 四種任務類型主導文本標註——命名實體識別(NER)、情感分析、意圖識別和關係標註——每種任務都有其特有的失敗點。
  • 高一致性是可實現的:電子健康記錄(EHR)標註研究發現,在適當培訓後,標籤在跨度和類別上達到了高度一致性,一項德國的關係研究達到了κ = 0.92。
  • NER在跨度邊界、嵌套實體和通用類別上容易出錯;PER、LOC和ORG在一致性上優於MISC。
  • 情感分析在相同語料庫中的共識程度低於NER,主要因為中性邊界和諷刺表達規定不明確。
  • 在同一個標註方案中,關係質量差異巨大——從出生日期的F1值0.99到死亡地點的F1值0.33——因此應報告每個類別的得分。
  • NER使用詞元級F1,分類任務使用κ或Krippendorff的α,關係任務使用關係的F1;κ在一項NER語料庫中低估了0.347,真實值應為0.71。
  • • 使用大語言模型(LLM)進行初步標註再結合人工審核對簡單任務有效,但在領域專業知識和主觀判斷方面表現不佳。

資料與進一步閱讀

常見問題

大約80%的一致性是一個常見的通用目標,κ或α值約為0.667被視為暫時可接受,而臨床數據集通常在發佈前需要α值高於0.90。根據應用的風險特徵設定標準。

因為κ需要負樣本的計數,而NER是一種序列標註任務。不包含O標籤的token級成對F1值是已被確立的替代方案。

部分可以。它們在基本情感分析和簡單分類方面表現良好,適用於快速預標註,但在領域專業知識、主觀判斷和一致性方面存在困難——因此推薦的模式是使用大語言模型進行初步標註,隨後由人工進行審核。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊