跳轉到主要內容
AI 數據

長尾與邊緣案例挖掘:尋找模型尚未見過的數據

簡短回答。長尾與邊緣案例挖掘是訓練前主動發現數據中稀有內容的實踐,以便做出是否……的明確決策

Mumu D. · 2026年9月1日 · 閱讀約 12 分鐘

簡短回答。 長尾和邊緣案例挖掘是指在訓練前主動發現數據中稀有的部分,從而有意識地決定是否需要收集更多數據、進行增強、重新平衡或接受數據缺口。這些方法從簡單的類別頻率分析到基於嵌入的聚類、模型不確定性信號以及專業領域審計不等。沒有任何一種方法能單獨完美地發揮作用,最好的方案是結合多種方法。

它們的底層原理是相同的:稀有性是數據集的一個屬性,且在問題發生之前就可以被測量。

本指南涵蓋的內容


為什麼長尾不是一種貶義的邊緣案例

現實世界的數據幾乎從來不會是平衡的。它通常遵循接近冪律的分佈,少數常見的類別或情況佔據了大多數樣本,而長尾部分的稀有類別雖然每個佔比很小,但加在一起卻構成了整體數據的相當大比例。

問題不在於稀有類別存在,而在於標準訓練流程未能公平對待這些類別。一個未經處理的不平衡數據集訓練出的模型,會傾向於優化多數類別的表現,因為梯度信號主要來自這些類別。它會對常見情況建立高置信度,而對稀有情況則形成薄且不穩定的表示。

研究有助於區分兩個容易混淆的維度:難度指的是問題本身的根本模糊性:即使提供了大量樣本,模型也難以分類,因為信號本身是噪聲。稀有性指的是數據支持的缺乏:模型分類表現差,僅僅是因為它見過的樣本太少。一項關於3D檢測挖掘的研究發現,直接針對稀有性而非難度進行優化,能帶來更大的性能提升,具體而言,通過特徵密度估計來識別和優先處理稀有樣本,而非僅僅挖掘困難樣本,實現了對稀有對象的30.97%性能提升。困難樣本和稀有樣本有交集,但並非同一概念,混淆了這兩個問題會導致錯誤的解決方案。

邊緣案例位於交界處。它們通常既稀有又困難,因此其重要性被顯著放大:模型學習到的樣本非常少,且這些樣本難以泛化。但區分仍然很重要。如果一個邊緣案例是稀有但不困難,那麼增加樣本數量可能就足夠了。如果它困難但不稀有,那麼數據收集的幫助將小於模型或標籤設計的改進。


頻率分析:大多數團隊跳過的顯而易見的起點

在使用任何複雜方法之前,先進行計數。

標籤頻率分析是最簡單的長尾挖掘形式,令人驚訝的是,在訓練之前它往往沒有被正確實施。各類、條件、人口統計特徵、語言或領域之間的分佈是首先要觀察的內容,因為它能告訴你長尾從何處開始以及其有多薄。

一個實用的起點:按頻率對所有標籤類別進行排序,並查看最底部的五分之一。對於分類任務中少於幾百個示例,或在語言模型上下文中少於幾千個標記的類別,應詢問實際使用頻率是否足以支撐當前的訓練頻率。一個在10%的真實查詢中出現,卻僅佔訓練數據0.1%的類別,其表現必然不佳,而且在訓練開始前就能明確這一點。

在實踐中,這比聽起來更困難有兩個原因。首先,許多真實數據集並沒有乾淨的分類標籤。長尾存在於組合和共現關係中,而非單一維度:它不是‘罕見類別X’,而是‘類別X在條件Y和Z共同出現時’。切片發現方法通過在現有類別內部尋找表現不佳的群體,而非尋找完全缺失的類別,來解決這一問題——它識別的不是缺失的標籤,而是未被充分代表的交集。一個情感分類器可能在整體上能很好地處理負面評論,但在來自使用代碼混合語體的用戶撰寫的負面評論,或在非常短的帶有諷刺語氣的評論上會明顯失敗。僅按標籤計數無法揭示這一點。

其次,數據集中的頻率與現實世界中的頻率並不相同。通過網絡爬取構建的數據集,會過度反映網絡內容的類型,而忽視其他內容。口語、地域方言、非正式表達方式以及實際部署環境中條件的分佈,都與一個方便收集的語料庫的頻率分佈系統性不同。數據集頻率與現實世界頻率之間的差距,正是長尾問題的所在。


嵌入聚類:揭示標籤無法展現的語義空隙

頻率分析作用於標籤空間,而嵌入聚類作用於語義空間,後者與前者不同,且往往更具揭示性。

思路是將示例投影到共享的嵌入空間中,對其進行聚類,並尋找在現實世界中規模較大但在訓練數據中卻較薄的聚類。這種方法能夠發現分類標籤所遺漏的空白:兩個示例可能具有相同的標籤,但在語義上卻差異顯著,如果其中一種變體在訓練集中較為罕見,標籤計數將無法反映出這一點。

實際操作步驟是相對可行的。使用一個預訓練的編碼器(文本的語言模型、圖像的視覺編碼器、音頻的語音編碼器),將你的數據輸入其中,應用k-means或基於UMAP的降維方法並進行可視化,然後尋找在訓練集中稀疏分佈的聚類。訓練集中稀疏分佈的聚類是潛在的空白區域。關鍵的是,如果你能夠獲取部署環境中的未標註數據,將其通過相同的編碼器處理,並將其疊加到訓練數據分佈上,就能看到模型實際會遇到但當前數據覆蓋不足的區域。

研究已經用特徵空間中的密度估計形式化了這一方法。一種方法是,在預訓練檢測器的特徵向量上訓練一個歸一化流模型,然後利用推斷出的概率密度為單個實例分配稀有性分數。密度低的實例是稀有的,密度高的實例是常見的。這種稀有性分數可以直接用於優先收集和標註覆蓋率不足的區域。

這類分析的輸出是空間性的而非分類性的:你不僅識別出缺失的標籤,還識別出語義空間中覆蓋較薄的區域。這對於數據收集設計更具可操作性,因為你可以用特徵描述缺失內容,而不僅僅是依賴類別標籤。‘我們需要更多這類示例’比‘我們需要以下類型的示例:簡短、非正式、混合語言、在特定人口條件下的’更有用。


不確定性與錯誤分析:讓模型告訴你它在哪裡失去信心

如果你有一個模型,它其實已經比你想像的更清楚地知道其訓練數據在哪些區域是稀薄的。

在未參與集或未標註數據樣本上,模型表現出高不確定性,這表明模型遇到了它無法自信判斷的內容。這可能是由於項目本身具有歧義(難度),也可能是由於模型未見過足夠多的此類樣本(稀有性)。這種區別很重要,但在你完成更深入分析之前,高不確定性區域至少值得重點關注。

基於不確定性的方法通過在一組未標註或保留數據上運行推理,並標記出模型置信度最低的項目來實現。有多種方式可以實現不確定性:預測熵、前兩名預測類別的差距、集成成員間的方差或蒙特卡洛滴落樣本的方差。每種方法在計算成本和對不確定性根本原因的敏感性上各不相同,但它們都指向同一個結論:模型實際上在猜測的區域。

對驗證集的錯誤分析是互補的,對於那些不想運行集成推理的實踐者來說,往往更具揭示性。按類別、按人口統計切片、按領域或按任何可計算的屬性對錯誤進行組織,並尋找規律。一個整體錯誤率為8%、但在特定子條件下的錯誤率高達34%的模型,存在長尾問題,而總體指標掩蓋了這一問題。

研究強調的一個重要區別:不確定性採樣傾向於選擇困難的樣本,而不一定傾向於稀有的樣本。如果你只收集最高不確定性樣本,你可能會得到更多真正模糊的樣本,而不是那些實際可分類但尚未充分代表的樣本。正確的做法是同時運行不確定性分析和密度分析,並將二者視為不同的信號,而不是互相替代。


領域審計:數據中尚未包含的內容

上述所有方法都基於你已有的數據。領域審計提出的是一個不同的問題:數據中應該包含哪些尚未具備的內容?

這需要領域專業知識,而非計算方法。應聯合那些瞭解部署環境、類似系統故障模式以及實際將與產品交互的用戶群體的人們。系統性地詢問他們:哪些條件、場景、人群、語言、語體或情境未被當前數據集所涵蓋?

審計應結構化而非開放式。一個有用的框架是梳理對任務至關重要的變異維度:

數據由誰產生?訓練集中包含哪些語言、方言、年齡群體、地理區域、人口群體和社會背景,又缺少哪些?

在何種條件下?部署環境涉及哪些錄音場景、設備、時間壓力、正式程度、情緒狀態和領域特定詞彙,而這些內容在訓練數據中並未被涵蓋?

當事情出錯時會發生什麼?對抗性輸入、易混淆的類別、用戶即使看似不可能也會產生的分佈外組合。已部署AI系統的史冊中充滿了那些在部署上下文中可預測、但在訓練分佈中不可見的失敗案例。

領域審計也是人類在數據收集和標註過程中所展現的專業知識變得不可替代的地方。

在Lifewood,當我們承接一個多語言數據項目時,早期工作的一部分正是這種審計:明確一個基於已有數據訓練的模型在理解某個地區人們實際語言使用方式時會遺漏的內容,包括他們使用的術語、記錄的條件,以及本地常見而非全球常見的邊緣案例。在聚合數據集中罕見的區域變體,可能在某個特定社區中成為主流形式,而發現這一點,需要了解該社區而非僅僅依賴數據集。

這是純計算方法最難以應對的維度。一個嵌入集群可以告訴你語義空間中的某個區域是稀薄的;但它無法告訴你,這個區域對應的是一個具有社會重要性的群體,他們將使用你的產品,並會發現產品無法滿足他們的需求。


一旦發現缺口,應該做什麼

發現缺口是有用的;但這還不夠。缺口需要被分類處理,而分類處理決定了對每個缺口實際採取的行動。

當缺口是可恢復的時,收集更多數據是正確的做法:該類別存在於現實世界中,可以找到人來產生或標註該類別,且在項目的時間和預算範圍內,數據量的缺口是可以彌補的。這適用於大多數區域語言覆蓋缺口、大多數人口結構不平衡以及大多數領域覆蓋問題。

當數據收集不切實際但合成變異具有意義時,應採用增強策略。通過在稀有類別表示方向上位移特徵向量來生成虛擬樣本的特徵空間增強,已被證明在缺乏真實樣本的情況下有效擴展尾部覆蓋範圍。相較於圖像級增強,這種方法在許多任務中更具辯護性,因為它在模型自身表示所定義的空間中進行操作。

當數據存在但訓練信號不平衡時進行再平衡。通過過採樣稀有類別、欠採樣常見類別,或使用損失加權在訓練時為尾部樣本賦予更多梯度,都是在不改變數據本身的情況下解決分佈不平衡的技術。正確的做法取決於尾部類別的稀有程度,以及模型是由於信號不足還是數據不足而失敗。

當差距真實存在但超出部署範圍時,應予以接受並記錄。並非每個差距都需要或應當被關閉。一個為特定語言社區部署的模型無需覆蓋所有語言;它只需要良好覆蓋該社區的語言即可。關鍵在於,這種差距必須被明確承認、記錄,並體現在模型卡片和部署指南中,而不是在生產環境中被用戶發現。

直覺上,人們傾向於將稀有類別和邊緣案例的挖掘視為訓練開始前需要解決的問題。更好的框架是將其視為一項持續進行的實踐。生產數據會揭示前期分析所遺漏的差距。每一次部署都會產生關於訓練集未包含內容的新信息。那些在構建過程中系統性收集失敗案例、從已部署模型中提取不確定性信號並定期進行領域審計的團隊,其模型會持續改進,而不是默默積累並不斷累積的錯誤。


關鍵要點

  • 大多數生產環境中的AI故障都發生在分佈的尾部,即樣本稀少且模型表示薄弱的地方。
  • 難度和稀有性是兩個不同的維度。直接針對稀有性進行優化,其對尾部類別的性能提升效果,明顯優於僅針對難度的優化,一項研究發現,專注於稀有性的挖掘可使稀有對象的性能提升達30.97%。
  • 標籤頻率分析是最簡單的起點。按頻率排序,檢查最底層的五分之一;驗證訓練頻率是否與預期的部署頻率一致。
  • 切片發現旨在尋找類別內部表現不佳的交叉點,而非缺失的類別,從而捕捉到標籤計數無法顯示的差距。
  • 嵌入式聚類能夠在不依賴標籤類別的前提下,識別語義空間中的稀疏區域。將訓練數據和未標註的部署數據通過相同的編碼器處理,並比較其分佈,即可揭示覆蓋薄弱的區域。
  • 在特徵空間中的密度估計為單個實例分配稀有性分數,並被用於優先收集代表性不足的區域。
  • 基於不確定性的方法會突出模型無法自信解決的項目。高不確定性與難度和稀有性相關,二者應分別進行跟蹤。
  • 領域審計會詢問數據中本應包含卻未包含的內容,這需要領域專業知識而非計算方法。
  • 一旦發現差距,選項包括:收集更多數據、通過特徵空間合成進行增強、訓練時重新平衡,或記錄並接受該差距。
  • 長尾挖掘應持續進行,而非一次性操作。生產失敗會暴露預訓練分析所遺漏的差距。

資料與進一步閱讀

常見問題

長尾現象指的是數據集中存在大量類別或條件,它們各自出現的頻率很低。這些類別或條件雖然總體上可能代表現實世界中相當大的一部分案例,但單個類別或條件在訓練樣本中的佔比極小,導致模型在這些類別上的表現較差。

困難示例由於固有的模糊性而難以分類,無論其在數據集中出現的頻率如何。稀有示例難以分類是因為模型看到的該類示例數量太少。針對稀有性的優化往往比針對困難性的優化能帶來更大的數據驅動性能提升。

一種分析技術,它在現有類別內部識別表現不佳的子群體,而不是完全忽略缺失的類別。它發現條件、人口統計或領域之間的交集,在這些交集中模型的失敗頻率顯著高於平均水平。

部分可以。特徵空間增強可以在實際數據收集不現實的情況下擴展覆蓋範圍,但其效果受限於模型現有的表示能力。它最合理的角色是作為真實數據的補充,而非替代。

當它超出了實際部署的現實範圍,當關閉它的成本超過收益,或者當受影響的人群不在目標部署場景中時,應明確記錄其接受標準,而非默認假設。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊