跳轉到主要內容
AI 數據

如何衡量數據集的多樣性

簡短回答。通過測量三個獨立方面,並拒絕讓其中任何一個替代其他方面。構成性詢問數據集中包含誰以及分佈的均衡程度,使用諸如香農……

Mumu D. · 2026年9月1日 · 閱讀約 8 分鐘

簡短回答。 通過測量三個獨立的方面,並拒絕讓其中任何一個替代其他方面。組成方面考察數據集中包含哪些內容以及分佈的均衡性,使用諸如香農熵、辛普森指數和有效數量等指標,而非簡單地統計類別數量。覆蓋方面考察實際使用中的語音和語言範圍是否完整。結果一致性方面考察模型在這些群體中的表現是否相等,這是唯一真正重要的測試,而標準準確性指標往往難以檢測到這一點。


為什麼‘我們覆蓋了20個方言’不能作為多樣性指標?

因為它衡量的是豐富性而忽略了均衡性,而均衡性才是數據集真正失敗的地方。

多樣性研究,主要從生態學引入機器學習領域,將兩個概念區分開來。豐富性是指存在多少個不同的類別。均衡性是指這些類別的分佈是否均衡。一個數據集可以既豐富又嚴重不平衡,而總數量的標題數字無法反映出這一點。

考慮兩個語音數據集,每個數據集涵蓋一種語言的八個地域變體,每個數據集都有1000小時的錄音。在第一個數據集中,一個變體佔800小時,其餘七個變體共佔200小時。在第二個數據集中,每個變體各有125小時。兩個數據集都可以誠實地宣稱覆蓋了八個變體。但只有其中一個數據集才能訓練出適用於所有八個變體的模型。

因此,類別數量是錯誤的衡量指標。供應商聲稱"50種以上語言"或"20種方言",只能說明數據集是豐富的,卻無法說明尾部是否有足夠數據具有實際意義,而類別數據量過小正是導致該類別引入噪聲而非能力的條件。

可測量的問題不是存在多少個類別,而是這些數據在各類別間的分佈情況。


真正可以測量的是什麼?

三個層面,混淆這三個層面是該領域最常見的分析錯誤。

構成。數據集中包含哪些人群:地域、語言變體、年齡區間、性別,以及這些人群在數據中的分佈情況。這部分可以從元數據中獲取,是可測量的最廉價層面,前提是元數據存在。

覆蓋範圍。是否涵蓋了現實世界中的各種條件:錄音環境、設備類型、背景噪聲、說話方式、正式程度、即興與朗讀語境、語言切換現象。一個數據集可以實現人口結構均衡,但聲音環境卻單調乏味。

結果一致性。訓練後的模型在上述各個群體上表現是否均等。這是人們真正關心的問題的唯一答案層,它需要按群體劃分的評估數據,而非單一的綜合分數。

各層並非可替代。即使組成均衡,也不能保證結果均衡,因為某些群體對模型而言更難,原因與樣本數量無關。良好的綜合表現也並不能說明任何群體的結果情況。

一個有用的規範是,在數據收集開始前,明確說明該數據集旨在代表什麼。多樣性並非絕對屬性;它是一種數據集與目標人群之間的關係。沒有明確的目標人群,'多樣性'就無法被驗證。


各指標分別回答什麼問題?

主要源自生態學和經濟學,且各自回答不同的問題。單獨報告其中一個指標,通常意味著有意隱藏了其他內容。

香農熵衡量隨機選取一個樣本屬於哪個群體的不確定性。熵值高表示各類別分佈廣泛;熵值低表示某一類主導。它對稀有類別敏感,因此有助於發現被忽視的尾部類別。

辛普森指數及其吉尼-辛普森變體衡量兩個隨機抽取樣本來自不同群體的概率。該指標在經濟學中表現為赫芬達爾-赫希曼指數,在機器學習中表現為吉尼不純度。它偏向於常見類別,因此更適合檢測主導情況。

希爾數和有效數將熵轉化為可理解的計數:即產生觀測到的多樣性的同等常見類別數量。這是該系列中最易溝通的指標。'八種方言存在,有效多樣性為2.4'立即向利益相關者表明,其中六種幾乎可視為裝飾性。

Vendi評分及其他基於嵌入的度量方法評估的是在學習到的表示空間中的多樣性,而非在聲明的類別上,因此能夠捕捉到任何元數據字段都無法記錄的變異。

覆蓋率和豐富度估計器解決的是另一個問題:樣本中可能缺失的真實群體變異有多少。

由於這些指標在設計上存在分歧,實際做法是報告一個小型固定集合,其中有效數量作為主要指標,因為這是最難誤解的數值。


為什麼主要準確率會掩蓋多樣性問題?

因為標準指標對說話人特徵的敏感性最低。這一結論是通過實測得出的,而非推測,因此應改變團隊報告結果的方式。

2026年一項審計語音識別在不同說話人人口統計學特徵上表現的研究發現,各類評估指標之間存在明顯的敏感性層級。被普遍引用的兩項指標——詞錯誤率和字符錯誤率——對人口統計和聲學因素的響應最弱,其報告的決定係數分別為0.040和0.及0.012。作者得出結論:原始詞彙錯誤數量主要受隨機噪聲主導,而非系統性地與說話人的特徵相關聯。

在指標層級更高的部分,表現則有所不同。匹配錯誤率、詞彙信息損失、嵌入加權錯誤和語義距離顯示出更大的彈性,捕捉到了詞錯誤率無法識別的人口學變異。

語義距離尤其在分析中佔據獨立方向,編碼了其他指標所遺漏的信息。

同一項研究將這一底層現象稱為‘多樣性稅’:那些具有邊緣化或非典型表達的用戶所承擔的額外負擔,他們為了獲得與主流群體用戶相同的基線使用體驗,不得不調整自己的發音或反覆糾正錯誤。這種負擔是真實存在的,而詞錯誤率卻難以察覺它。

實踐中的教訓雖然令人不安但十分簡單:如果你的質量報告以單一的聚合詞錯誤率開頭,那麼你選擇的指標最不可能揭示多樣性問題。報告在語義敏感的指標上按群體劃分的結果,雖然工作量更大,但信息量也顯著更高。


在數據採集階段必須捕捉什麼?

你將來希望按其進行切分的每一項內容。未被記錄的多樣性無法被測量,也無法在事後重建。

此時測量問題已轉變為數據採集問題,而非分析問題。一個數據集只能根據其元數據所記錄的維度進行審計。

語音和文本數據採集的可行最低要求:

說話者屬性。地區及子地區、語言變體、年齡區間、性別,以及與語言切換相關的任何第二語言。以聲明的類別形式記錄,並附有明確的分類方案,而非自由文本。

會話屬性。設備類型、錄音環境、背景噪音水平、提示類型、是自發表達還是朗讀、會話時長。

內容屬性。領域、註冊級別或正式程度、主題、是否發生語言切換以及切換到何種語言。

處理屬性。由誰進行轉錄、由誰進行審核、是否經過裁決,以及依據哪個版本的指南。

存在兩項約束。收集人口統計屬性必須獲得同意、具有目的性且比例適當,因為這些屬於個人數據,在某些司法管轄區中還屬於敏感數據。同時,類別本身也需要謹慎處理,因為一個在其他地區設計的分類方案可能無法準確反映該地區居民實際自我描述的方式。

如果處理得當,這種元數據使得後續問題如‘模型在某一地區老年使用者群體上表現不佳’能夠被回答。Lifewood在交付網絡中工作推進時同步捕獲此類元數據,其根本原因在於,一個無法描述其構成的數據集,其多樣性也就無法得到辯護。


如何開展多樣性審計?

六個步驟,最好在交付前而非部署後進行。

明確目標人群。該數據集應代表什麼,依據何種來源。沒有這一點,審計便無參考基準。

同時報告豐富度和均勻度。按維度報告類別數量與有效數量,絕不能僅報告數量。

將尾部與可用性基準進行對比。對於每個類別,是否存在足夠的數據量以提供有效貢獻?低於基準線的類別應報告為‘存在但稀薄’,而非簡單計入覆蓋範圍。

將覆蓋範圍與構成單獨衡量。設備類型、噪聲環境和說話風格需要各自獨立的分佈。

按群體分別評估結果。使用能夠響應說話者特徵的指標,在按說話群體構建的評估集上進行測試。

將數據集的構成與發佈一同公開。提供一份詳盡的數據聲明,說明數據集是如何構建的、它所代表的內容以及它所遺漏的部分。根據歐盟對高風險系統的數據治理要求,數據集應反映系統將被使用的環境特徵,這不僅是一個數據收集問題,更是一個文檔記錄問題。

反覆出現的主題是:多樣性是一種聲明,而聲明需要證據。能夠提供構成表格、有效數量及各群體結果的供應商,是在做出可驗證的陳述;而僅提供語言列表的供應商,則無法做到這一點。


關鍵要點

  • 多樣性包含兩個方面:豐富性,即有多少類別存在;均衡性,即這些類別分佈是否平衡。類別數量僅反映了前者。
  • 即使兩個數據集包含相同的八種方言和相同的總時長,其實際內容仍可能完全不同,這取決於各類別的分佈情況。
  • 測量具有三個層次:構成、對現實條件的覆蓋情況,以及各群體之間的結果一致性。
  • 沒有一個可以替代另一個。
  • 香農熵對稀有類別敏感;辛普森指數偏向於優勢類別;希爾或有效數量將兩者轉化為可解釋的計數。
  • 基於嵌入的度量,如Vendi分數,能夠捕捉元數據類別從未記錄的變異。
  • 2026年的一項語音識別審計發現,詞錯誤率和字符錯誤率對說話者人口統計學特徵的敏感性最低,報告的R²值分別為0.040和0.及0.012。
  • 匹配錯誤率、信息丟失、嵌入加權錯誤和語義距離對人口統計學差異的響應顯著更強。
  • 同一項研究將這種差異稱為‘多樣性稅’:那些具有非典型語音的用戶為獲得與主流人口統計學用戶相同的效用而付出的額外努力。
  • 在數據收集階段未記錄的多樣性無法在之後被衡量,因此必須在工作進行過程中記錄說話者、會話、內容和流程的元數據。
  • 人口統計學元數據屬於個人數據,必須獲得同意,且應以社區認可的類別進行分類。
  • 一項審計指出目標人群,報告豐富性與均衡性,將尾部與可用性底線進行比對,分別衡量覆蓋範圍,按群體評估結果,並公佈構成情況。

資料與進一步閱讀

常見問題

不是。它僅體現豐富性。如果沒有各語言之間的分佈情況以及每個類別下的可使用門檻,一個長列表可能描述一個在一種語言中表現良好、而在其他語言中表現不佳的數據集。

如果只能選擇一個,應使用有效數量,因為它以可解釋的等同類別數量來表達多樣性。更好的做法是同時報告豐富性、有效數量以及各組的結果。

因為它對說話人特徵的響應很弱。2026年的審計發現,詞錯誤率對人口統計和聲學因素的R²值為0.040,字符錯誤率的R²值為0.012,而語義指標對這些因素的響應則強得多。

邊緣化或非典型語音使用者所承擔的不成比例負擔,他們必須反覆調整發音或糾正錯誤,才能獲得其他用戶默認即可獲得的相同功能效用。

只能通過收集更多數據實現。元數據無法事後可靠地重建,且缺失的類別無法被推斷出來。

應徵求相關社區的意見,明確記錄、獲得其同意,並僅限於項目有明確分析用途的屬性。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊