跳轉到主要內容
AI 數據

低資源語言語音數據的採集方式

簡短回答。低資源語言的語音數據是通過採集獲得,而非從現有資源中發現。由於沒有大規模的公開語料庫可供爬取,因此該工作本質上是實地操作:招募並核實本地……

Lifewood Data Technology · 2026年7月3日 · 閱讀約 7 分鐘

簡短回答。 低資源語言的語音數據是通過實地採集獲得,而非從現有資源中獲取。沒有大規模的公開語料庫可供爬取,因此這項工作本質上是實地操作:招募並驗證按方言、年齡、性別和區域分層的母語者;設計能夠激發讀出和自發語音的提示;在模型實際會遇到的設備和聲學條件下進行錄音;採用事先約定的書寫規範對語音進行轉錄,尤其適用於正字法不穩定的語言;並通過母語者評審者驗證,以詞錯誤率和方言層面的一致性而非語言層面的一致性為衡量標準。知情同意和公平報酬是方法的一部分,而非事後合規的附加項——當一個語料庫在變得有價值時,若其知情同意來源薄弱,則完全無法使用。

語音模型在數據最少的語言上表現不佳,而這些語言正是技術服務覆蓋最弱的人群所使用的語言。縮小這一差距本質上是一個具有特定方法論的收集問題,其中大部分困難是操作層面的,而非技術層面的。

本指南闡明瞭實際工作流程以及企業買家應提出的要求。


為什麼低資源語音數據不同

沒有可爬取的內容。 高資源語言擁有數十年的廣播、字幕媒體和公開語料庫。低資源語言通常缺乏這些可用數量的資源,因此每一小時的語音數據都是刻意生產出來的。

正字法可能不穩定。 一些語言存在相互競爭的拼寫規範、最近的標準化過程,或主要以口頭使用為主。轉錄工作必須在選擇並書面確立規範後才能開始——而這一決策將影響所有下游指標。

方言差異通常大於高資源語言中的情況。 語言層面的規劃將某些方言視為同一類,但實際上它們的差異可能足夠大,以至於在某一方言上訓練的模型在另一方言上表現不佳。

語言切換是正常現象,而非例外。 在許多多語言地區,人們在一句話中混合使用多種語言是標準做法。一個排除了語言切換語料的語料庫,實際上忽略了人們的真實交流方式。

說話者群體是招聘問題。 在尚未覆蓋的語言中尋找、驗證、留住並公平支付說話者,是一項實地工作——而這恰恰是決定一個項目能否成功交付的最關鍵因素。


在錄音前設計覆蓋範圍

覆蓋範圍是設計出來的,而不是發現出來的。五個分層維度,每個維度都有明確目標:

維度 明確說明 原因
方言和地域變體 列出具體變體,併為每種變體設定目標份額 最常見的差距;在語言層面的計劃中是不可見的
說話者人口統計特徵 年齡組、性別、城鄉分佈、教育背景組合 決定了模型對哪些人群表現不佳
語音類型 朗讀、腳本化、即興、對話式 僅包含朗讀語料的語料庫會產生在自然語音上表現失敗的模型
語音條件 安靜、環境噪聲,室外,車載,通話 必須匹配部署條件
設備 市場上常見的手機型號、耳機、遠場 麥克風特性會實質性地影響信號
覆蓋率 = 該分層已採集小時數 ÷ 該分層目標小時數

跟蹤並報告各層次的最小值以及總量。一個計劃在總時長的90%範圍內,仍可能在佔市場份額三分之一的方言上達到20%。


提示和腳本設計

三種材料類型,且語料庫通常需要全部三種:

  • 閱讀語音 — 說話者朗讀準備好的句子。成本最低,控制最精確,能提供清晰的語音覆蓋。生成的語音聽起來不像對話。
  • 提取自發語音 — 提供一個提示或情境,由說話者用自己的話表達。轉錄成本更高,更貼近實際部署場景。
  • 對話語音 — 兩個或更多說話者,包含重疊、中斷和修正。轉錄難度最大,對於處理真實對話內容至關重要。

在低資源工作中,有兩個設計原則更為重要:

用目標語言、文化背景編寫提示。 從英語翻譯而來的提示會產生說話者絕不會說的句子,說話者在朗讀時會顯得彆扭,這種現象在數據中是可聽出的。

明確設計語音覆蓋範圍。 檢查提示集是否涵蓋了該語言的所有音素,包括那些罕見但具有代表性的發音。在沒有現有語料庫的語言中,沒有任何東西能為你完成這一點。


說話者招募與驗證

工作的核心運營環節。

  • 驗證語言的變體,而不僅僅是語言本身。 一個聲稱會說某種語言的說話者,可能說的是一種不同於你需要的語言的地域變體。驗證是一種簡短的母語者篩選,跳過這一環節會無聲地破壞數據的分層結構。
  • 招募市場內用戶。 外籍群體的說話者具有價值,但他們的語言會漂移——詞彙、藉詞和語體會逐漸偏離當前市場中的實際使用情況。
  • 會話間留存計劃,其中設計需要每位說話者多次錄音。
  • 公平且透明地支付,支付標準應符合當地市場水平,並以說話者母語呈現,使其可閱讀。這既是道德要求,也是實際需要:薪酬過低會導致錄音倉促、退出率上升,以及無法為下一期項目返回的說話者群體。

錄音環境

與實際部署場景相匹配。一個完全基於安靜室錄音訓練的模型,在其實際運行的環境中表現會顯著下降。

  • 包含使用場景中的噪聲條件——如街道、市場、車輛、有背景噪音的家中環境。
  • 包含該市場中人們實際使用的設備,這些設備可能與你們團隊使用的設備不同。
  • 如果模型將滿足該要求,則需包含 電話頻段音頻;帶寬縮減並非寬頻訓練模型默認處理的內容。
  • 記錄 每會話的元數據 — 設備、環境、說話者層級、會話條件。元數據缺失是導致語料庫無法後續重新平衡的原因。

轉錄規範

此後所有質量指標的決策依據。在首次轉錄前,須以書面形式達成一致:

  • 正字法。 採用哪種拼寫規範,以及對於無標準拼寫詞彙的處理方式。
  • 數字、日期和縮寫 — 以口語形式書寫還是以數字形式書寫。
  • 不流暢表達 — 填充音、錯誤開頭、重複:是否轉錄、是否標註或是否捨棄。
  • 語言混合現象 — 如何標記混合語言片段。
  • 非語音事件 — 笑聲、噪音、重疊語音。
  • 多說話人音頻的說話人標籤
  • 不確定性 — 語音轉錄員如何標記不可理解的音頻,而不是進行猜測。

最後這一點值得堅持。一個沒有方式表達‘我聽不到’的約定,會產生自信的錯誤轉錄,而這種錯誤比空白更嚴重,因為它們會訓練模型生成虛構的文本。


質量驗證

WER = (Substitutions + Insertions + Deletions) ÷ Reference words

四項要求:

  1. 按方言和聲學條件分別報告WER,而不是按語言。總體指標會被最容易的層次所主導。
  2. 在雙轉錄子集上測量不同轉錄員之間的一致性。一致性低意味著該約定是模糊的——這是最早且最便宜的信號,表明該指南需要改進。
  3. 使用原生構建的黃金標準集,定期更新,並以預定速率注入實時工作流程,從而使質量持續測量而非僅在交付時測量。
  4. 讓本地評審員傾聽,而不僅僅是閱讀。一些錯誤——方言錯誤、不自然的朗讀、非母語者發聲——在文本轉錄中是聽不到的,但在音頻中卻非常明顯。

同意、倫理與來源追溯

對於收集到的語音數據,這是資產與負債之間的區別。

  • 知情同意,以說話者母語表達,涵蓋錄音的用途,包括後續和商業用途,以及數據保留時長。
  • 可執行的退出路徑——一個無法追溯到具體文件的退出權利,並不構成真正的權利。
  • 個人身份信息處理。 自發性語音中包含姓名、地址等個人細節,這些是說話者並未意圖永久保留的內容。檢測與編輯應作為流程的一部分。
  • 每項內容的來源追溯——會話、說話者層級、同意記錄、轉錄員和評審員。
  • 社區尊重,即一種語言屬於小眾或邊緣化社區的情況。應確保公平補償、使用情況的透明性,以及在適當情況下,讓該社區自身能夠訪問由此產生的資源。

Lifewood的應對方式

低資源語言的語音數據是 Lifewood 專項工作,而非其通用語音工作的延伸。該工作以實地採集與市場運營相結合的方式進行:涵蓋多樣地理和人口群體的定製化數據採集,包括圖像、視頻和音頻記錄,並輔以多語言轉錄和音素標註。

這種模式能夠奏效,原因在於其組織結構。30多個國家的40多個交付中心覆蓋中國、菲律賓、馬來西亞、印度和孟加拉國,以及非洲、歐洲和北美,擁有50多種語言56,788名參與者。這使團隊能夠在目標市場當地招募並核驗語言使用者,而非遠程尋找人員——這一步決定了方言分層是真實有效,還是僅有名義上的分類。Lifewood自2004年起開展多語言數據業務,目前的AI數據公司於2018年成立;語音與語言項目服務於語音AI開發者。

參見 低資源語音數據多語言數據採集AI數據服務全球AI數據


資料與進一步閱讀

常見問題

通過設計的實地採集而非網絡爬取。演講者在市場中招募並核實,按方言、年齡、性別和區域進行分層;提示語以目標語言撰寫,以激發閱讀、自發和對話式的語音表達;錄音在實際部署所涉及的各種設備和聲學環境下進行;轉錄則在工作開始前以書面形式約定的規範執行。質量通過母語評審員進行驗證,測量各方言的詞錯誤率以及雙轉錄子集的轉錄員間一致性。

因為這些數據在網上的可用量非常有限。高資源語言擁有數十年的廣播、字幕媒體和公開語料庫;而許多低資源語言的錄音材料極少,文字系統不穩定,或主要以口頭使用為主。每一小時可用的語音數據都必須刻意生產。

這取決於具體任務、聲學條件以及是否已有多語言基礎模型對相關語言有接觸。更關鍵的問題是覆蓋範圍而非數據時長:方言、說話人群特徵、語音類型、設備和噪聲條件是否都得到了體現,以及體現的比例如何?一個規模較小但分層良好的語料庫通常優於一個規模大但分佈不均的語料庫。

僅在安靜環境中採集閱讀語音。這種數據最容易且最乾淨地生產出來,但它訓練出的模型在面對真實、嘈雜、通過設備傳遞的自然語音時表現不佳——而這正是模型在實際部署中會遇到的所有語音類型。

與原生構建的黃金標準集相比的詞錯誤率,按方言和語音條件分別報告,而非作為整體語言的平均值,加上對雙轉錄子集的一致性評估。只有當轉錄規範——如不流暢表達、數字表示、語言切換、不確定性標記——在前期以書面形式固定下來時,這兩個指標才具有可比性。

必須以說話人自身語言提供知情同意,涵蓋用途(包括商業用途和後續用途)、數據保留期限以及可實際執行的具體文件撤回路徑。自發性語音還需要進行個人身份信息(PII)檢測與擦除,因為說話者會說出他們本無意永久保留的姓名和個人信息。同意來源的薄弱性,恰恰在數據變得有價值時使語料庫變得不可用。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊