簡短回答。 低資源語言的語音數據是通過實地採集獲得,而非從現有資源中獲取。沒有大規模的公開語料庫可供爬取,因此這項工作本質上是實地操作:招募並驗證按方言、年齡、性別和區域分層的母語者;設計能夠激發讀出和自發語音的提示;在模型實際會遇到的設備和聲學條件下進行錄音;採用事先約定的書寫規範對語音進行轉錄,尤其適用於正字法不穩定的語言;並通過母語者評審者驗證,以詞錯誤率和方言層面的一致性而非語言層面的一致性為衡量標準。知情同意和公平報酬是方法的一部分,而非事後合規的附加項——當一個語料庫在變得有價值時,若其知情同意來源薄弱,則完全無法使用。
語音模型在數據最少的語言上表現不佳,而這些語言正是技術服務覆蓋最弱的人群所使用的語言。縮小這一差距本質上是一個具有特定方法論的收集問題,其中大部分困難是操作層面的,而非技術層面的。
本指南闡明瞭實際工作流程以及企業買家應提出的要求。
為什麼低資源語音數據不同
沒有可爬取的內容。 高資源語言擁有數十年的廣播、字幕媒體和公開語料庫。低資源語言通常缺乏這些可用數量的資源,因此每一小時的語音數據都是刻意生產出來的。
正字法可能不穩定。 一些語言存在相互競爭的拼寫規範、最近的標準化過程,或主要以口頭使用為主。轉錄工作必須在選擇並書面確立規範後才能開始——而這一決策將影響所有下游指標。
方言差異通常大於高資源語言中的情況。 語言層面的規劃將某些方言視為同一類,但實際上它們的差異可能足夠大,以至於在某一方言上訓練的模型在另一方言上表現不佳。
語言切換是正常現象,而非例外。 在許多多語言地區,人們在一句話中混合使用多種語言是標準做法。一個排除了語言切換語料的語料庫,實際上忽略了人們的真實交流方式。
說話者群體是招聘問題。 在尚未覆蓋的語言中尋找、驗證、留住並公平支付說話者,是一項實地工作——而這恰恰是決定一個項目能否成功交付的最關鍵因素。
在錄音前設計覆蓋範圍
覆蓋範圍是設計出來的,而不是發現出來的。五個分層維度,每個維度都有明確目標:
| 維度 | 明確說明 | 原因 |
|---|---|---|
| 方言和地域變體 | 列出具體變體,併為每種變體設定目標份額 | 最常見的差距;在語言層面的計劃中是不可見的 |
| 說話者人口統計特徵 | 年齡組、性別、城鄉分佈、教育背景組合 | 決定了模型對哪些人群表現不佳 |
| 語音類型 | 朗讀、腳本化、即興、對話式 | 僅包含朗讀語料的語料庫會產生在自然語音上表現失敗的模型 |
| 語音條件 | 安靜、環境噪聲,室外,車載,通話 | 必須匹配部署條件 |
| 設備 | 市場上常見的手機型號、耳機、遠場 | 麥克風特性會實質性地影響信號 |
覆蓋率 = 該分層已採集小時數 ÷ 該分層目標小時數
跟蹤並報告各層次的最小值以及總量。一個計劃在總時長的90%範圍內,仍可能在佔市場份額三分之一的方言上達到20%。
提示和腳本設計
三種材料類型,且語料庫通常需要全部三種:
- 閱讀語音 — 說話者朗讀準備好的句子。成本最低,控制最精確,能提供清晰的語音覆蓋。生成的語音聽起來不像對話。
- 提取自發語音 — 提供一個提示或情境,由說話者用自己的話表達。轉錄成本更高,更貼近實際部署場景。
- 對話語音 — 兩個或更多說話者,包含重疊、中斷和修正。轉錄難度最大,對於處理真實對話內容至關重要。
在低資源工作中,有兩個設計原則更為重要:
用目標語言、文化背景編寫提示。 從英語翻譯而來的提示會產生說話者絕不會說的句子,說話者在朗讀時會顯得彆扭,這種現象在數據中是可聽出的。
明確設計語音覆蓋範圍。 檢查提示集是否涵蓋了該語言的所有音素,包括那些罕見但具有代表性的發音。在沒有現有語料庫的語言中,沒有任何東西能為你完成這一點。
說話者招募與驗證
工作的核心運營環節。
- 驗證語言的變體,而不僅僅是語言本身。 一個聲稱會說某種語言的說話者,可能說的是一種不同於你需要的語言的地域變體。驗證是一種簡短的母語者篩選,跳過這一環節會無聲地破壞數據的分層結構。
- 招募市場內用戶。 外籍群體的說話者具有價值,但他們的語言會漂移——詞彙、藉詞和語體會逐漸偏離當前市場中的實際使用情況。
- 會話間留存計劃,其中設計需要每位說話者多次錄音。
- 公平且透明地支付,支付標準應符合當地市場水平,並以說話者母語呈現,使其可閱讀。這既是道德要求,也是實際需要:薪酬過低會導致錄音倉促、退出率上升,以及無法為下一期項目返回的說話者群體。
錄音環境
與實際部署場景相匹配。一個完全基於安靜室錄音訓練的模型,在其實際運行的環境中表現會顯著下降。
- 包含使用場景中的噪聲條件——如街道、市場、車輛、有背景噪音的家中環境。
- 包含該市場中人們實際使用的設備,這些設備可能與你們團隊使用的設備不同。
- 如果模型將滿足該要求,則需包含 電話頻段音頻;帶寬縮減並非寬頻訓練模型默認處理的內容。
- 記錄 每會話的元數據 — 設備、環境、說話者層級、會話條件。元數據缺失是導致語料庫無法後續重新平衡的原因。
轉錄規範
此後所有質量指標的決策依據。在首次轉錄前,須以書面形式達成一致:
- 正字法。 採用哪種拼寫規範,以及對於無標準拼寫詞彙的處理方式。
- 數字、日期和縮寫 — 以口語形式書寫還是以數字形式書寫。
- 不流暢表達 — 填充音、錯誤開頭、重複:是否轉錄、是否標註或是否捨棄。
- 語言混合現象 — 如何標記混合語言片段。
- 非語音事件 — 笑聲、噪音、重疊語音。
- 多說話人音頻的說話人標籤。
- 不確定性 — 語音轉錄員如何標記不可理解的音頻,而不是進行猜測。
最後這一點值得堅持。一個沒有方式表達‘我聽不到’的約定,會產生自信的錯誤轉錄,而這種錯誤比空白更嚴重,因為它們會訓練模型生成虛構的文本。
質量驗證
WER = (Substitutions + Insertions + Deletions) ÷ Reference words
四項要求:
- 按方言和聲學條件分別報告WER,而不是按語言。總體指標會被最容易的層次所主導。
- 在雙轉錄子集上測量不同轉錄員之間的一致性。一致性低意味著該約定是模糊的——這是最早且最便宜的信號,表明該指南需要改進。
- 使用原生構建的黃金標準集,定期更新,並以預定速率注入實時工作流程,從而使質量持續測量而非僅在交付時測量。
- 讓本地評審員傾聽,而不僅僅是閱讀。一些錯誤——方言錯誤、不自然的朗讀、非母語者發聲——在文本轉錄中是聽不到的,但在音頻中卻非常明顯。
同意、倫理與來源追溯
對於收集到的語音數據,這是資產與負債之間的區別。
- 知情同意,以說話者母語表達,涵蓋錄音的用途,包括後續和商業用途,以及數據保留時長。
- 可執行的退出路徑——一個無法追溯到具體文件的退出權利,並不構成真正的權利。
- 個人身份信息處理。 自發性語音中包含姓名、地址等個人細節,這些是說話者並未意圖永久保留的內容。檢測與編輯應作為流程的一部分。
- 每項內容的來源追溯——會話、說話者層級、同意記錄、轉錄員和評審員。
- 社區尊重,即一種語言屬於小眾或邊緣化社區的情況。應確保公平補償、使用情況的透明性,以及在適當情況下,讓該社區自身能夠訪問由此產生的資源。
Lifewood的應對方式
低資源語言的語音數據是 Lifewood 專項工作,而非其通用語音工作的延伸。該工作以實地採集與市場運營相結合的方式進行:涵蓋多樣地理和人口群體的定製化數據採集,包括圖像、視頻和音頻記錄,並輔以多語言轉錄和音素標註。
這種模式能夠奏效,原因在於其組織結構。30多個國家的40多個交付中心覆蓋中國、菲律賓、馬來西亞、印度和孟加拉國,以及非洲、歐洲和北美,擁有50多種語言和56,788名參與者。這使團隊能夠在目標市場當地招募並核驗語言使用者,而非遠程尋找人員——這一步決定了方言分層是真實有效,還是僅有名義上的分類。Lifewood自2004年起開展多語言數據業務,目前的AI數據公司於2018年成立;語音與語言項目服務於語音AI開發者。
參見 低資源語音數據、多語言數據採集、AI數據服務 和 全球AI數據。
資料與進一步閱讀
- 配套指南:多語言大語言模型訓練數據 和 選擇AI標註服務的9項標準。
- Lifewood 低資源語音數據範圍發佈於 lifewood.com/low-resource-speech-data。