一家為亞太及非洲語言市場的消費設備打造語音識別技術的全球語音 AI 公司
覆蓋 11 種語言、8 個國家的 14,000 小時語音數據,將詞錯誤率降低 92%
發佈日期 2026年7月24日
概覽
| 所屬行業 | 消費科技 / 語音 AI | 語音助手向新興市場的拓展 |
|---|---|---|
| 地區 | 8 個國家 | 非洲及東南亞地區實地作業 |
| 使用的服務 | 3 項 | 語音採集 · NLP · 多語言數據採集 |
| 項目規模 | 14,000 小時 | 覆蓋 11 種語言的已採集語音數據 |
| 貢獻者規模 | 6,200 多名母語使用者 | 覆蓋城鄉社區、年齡性別口音結構均衡 |
| 準確率成果 | 詞錯誤率下降 92% | 客戶語音 AI 在目標語種上,相較項目啟動前基準的表現 |
| 市場成果 | 11 種語言 | 在客戶語音助手中於 9 個月內上線 |
| 基線覆蓋 | 15 種語言 | 項目啟動前該助手可運行的語言數量 |
| 倫理化採集 | 100% 合規 | 經第三方審計驗證;貢獻者報酬高於當地公平工資基準,並獲得完整知情同意 |
| 狀態 | 已交付 | 11 種語言已在 9 個月內上線 |
這是一份 Lifewood Data Technology 關於多語言語音 + LLM的案例研究——一個為一家為亞太及非洲語言市場的消費設備打造語音識別技術的全球語音 AI 公司、覆蓋中國 · 亞太地區交付的項目。 覆蓋 11 種語言、8 個國家的 14,000 小時語音數據,將詞錯誤率降低 92%
一款在 15 種語言中運行良好的語音助手,卻在最需要增長的市場全面失效
客戶的語音助手在 15 種主要語言上表現良好,但在數字語音數據極度匱乏的新興市場語言中卻頻頻失效,而這些市場潛藏著數以億計的潛在用戶。目標語種沒有現成的語音數據集可用,客戶也無法出於倫理考量大規模抓取語音數據。這意味著必須在客戶完全沒有運營基礎的地區,從零開始開展采集工作。真正讓工作變難的制約因素,是代表性。發音人必須涵蓋不同年齡、性別、口音及錄音環境,這樣最終打造出的語音 AI,才能覆蓋整個人群,而非僅僅是城市中的一小部分。一個僅在某一地點便利採集的數據集,無論規模擴大到多大,都只會不斷復現該地點的人群結構——而這恰恰是眾包平臺所產生的典型失效模式,因為眾包平臺的人群結構往往偏向城市化、受過高等教育、使用高資源語言的群體,並系統性地遺漏方言及語域上的差異。
在八個國家開展實地作業,深入社區招募而非依賴線上渠道
Lifewood 在 8 個非洲及東南亞國家啟動了實地作業,從城鄉社區中招募了 6,200 多名母語使用者。貢獻者獲得高於當地公平工資基準的合理報酬,並完整記錄知情同意文件。採集內容涵蓋腳本化提示詞、即興對話,以及圍繞電商、導航及媒體等領域、貼合客戶助手使用場景的專屬指令。一、社區內部招募。貢獻者通過實地作業、直接從該語言社區內部招募,而非來自眾包平臺——這正是能夠實現真實方言、語域及口音覆蓋的根本前提。二、按設計實現的人群結構均衡。發音人群體在年齡、性別、口音及錄音環境上的均衡,是招募階段就設定好的規格要求,而非事後篩選。三、環境多樣性抽樣。錄音條件被有意設計得多種多樣,讓模型學習的是"語音本身",而非"錄音棚環境"。四、語音轉錄及質量把控。質量把控包括語音轉錄、發音人群體結構均衡及環境噪聲多樣性抽樣,均在 Lifewood 95% 以上準確率服務承諾及雙層人工閉環審核之下完成。支撐這一項目的語言覆蓋能力,涵蓋 50 多種語言、觸及全球 90% 以上人口,包括非洲的斯瓦希里語、沃洛夫語、豪薩語、阿姆哈拉語、提格利尼亞語、約魯巴語、祖魯語、紹納語、林加拉語及索馬里語,以及東南亞及太平洋地區的菲律賓語、宿務語、伊洛卡諾語、瓦萊語、高棉語、托克皮辛語、德頓語、斐濟語及薩摩亞語。
詞錯誤率下降 92%,十一種新市場語言在九個月內上線
該項目在 8 個國家、從 6,200 多名獨立發音人處採集了覆蓋 11 種語言的 14,000 小時語音數據。客戶方面,目標語言的詞錯誤率相較項目啟動前的基準下降了 92%,並且在項目啟動後九個月內,11 種新市場語言在其語音助手中正式上線 —— 而項目開始前的可用語言基數僅為 15 種主要語言。
Lifewood 相關服務
經核實的成果
| 指標 | 數值 | 基線 | 衡量方式 |
|---|---|---|---|
| 已採集語音數據 | 14,000 小時 | 目標語種此前不存在可用的公開語料 | 覆蓋 11 種語言的已驗收交付 |
| 獨立發音人 | 6,200 多名 | 年齡、性別、口音及環境結構均衡 | 覆蓋 8 個國家的實地招募記錄 |
| 詞錯誤率 | 下降 92% | 相較客戶目標語種項目啟動前的基準 | 客戶方在目標語種測試集上的評估 |
| 已上線市場語言 | 11 種 | 基於 15 種主要語言的基數 | 客戶助手在 9 個月內的發佈記錄 |
| 覆蓋國家 | 8 個 | 客戶此前在這些市場沒有運營基礎 | 按國家啟動的實地作業 |
方法與核實。 本頁數據來自已交付數據量記錄及客戶方評估。工時數、發音人數量及國家覆蓋,均為 Lifewood 實際交付數據。92% 的詞錯誤率下降,是客戶在目標語種測試集上、相較項目啟動前基準測得的成果,11 種已上線市場語言為客戶方發佈里程碑,而非 Lifewood 的交付物本身。倫理化採集合規性,經第三方審計驗證達到 100%,而非自我評估。根據本次合作的保密條款,本頁不披露客戶名稱。
關於這個項目的常見問題
Lifewood 通過深入社區的實地作業招募母語使用者來採集低資源語音數據——在這個項目中,覆蓋了 8 個非洲及東南亞國家的 6,200 多名發音人。
在 Lifewood 的語音採集項目中,人群結構均衡是招募階段的規格要求,因為一個僅在某一地點便利採集的數據集,無論規模擴大到多大,都只會不斷復現該地點的人群結構。
Lifewood 完整記錄知情同意文件,並向貢獻者支付高於當地公平工資基準的報酬;在這個項目中,倫理化採集合規性經第三方審計驗證達到 100%。
這個多語言語音採集項目交付了覆蓋 11 種語言的 14,000 小時數據,其中 11 種新市場語言在九個月內於客戶語音助手中上線。