一家为亚太及非洲语言市场的消费设备打造语音识别技术的全球语音 AI 公司
覆盖 11 种语言、8 个国家的 14,000 小时语音数据,将词错误率降低 92%
发布日期 24 July 2026
概览
| 所属行业 | 消费科技 / 语音 AI | 语音助手向新兴市场的拓展 |
|---|---|---|
| 地区 | 8 个国家 | 非洲及东南亚地区实地作业 |
| 使用的服务 | 3 项 | 语音采集 · NLP · 多语言数据采集 |
| 项目规模 | 14,000 小时 | 覆盖 11 种语言的已采集语音数据 |
| 贡献者规模 | 6,200 多名母语使用者 | 覆盖城乡社区、年龄性别口音结构均衡 |
| 准确率成果 | 词错误率下降 92% | 客户语音 AI 在目标语种上,相较项目启动前基准的表现 |
| 市场成果 | 11 种语言 | 在客户语音助手中于 9 个月内上线 |
| 基线覆盖 | 15 种语言 | 项目启动前该助手可运行的语言数量 |
| 伦理化采集 | 100% 合规 | 经第三方审计验证;贡献者报酬高于当地公平工资基准,并获得完整知情同意 |
| 状态 | 已交付 | 11 种语言已在 9 个月内上线 |
这是一份 Lifewood Data Technology 关于多语言语音 + LLM的案例研究——一个为一家为亚太及非洲语言市场的消费设备打造语音识别技术的全球语音 AI 公司、覆盖中国 · 亚太地区交付的项目。 覆盖 11 种语言、8 个国家的 14,000 小时语音数据,将词错误率降低 92%
一款在 15 种语言中运行良好的语音助手,却在最需要增长的市场全面失效
客户的语音助手在 15 种主要语言上表现良好,但在数字语音数据极度匮乏的新兴市场语言中却频频失效,而这些市场潜藏着数以亿计的潜在用户。目标语种没有现成的语音数据集可用,客户也无法出于伦理考量大规模抓取语音数据。这意味着必须在客户完全没有运营基础的地区,从零开始开展采集工作。真正让工作变难的制约因素,是代表性。发音人必须涵盖不同年龄、性别、口音及录音环境,这样最终打造出的语音 AI,才能覆盖整个人群,而非仅仅是城市中的一小部分。一个仅在某一地点便利采集的数据集,无论规模扩大到多大,都只会不断复现该地点的人群结构——而这恰恰是众包平台所产生的典型失效模式,因为众包平台的人群结构往往偏向城市化、受过高等教育、使用高资源语言的群体,并系统性地遗漏方言及语域上的差异。
在八个国家开展实地作业,深入社区招募而非依赖线上渠道
Lifewood 在 8 个非洲及东南亚国家启动了实地作业,从城乡社区中招募了 6,200 多名母语使用者。贡献者获得高于当地公平工资基准的合理报酬,并完整记录知情同意文件。采集内容涵盖脚本化提示词、即兴对话,以及围绕电商、导航及媒体等领域、贴合客户助手使用场景的专属指令。一、社区内部招募。贡献者通过实地作业、直接从该语言社区内部招募,而非来自众包平台——这正是能够实现真实方言、语域及口音覆盖的根本前提。二、按设计实现的人群结构均衡。发音人群体在年龄、性别、口音及录音环境上的均衡,是招募阶段就设定好的规格要求,而非事后筛选。三、环境多样性抽样。录音条件被有意设计得多种多样,让模型学习的是"语音本身",而非"录音棚环境"。四、语音转录及质量把控。质量把控包括语音转录、发音人群体结构均衡及环境噪声多样性抽样,均在 Lifewood 95% 以上准确率服务承诺及双层人工闭环审核之下完成。支撑这一项目的语言覆盖能力,涵盖 50 多种语言、触及全球 90% 以上人口,包括非洲的斯瓦希里语、沃洛夫语、豪萨语、阿姆哈拉语、提格利尼亚语、约鲁巴语、祖鲁语、绍纳语、林加拉语及索马里语,以及东南亚及太平洋地区的菲律宾语、宿务语、伊洛卡诺语、瓦莱语、高棉语、托克皮辛语、德顿语、斐济语及萨摩亚语。
词错误率下降 92%,十一种新市场语言在九个月内上线
该项目在 8 个国家、从 6,200 多名独立发音人处采集了覆盖 11 种语言的 14,000 小时语音数据。客户方面,目标语言的词错误率相较项目启动前的基准下降了 92%,并且在项目启动后九个月内,11 种新市场语言在其语音助手中正式上线 —— 而项目开始前的可用语言基数仅为 15 种主要语言。
Lifewood 相关服务
经核实的成果
| 指标 | 数值 | 基线 | 衡量方式 |
|---|---|---|---|
| 已采集语音数据 | 14,000 小时 | 目标语种此前不存在可用的公开语料 | 覆盖 11 种语言的已验收交付 |
| 独立发音人 | 6,200 多名 | 年龄、性别、口音及环境结构均衡 | 覆盖 8 个国家的实地招募记录 |
| 词错误率 | 下降 92% | 相较客户目标语种项目启动前的基准 | 客户方在目标语种测试集上的评估 |
| 已上线市场语言 | 11 种 | 基于 15 种主要语言的基数 | 客户助手在 9 个月内的发布记录 |
| 覆盖国家 | 8 个 | 客户此前在这些市场没有运营基础 | 按国家启动的实地作业 |
方法与核实。 本页数据来自已交付数据量记录及客户方评估。工时数、发音人数量及国家覆盖,均为 Lifewood 实际交付数据。92% 的词错误率下降,是客户在目标语种测试集上、相较项目启动前基准测得的成果,11 种已上线市场语言为客户方发布里程碑,而非 Lifewood 的交付物本身。伦理化采集合规性,经第三方审计验证达到 100%,而非自我评估。根据本次合作的保密条款,本页不披露客户名称。
关于这个项目的常见问题
Lifewood 通过深入社区的实地作业招募母语使用者来采集低资源语音数据——在这个项目中,覆盖了 8 个非洲及东南亚国家的 6,200 多名发音人。
在 Lifewood 的语音采集项目中,人群结构均衡是招募阶段的规格要求,因为一个仅在某一地点便利采集的数据集,无论规模扩大到多大,都只会不断复现该地点的人群结构。
Lifewood 完整记录知情同意文件,并向贡献者支付高于当地公平工资基准的报酬;在这个项目中,伦理化采集合规性经第三方审计验证达到 100%。
这个多语言语音采集项目交付了覆盖 11 种语言的 14,000 小时数据,其中 11 种新市场语言在九个月内于客户语音助手中上线。