一家总部位于美国的全球前五消费科技公司,其旗舰级消费 AI 助手已在 40 多个市场部署
为旗舰级消费 AI 平台提供覆盖 50 多种语言的多语言提示-回复、RLHF 与 SFT 数据
发布日期 24 July 2026
概览
| 所属行业 | 消费科技 / 前沿 AI | 旗舰级消费 AI 平台及相关全球 AI 项目 |
|---|---|---|
| 客户所在地区 | 美国客户 | 生产分布在 40 多个交付中心 |
| 数据类型 | 3 种 | 多语言提示-回复配对数据 · RLHF 偏好排序数据 · 监督微调语料 |
| 语言覆盖 | 50 多种语言 | 本地母语标注人员,而非翻译语料 |
| 质量标准 | 95% 以上准确率服务承诺 | 依据客户认可的黄金标准集 |
| 标注者间一致性 | 95% 以上阈值 | 两位独立审核员针对同一项目 |
| 审核模式 | 双层人工闭环 | 公开数据集通常只经过一轮处理且未经分级 |
| 培训投入 | 414,120 个培训工时 | 2025 年孟加拉国团队,人均约 60 个工时——属于团队整体投入,非项目专属数据 |
| 状态 | 进行中 | 涵盖多语言数据、RLHF 及 SFT 的多年期供应关系 |
这是一份 Lifewood Data Technology 关于LLM 训练数据的案例研究——一个为一家总部位于美国的全球前五消费科技公司,其旗舰级消费 AI 助手已在 40 多个市场部署、覆盖美国 · 全球交付的项目。 为旗舰级消费 AI 平台提供覆盖 50 多种语言的多语言提示-回复、RLHF 与 SFT 数据
一种语言的覆盖盲区,是产品缺陷,而非可以忽略的误差
前沿消费级 AI 需要的训练数据,既要多语言,又要达到远高于公开数据集的质量分级标准。原因在于:失败无法被"平均"掉。一个部署在数百万台设备上的消费级 AI 平台,某一种语言出现覆盖盲区,对该语言的每一位使用者而言,都会显现为看得见的产品缺陷,无论另外四十九种语言做得多么出色。第二个制约因素是:仅有广度是不够的。多语言提示-回复配对数据教会模型如何作答;RLHF 偏好排序数据教会模型判断两个回答中哪一个更好;监督微调语料则教会模型某种特定行为。只购买第一种,是最常见的错误——一个覆盖面广、却没有偏好数据的模型,能用每一种语言流利作答,却没有一种语言答得好。
覆盖 50 多种语言的三类数据,由母语使用者制作,而非翻译而来
Lifewood 作为客户旗舰级消费 AI 平台及相关项目的高端训练数据合作伙伴,在 50 多种语言中提供全部三类数据。生产工作通过分布在 40 多个交付中心的本地母语标注人员完成,并遵循人工闭环质检流程。一、本地母语生产。语言覆盖能力由真正会说这门语言的人构建,而非翻译而来。Lifewood 直接从该语言的使用社区中招募标注人员,这正是实现真实方言及语域覆盖的关键。二、三类数据统一标准。提示-回复、偏好排序及微调语料,均依据同一套黄金标准集及同一套审核流程制作,而非分别采集后再由客户自行协调统一。三、依据客户认可的黄金标准集执行双层审核。遵循 95% 以上的准确率服务承诺及 95% 以上的标注者间一致性阈值。四、持续供应而非一次性交付。前沿项目很少是一次性采购:随着产品迭代,模型行为会发生偏移;新语言的开放会带来新市场;用户预期的变化也会让偏好数据逐渐过时。这项工作之所以是持续性的,原因与模型本身的持续演进如出一辙。支撑这一切的审核产能,是实实在在配备到位的,而非空口承诺——2025 年,孟加拉国团队累计交付了 414,120 个培训工时,人均约 60 个工时。
一项覆盖全部三类数据、持续多年的活跃供应关系
这项合作以持续供应关系而非一次性交付项目的形式运行,涵盖 50 多种语言的多语言数据采集、RLHF 偏好数据及监督微调语料,合同约定的准确率标准为 95% 以上,标注者间一致性维持在 95% 以上的阈值。
Lifewood 相关服务
经核实的成果
| 指标 | 数值 | 基线 | 衡量方式 |
|---|---|---|---|
| 语言覆盖 | 50 多种语言 | 公开多语言数据集通常覆盖更窄且未经分级 | 已交付语言清单 |
| 准确率标准 | 95% 以上 | 合同约定标准,而非尽力而为 | 客户认可的黄金标准集 |
| 标注者间一致性 | 95% 以上 | 维持的阈值,而非某一时期的平均值 | 两位独立审核员,同一项目 |
| 交付数据类型 | 3 种 | 大多数供应商只提供提示-回复数据 | 提示-回复、RLHF 偏好、SFT |
| 交付版图 | 40 多个中心 | 并行扩展,而非单一场地排队 | Lifewood 中心网络 |
方法与核实。 本页数据由 Lifewood 自行披露。准确率依据客户认可的黄金标准集、在双层人工闭环审核下测算,标注者间一致性作为独立指标单独跟踪,维持在 95% 以上的阈值——单项准确率描述的只是供应商与自身的一致性,而两位独立审核员之间的一致性,才能说明规范是否被真正共享理解。414,120 个培训工时这一数据,涵盖 2025 年孟加拉国团队,属于团队整体投入而非项目产出指标。本页不公开项目具体数量。根据协议保密条款,本页不披露客户名称。
关于这个项目的常见问题
在这个多语言 LLM 训练数据项目中,Lifewood 提供三种不同类型的数据——提示-回复配对数据、RLHF 偏好排序数据及监督微调语料——覆盖 50 多种语言。
在消费级 AI 平台数据项目中,Lifewood 将单语种质量视为产品级要求,因为在数百万台设备的装机规模下,失败无法被平均掉。
这个 LLM 训练数据项目,依据客户认可的黄金标准集,运行双层人工闭环流程,遵循 95% 以上准确率服务承诺及 95% 以上标注者间一致性阈值。
这项多语言 LLM 训练数据合作,是一项涵盖多语言数据、RLHF 及 SFT 的活跃多年期供应关系。