跳转到主要内容
C 类 —— 垂直领域 LLM 数据

类 ——
垂直领域 LLM 数据

垂直领域 LLM 数据,是通用语料的领域专用对应版本:专为单一行业(而非所有行业)打造的数据——自动驾驶标注、车内数据采集,以及面向企业或私有模型的专业语料,均遵循 95% 以上的准确率服务承诺交付。

面向驾驶员监测系统的自动驾驶及智能座舱数据集

招商局集团:用于构建"ShipGPT"的企业级数据集

01

垂直领域 LLM 数据:目标、解决方案及成果

01 / 03
01

目标

目标

采集
Target

运用 2D 与 3D 标注技术,对车辆、行人及道路物体进行标注,为自动驾驶实现精准的物体检测。自动驾驶汽车依赖精确的视觉训练数据,才能在真实道路环境中完成检测、分类及安全响应。

23 个国家6 种项目类型9 个数据领域25,400 个有效小时

垂直领域 LLM 数据,一次讲清楚

什么是垂直领域 LLM 数据?

垂直领域 LLM 数据,是专为某一个行业(而非所有行业)打造的领域专用训练数据——自动驾驶、车载系统,或是企业依据自身领域训练的私有模型。它能让一个具备通用能力的模型,转变为在特定主题上准确可靠的模型,也是准确率要求通常最为严苛的地方。

为什么垂直领域项目的准确率门槛会更高?

因为误差预算是物理层面的,而非统计层面的。在 自动驾驶场景中,一个被错误标注的行人,不是一个百分点的误差,而是一种失效模式——这正是为什么 Lifewood 针对 L4 级别场景,将标注准确率基准定在 99.9%,相较于适用于一般项目的 95% 以上服务承诺,标准更为严苛。

私有或企业级 LLM 项目涉及哪些内容?

一份由组织自身材料——文档、记录、转录文本——汇编而成的语料库,经过清洗、结构化及标注处理,使模型能够在其基础上进行训练或微调,而不会围绕它产生数据泄露或幻觉。这项工作遵循与其他所有项目相同的双层 审核流程 及审计记录,而这正是采购与合规部门所要审查的内容。

Frequently asked questions

当模型在某一特定领域必须做到准确、而不仅仅是表达流畅时。通用型数据建立起通用能力;垂直领域数据则提供领域知识。大多数生产级项目会同时使用两者,而只采购通用型数据,往往正是导致模型"听起来很权威、却恰恰在关键领域出错"的常见原因。

用于三维结构识别的 LiDAR 点云、用于语义理解的多摄像头检测、用于测速及恶劣天气应对的雷达,以及用于座舱内部的驾驶员监测数据。真正的难点在于融合——让各个模态达成一致——而这恰恰是单一模态供应商通常止步的地方。Lifewood 通过位于马来西亚及印度尼西亚的专属自动驾驶中心来完成这项工作。

通过在当地招募的、人群结构均衡的参与者群体,以及受控的座舱内录制,并针对具体用途记录知情同意。人群结构的均衡性,必须在招募环节就设计到位:一个仅在某一地点便利采集的数据集,无论规模扩大到多大,都只会不断复现该地点的人群结构。

可以。企业级及私有模型项目,遵循与 Lifewood 其他工作相同的审计记录流程,每一批次均带有时间戳审批,确保一份已交付的数据集,在多年之后依然可以追溯到其采集及审核所依据的具体条款。