随着智能座舱从指令响应走向主动感知,车辆不仅要理解语音指令,还要识别车内人员的身份、动作、状态及人与物之间的交互。模型训练所需的数据也从单一图像或语音,扩展到覆盖不同人群、光照条件、传感器模式和交互任务的多模态数据。
目标
某头部智能电动汽车企业需要持续建设车内视觉、音频及多模态训练数据,用于支持视觉语言模型、身份识别、乘员状态监测、儿童与手势交互、宠物和车内物品识别模型训练,以及多语种及方言语音交互能力建设。

挑战
系列项目在车型、任务、人群和验收规则上各不相同。采集既要覆盖成人、老人、儿童等常规人群,也涉及双胞胎、儿童互动和宠物等特殊样本;既包含白天与夜间的RGB和红外数据,也涉及动作视频、人员信息、语音及转写标注。
多车型、多任务会同时占用车辆、场地、设备和验收资源,局部环节滞后可能影响整体排期。部分试验车辆尚未上市,人员和设备进入现场后还要严格控制信息泄露风险。静态采集需要车辆保持上电,动态采集涉及车辆行驶,质量、安全与保密必须同步管理。
解决方案
围绕多车型、多任务并行带来的资源协同压力,以及批次质量、试验车辆保密和现场安全等要求,海天瑞声统筹人员组织、车辆排期、采集执行和质量验收,分别建立数据规划与资源弹性调用、采集与验收质量闭环、试验车辆保密与安全三项机制,为各项挑战配置对应的执行措施和管理节点。

数据规划与资源弹性调用
项目启动前,海天瑞声根据数据集目标制定采集规划,以人员、车辆、设备和采集内容为四个基础维度,拆解不同人群、车型、场景时段和任务配额。
项目团队结合车辆数量、任务量和验收能力建立效率模型,形成日产能和批次计划,并按照优先级滚动排产,在保证样本覆盖均衡性的同时统筹采集效率。
人员按照成人、老人、儿童及特殊样本分类建池并配置备用资源。当人员临时退出或人群比例出现偏差时,项目团队可以及时补充对应资源。
同时,项目还引入先验视频机制,将部分样本优先提交审核,提前确认动作执行、拍摄效果和数据格式,并根据反馈调整后续采集,避免批量返工。
采集与验收质量闭环
针对任务标准不一、批次质量容易波动的问题,明确动作执行、场景条件、人群比例、设备检查、信息记录和文件目录等要求,形成采集手册与质检清单。采集人员完成专项培训和考核后方可上岗。
采集过程中,项目团队检查摄像头状态并完成设备标定,同时核对动作执行、人员信息和数据完整性。每批数据先进行内部复核,不合格数据及时返工或补采。
针对儿童、手势等任务中数据容易错配的问题,采用统一任务编号贯通采集、标注和交付。语音数据则按照语种、方言及单人或多人场景分别验收,并核对音频、转写内容和目录结构。
试验车辆保密与安全机制
针对未上市车辆的信息泄露风险,所有参与人员进场前完成专项保密培训并签署保密文件。涉密区域实行访问控制和监控留痕,个人电子设备不得带入车辆,项目设备统一管理。车辆进场、使用和离场均需检查,降低外观、内饰及测试信息暴露风险。
静态采集通过车辆制动、车轮限位、钥匙管理和安全监护防止车辆误动;动态采集实行驾驶员考核、限速运行和随车安全管理,将安全要求嵌入采集过程。
方案价值
从数据目标拆解、采集规划到资源调度,项目建立了贯通规划与执行的数据生产链路。分层资源池和滚动排产保障样本覆盖,先验视频、批次复核和补采机制让问题更早暴露,安全保密机制降低试验车辆采集风险。
统一的任务编号、数据目录和验收口径,减少了采集、标注与交付环节的数据错配,为后续数据接入和扩展提供一致基础。
服务能力
通过该系列项目,海天瑞声进一步验证了智能座舱多模态数据项目的资源组织、现场执行、质量控制及安全保密能力。
海天瑞声可根据客户的车型、传感器、场景定义和验收标准,提供从方案设计、资源组织、现场采集到标注验收的数据服务,为座舱模型训练与迭代提供稳定的数据基础。