座舱助手的进步速度取决于训练数据。斑马把车队每日产生的海量语音与语言数据汇聚到 MOI,按统一事件模式标准化,音频、转写、向量与标签同库存放,训练集从「翻目录」变成「查数据」。
斑马网络成立于 2015 年 11 月,阿里巴巴集团为其最大股东,业务覆盖智能汽车操作系统与网联汽车解决方案,车队每日产生大规模的座舱语音交互数据。
斑马智行为汽车行业提供智能座舱与车联网解决方案,语音助手是座舱交互的主入口。
这类助手好不好用,取决于训练数据的质量与迭代速度——而不是取决于某一次模型选型。
路上行驶的车辆每天产生巨量的语音交互及其周边语言数据:原始语句、转写文本、识别出的意图、对话上下文、纠错与兜底事件,横跨不同车型、地域、口音和座舱环境。
要让这股数据流真正能用于深度学习训练,需要同时解决四件事。第一是以足够规模落盘;第二是保持带标注、可查询,而不是散落在存储上的一堆文件;第三是能够针对具体弱点组装训练集;第四是全程满足座舱音频所要求的隐私管控。
其中第三点最容易被低估。模型团队真正需要的从来不是「全部数据」,而是「助手在四川口音下兜底的那些会话」这种精确切片。如果数据只是按时间堆放,那么每一次实验都要先启动一个数据收集项目。
任何一环缺失,数据量再大也变不成模型能力——车队规模带来的优势会停留在存储账单上。
斑马智行把语音与语言数据汇聚到一套 MOI 平台上。数据从车队持续流入,按统一的事件 schema 标准化,与其结构化上下文——车型、地域、座舱状态、对话会话——一同存储。
关键在于转写文本、向量与标注也保存在同一个引擎中。音频、文本与向量分开存放是常见做法,但那样一来「按语义找、再按车型筛」就变成了跨系统拼接,而这恰恰是最高频的查询形态。
团队用查询来组装训练集,SQL 与向量相似度检索并用:助手发生兜底的那些语句、某个模型识别不佳的口音、围绕某一个意图的全部会话,都可以直接检索出来。
版本化的数据集进入深度学习训练与评估,评估结果再作为标注写回,使下一轮迭代直接对准真正失败的地方——数据平台由此形成闭环,而不只是一个数据出口。
音频、转写、向量与标注连同车型与会话上下文存放在同一个引擎里,训练语料是被检索出来的,而不是在目录里翻找出来的。
一次新实验从一条查询开始——这个意图、这个地域、这些兜底案例——而不是从一个数据收集项目开始,迭代速度由模型团队决定而不是由数据管线决定。
车型、地域、座舱状态与对话会话始终附着在每一条语句上,这正是能够定位模型究竟在哪里表现不佳的前提。
评估结果回写为标注之后,每一轮训练都比上一轮更有针对性,车队规模真正转化为模型能力。