9 月 11 日,小米技术官方宣布,正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。这款模型瞄准的是语音识别领域一个存在了几十年的老问题——”鸡尾酒会难题”。
一个人说得清,几个人就抓瞎
所谓鸡尾酒会难题,指的是这样一种情况:现有的语音识别技术已经能以较高精度识别一个人说的话,可一旦说话人数变成两人甚至多人、声音彼此重叠,识别率就会出现断崖式下跌。
人类在嘈杂的饭局上能自动锁定对面朋友的声音,把周围噪音当成背景过滤掉,机器长期以来却很难做到这一点。会议纪要、车载语音、多人访谈这类场景,恰恰全是多人同时开口的场合。
Xiaomi-CocktailASR-1 的做法是把问题直接换了个解法。模型采用端到端的 LLM 架构,不再走”先分离声音、再识别内容”的两段式老路,而是把目标说话人的一段参考音频作为声纹提示丢给模型,让它在多人重叠的语音流里,精准提取并只转录这个人的话。
换句话说,只要先给模型听一段”要听谁”的样本,它就能在混乱的音频中锁定这个人,其余人的声音被自动过滤。
多个主流测试集达到最优,单人场景也不掉队
小米方面表示,该模型基于大规模多说话人数据训练,在 AliMeeting、AMI、LibriMix 等多个主流多说话人测试集上均达到最优性能,大幅领先现有方案。
更关键的一点是它不需要两套系统。Xiaomi-CocktailASR-1 在单说话人场景下的识别表现,可以与主流单人语音识别模型相媲美。这意味着同一个模型既能应付多人混说,也能无缝处理单人说话,不必在不同模型之间来回切换。
目标不在场,就输出空文本
在实际落地中,误触发往往比识别不准更让人头疼。会议室里旁边有人随口一句,语音助手就自作主张开始记录,这类问题在车载和智能音箱场景里尤其常见。
Xiaomi-CocktailASR-1 具备负样本拒识能力:当音频中并不存在目标说话人时,模型会输出空文本,而不是硬凑一句识别结果出来。这一设计能显著降低非目标语音带来的误识别和误触发风险。
此外,该模型还支持思维链推理模式,能够为识别结果提供具备可解释性的推理过程。对于需要调试语音系统、或者需要判断识别结果是否可信的场景,这项能力比单纯输出一串文字更有价值。
权重和推理代码一并开源
目前,Xiaomi-CocktailASR-1 的模型权重与推理代码已经开放,托管在 GitHub 与 Hugging Face 两个平台上。
对国内开发者而言,”工业级””目标说话人””多说话人最优”这几个标签叠在一起还直接开源,意味着语音交互、会议记录、助听设备、车载座舱等方向的团队,可以跳过从零训练的成本,直接在现有产品里试用。
多人同时说话时只听一个人的声音,这件事听上去简单,做起来极难。小米这次不仅做出来了,还把它交到了所有开发者手里。
