语音识别终于能听懂你在说什么了

你用语音输入法的时候,有没有被同音词坑过?”期中考试”打成”期终考试”,”致癌物质”变”治癌物质”——机器听清了每个字,但就是不懂你的意思。

8 月 4 日,腾讯混元发布了新一代语音识别模型 Hy ASR 3.0 preview,核心升级就一句话:**从”逐字转写”变成”理解语境”。**

具体数据很能打。在开源评测集上,中文普通话词错误率(WER)3.34%、英语 2.62%、粤语 3.12%,全部压在 3% 左右——这个水平已经接近人类速记员的准确率。

但比数字更重要的,是它解决的三个实际痛点:

**第一,同音词不再靠猜。** 以前语音识别是纯声学信号处理,听到什么写什么。Hy ASR 3.0 接入了混元大模型 Hy3 的语义理解能力,能根据上下文自动纠错。会议纪要、访谈转写这种长音频场景,越往后转越准。

**第二,方言覆盖面广。** 支持 10 大方言片区、20 余个二级小片区。粤语、吴语、闽南语这些主流方言都能用,不用再刻意说”播音腔普通话”。

**第三,复杂环境稳得住。** 高噪声环境、耳语、悄悄话这些声学条件恶劣的场景做了专项优化。工厂车间、街头、会议室都能用。

技术架构上也有干货:采用 MoE(混合专家)架构,自研无监督语音编码器用了数千万小时级语音数据训练,还引入多阶段强化学习优化复杂场景的识别准确率。

目前该模型已上线腾讯云 API,腾讯元宝 App 已首发接入并免费开放方言识别和上下文纠错功能。

说白了,语音识别的竞争已经从”听得多准”升级到”懂你说什么”。对普通用户来说,最直接的感受就是:以后按住说话键,可以更随意、更自然地表达,不用担心机器把意思搞反了。

你平时用语音输入多吗?最常遇到的识别错误是什么?