Google 近日发布 Gemini 3.5 Transcribe,这是 3.5 系列中的一款专用模型,定位是语音转文字。与以往只做”听写”不同,它会在输出阶段对口语进行整理:自动删去”嗯””那个”之类的填充词,修正口误,并参考用户提供的专业词表处理行业术语,最终给出一段通顺的成文。
比旧引擎快七成,错误率降到 5.5%
Google 给出的数据是,从开口说话到生成最终文字,Gemini 3.5 Transcribe 比上一代语音识别引擎 Chirp 3 快约 70%;实时语音的错误率从 Chirp 3 的 7.32% 下降到 5.5%。虽然降幅不算惊人,但语音输入最怕事后改错别字,任何提升都有实际价值。
该模型支持 85 种语言,对预先录制的音频最多可区分 3 名说话人。它目前已经用在 Gboard 输入法的 Rambler 功能中(首发于 Pixel 11 手机),macOS 版 Gemini 应用的语音输入也从即日起获得这项能力。
已经上线和即将到来的地方
除了 Gboard 与 Gemini 应用,Google 表示 Antigravity 已接入新模型,可在获得授权后结合屏幕内容与聊天记录;AI Studio 的构建模型也已可用,开发者能用优化过的语音转文字来”声控写代码”。开发者还能通过 Gemini API 直接调用该模型。
Google 还计划把这项转写能力带进 Chrome 浏览器,届时可在任意网页输入框用语音写邮件、发评论,甚至直接向聊天机器人下指令。

可用性提示
需要说明,Google 的 Gemini 系列服务目前尚未在中国内地提供,Pixel 11 也未在中国大陆正式销售,因此文中的 Rambler 等功能对国内用户暂时无法体验。对于关注 AI 语音技术的读者,这款模型展示了”听得清”之外”整理得干净”的新方向。







