Meta 发布首款实时音频感知模型
Meta 于 9 月 1 日发布 Muse Voice Transcribe,这是其第一款实时音频感知模型,由 Meta Superintelligence Labs 打造。该模型将流式语音识别、说话人分离与时间端点检测结合在一起,能够在说话的同时完成转写,并自动区分录音中 20 位以上的不同说话人,判断某人何时说完一句话,全程无需额外的后处理步骤。

支持 70 多种语言,按小时计费
Muse Voice Transcribe 在超过 70 种语言上完成训练,发布时已有 25 种语言通过验证,可处理超过一小时的音频,并支持句内与句间的母语级代码切换。模型还引入了名为「自适应延迟」的机制:对容易识别的语音快速输出,对困难词汇则调用更多音频上下文后再做判断。
据 Meta 介绍,该模型在 Artificial Analysis 的流式语音转写排行榜上排名首位(截至 9 月 1 日)。通过 Meta Model API 调用时,价格为每 1000 音频分钟 3 美元,约合每小时 0.18 美元。
已接入 Mac 端与编程工具
目前,该模型已为 Meta AI for Mac 与 Muse Code 中的听写功能提供支持。在 Mac 上,用户按住 Fn 键即可向任意应用进行语音输入。相关能力由 Meta 研究员 Spencer Barnett 于 9 月 1 日在社交平台 X 上公布。
中文市场用户需注意
需要说明的是,Muse Voice Transcribe 目前主要依托 Meta AI 生态,面向以英语为主的市场,在中国内地并未正式提供服务。对于中文用户,类似的实时语音转写与会议纪要能力,已可由国内多家语音技术厂商与办公协作产品提供;本文仅作技术动态介绍,不构成使用建议。







