Grok 语音转写 2.0 发布:错误率减半,价格不变

SpaceXAI(xAI)于当地时间 9 月 18 日发布了 Grok Voice Transcribe 2.0 语音转文本模型。在保持价格不变的前提下,新版本将词错误率(WER)较上一代降低约一半,并在独立评测榜单 Artificial Analysis 的流式转写准确率排名中位列 32 款模型之首。

Grok Voice Transcribe 2.0 官方示意图

准确率登顶流式榜单

根据 Artificial Analysis 的 AA-WER Streaming 评测,Grok Voice Transcribe 2.0 在最终转录结果上的词错误率为 2.7%,而上一代 1.0 版本为 3.9%。在首个部分转录结果上,新版本词错误率从 1.0 的 18.3% 大幅降至 3.4%,响应时间为语音结束后的 0.49 秒。

非流式场景下,2.0 版本的词错误率为 2.3%,在全部 59 款模型中排第 5 位。SpaceXAI 称,该模型在流式转写的准确率上超越了 Meta 的 Muse Voice Transcribe 与 ElevenLabs 的 Scribe v2 Realtime 等竞争对手。

四项内部测试全面领先

除公开榜单外,SpaceXAI 基于线上实际业务采样了四个内部数据集进行系统评测,新版本在四项测试中均全面超越 1.0 版本:8 kHz 客服电话音频词错误率从 10.6% 降至 7.1%;与 Grok 的日常英语对话从 8.7% 降至 3.3%;人名、邮箱、地址等口述信息从 7.2% 降至 3.2%;覆盖 19 种语言的简短语音指令从 20.6% 降至 6.8%。

SpaceXAI 表示,Grok Voice 底层音频基础模型目前已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时视频旁白,并为实体硬件中的语音智能体提供支撑,其中包括特斯拉车辆搭载的 Grok 助手。企业协作软件商 Atlassian 已在旗下 Loom 录屏平台中采用该模型,用于为 Cursor 等编码工具生成可落地的开发口述转录。

价格不变,功能加码

Grok Voice Transcribe 2.0 的定价与 1.0 版本完全一致:批量转录为每小时音频 0.10 美元(现汇率约合 0.67 元人民币),实时流式转录为每小时 0.20 美元(现汇率约合 1.3 元人民币)。说话人分离、精确时间戳以及自定义关键词功能均已包含在内,无需额外付费。

新版本新增了多项能力:带置信度评分的逐词时间戳、最多 8 通道的独立转录、智能语音分段检测,以及每次请求最多可传入 100 个领域专属词汇的关键词偏置,用以提升专有名词与术语的识别率。开发者可通过 SpaceXAI 的语音转文本接口调用,批量请求支持最大 500 MB 文件,流式请求通过 WebSocket 端点传输。

SpaceXAI 表示,1.0 版本将在未来数周内逐步弃用,2.0 版本将接任默认模型;过渡期内开发者仍可通过指定版本号继续使用旧接口。对现有集成而言,切换到 2.0 无需修改代码。