每秒 1107 token:Mercury 2.5 凭什么最快

美国人工智能初创公司 Inception Labs(下称 Inception)于 2026 年 9 月 8 日发布了 Mercury 2.5。这是一款基于扩散架构的语言模型,官方给出的输出速度为每秒 1107 个 token,上下文长度 26 万 token,每百万输入 token 定价 0.20 美元、每百万输出 token 0.75 美元。在同期几款主打”低成本前沿”的小模型中,这组数字把速度拉到了一个明显靠前的位置。

不是逐字往外蹦,而是先画草稿再改

主流大语言模型采用自回归方式生成文本,也就是根据已经写出的内容,一个接一个地决定下一个 token。回答越长,等待时间越久。一次简单对话可能只多等几秒钟,但搜索类应用往往要连续调用模型多次——改写检索词、重排结果、抽取事实、归纳来源、生成答案——每一步的延迟都会叠加到最终响应时间里。

Mercury 系列走的是另一条路。它采用扩散式大语言模型,不是从左侧开始把句子逐个定稿,而是先生成一个粗糙的整体回答,再通过若干轮处理并行修正多个 token。这套思路借鉴了图像生成领域的扩散模型——从噪声开始逐步细化成图,只不过被搬到了文本生成上。

Inception 的创始团队来自斯坦福大学、加州大学洛杉矶分校和康奈尔大学,是首个扩散语言模型的提出者。据该公司介绍,Mercury 2.5 是迄今训练规模最大的扩散语言模型,智能水平相比 Mercury 2 提升 40%。作为对比,Mercury 2 在英伟达 Blackwell 图形处理器上的输出速度为每秒 1009 个 token,上下文长度 12.8 万 token;Mercury 2.5 把速度提升到 1107、上下文扩大到 26 万,输入价格还从每百万 0.25 美元降到了 0.20 美元。

四款模型横向对比:速度与价格怎么排

把 Mercury 2.5 放进同期同定位的模型里比较,差异会更直观。

Inception 官方标称每秒 1107 个 token。第三方平台 OpenRouter 对该接口的遥测数据显示,P50 实际输出速度为每秒 440 个 token,延迟 1.17 秒,仍然是四者中最快。

谷歌 Gemini 3.5 Flash-Lite 在 Artificial Analysis 的测试中跑出每秒 382 个 token,价格为每百万输入 0.30 美元、输出 2.50 美元——速度不慢,但输出价格是 Mercury 2.5 的约 3.3 倍。

OpenAI 的 GPT-5.6 Luna 在 Artificial Analysis 记录到的最高速度为每秒 129 个 token,价格每百万输入 0.20 美元、输出 1.20 美元,拥有这组里最大的上下文窗口。

Anthropic 的 Claude Haiku 4.5 在非推理模式下测得约每秒 82 个 token,价格每百万输入 1.00 美元、输出 5.00 美元,是四款里最慢也最贵的一个——按输出计算,每百万要花掉约 6.7 个 Mercury 2.5 的价钱。

需要说明的是,Inception 把 Mercury 2.5 的质量对标的是”成本优化级前沿模型”,也就是 GPT-5.6 Luna(低档位)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5 这一层,而不是各家旗舰。换句话说,它主打的是速度与价格的组合,而非绝对能力上限。

真实业务里能省下多少时间

速度最终要落到场景上。语音智能体公司 OpenCall 在其生产负载上,模型响应的中位数延迟降到约 170 毫秒;该公司反馈,切换到 Mercury 后 P99 响应时间从数分钟降到 1 秒,P50 从 0.4 秒降到 0.2 秒以下。

编码 AI 公司 Augment Code 把”上下文压缩”这一环节迁移到 Mercury——这一步负责把冗长的工作历史缩短。结果是处理时间从约 150 秒降到 27 秒,延迟降低 82%,成本下降 90%,质量保持不变。工具搜索摘要的返回时间也控制在了 1 秒以内。

功能层面,Mercury 2.5 支持可调推理强度、并行工具调用以及严格符合给定结构的 JSON 输出,接口与 OpenAI 兼容,可作为既有智能体代码的直接替换。发布同时,Inception 还预告了 Mercury Voice 与 Mercury Router:前者首 token 延迟低于 170 毫秒,面向语音智能体;后者用扩散模型理解输入提示,再把请求路由到质量、速度、成本组合最优的模型上。

该怎么选

如果业务对延迟敏感——语音智能体、搜索管线、编码子智能体——Mercury 2.5 是更合适的选择,速度加上兼容的接口、并行工具调用和结构化输出,几乎可以无缝接入现有代码。

如果是通用廉价对话和批量推理,且需要很长的上下文,GPT-5.6 Luna 依然更稳妥:当输出的是给人读的内容时,上下文窗口和生态成熟度比每秒 token 数更重要。

如果技术栈本来就深度绑定谷歌,Gemini 3.5 Flash-Lite 接入 Vertex AI 很方便,速度也确实快,代价是输出不便宜。如果看重指令遵循的准确度而非吞吐,Claude Haiku 4.5 仍然有它的位置,只是要接受更高的价格和更慢的速度。

最后提醒一点:Mercury 2.5 发布时的八折优惠(每百万输入 0.04 美元、输出 0.15 美元)已于 2026 年 9 月 8 日 07 时(协调世界时)结束,做预算时应按原价计算。模型目前通过 Inception 接口、Baseten 和 OpenRouter 提供服务,OpenRouter 上的模型标识为 inception/mercury-2.5,企业客户可申请专属容量与私有化部署;官方暂未提供可下载的模型权重。