OpenAI 近日开始预览一种名为「Ultrafast(超快)」的全新服务层级。在该模式下运行最强模型 GPT-5.6 Sol,速度最高可比标准处理模式快十四倍,每秒最多可生成七百五十个输出词元。这意味着前沿大模型的智能水平,第一次能够稳定地进入对延迟极其敏感的产品与工作流。

## 由Cerebras 提供算力,主打极低延迟
「超快」模式由芯片公司 Cerebras 提供底层算力支持,是 OpenAI 与 Cerebras 合作把超低延迟推理带上平台的最新一步。此前,人工智能开发者常常不得不在「速度」与「智能」之间做取舍:模型越大越聪明,计算和数据的搬运成本也越高,响应自然越慢。用户要么等待高质量的结果,要么在更短时间内接受更差的输出。
「超快」模式试图打破这一两难。OpenAI 表示,在保持与标准版完全相同智能水平的同时,运行速度最高提升十四倍。凭借晶圆级引擎技术绕开推理过程中的内存带宽瓶颈,Cerebras 让 GPT-5.6 Sol 这样的高智能模型,也能以每秒七百五十个输出词元的速度稳定吐字。
## 从一夜到一天:研发周期被压缩
在实际应用中,OpenAI 的开发团队已经用「超快」模式在系统事件期间分析日志与追踪信息,把过去需要彻夜运行的research周期,压缩到在一个工作日内进行多次迭代。
对外,这一模式面向语音、客户支持、商务交易、开发者代理、金融研究和安全响应等实时或接近生产环境的任务。OpenAI 表示,它让企业能够构建响应更快的产品、做出更快的决策,并把强大的大模型直接带进最关键的工作流。目前该服务仅向部分精选客户开放限量预览,后续将随容量增长逐步扩大;有需求的企业可通过提交自身工作负载、延迟要求和预期用量加入等待名单。
## 横向对比:比同类模型快数倍
在标准模式下,GPT-5.6 Sol 已是 OpenAI 当前最聪明的模型。根据第三方机构 Artificial Analysis 的对比数据,开启「超快」模式后,它的输出速度比 Fable 5 快约十一倍,比 Opus 4.8 的快模式快约五倍。
在更具挑战性的 HLE(人类终极考试)基准上,「超快」模式也展现出明显优势。HLE 包含两千五百道通常只有化学、经济、文学等领域博士才能作答的难题。由 Cerebras 执行的实测显示,GPT-5.6 Sol「超快」模式配合 Codex、采用最高推理级别,仅用十一小时十一分钟便答完全部题目;而 Claude Fable 5 配合 Claude Code、同样采用最高推理级别,耗时七十八小时二十七分钟,相当于超过三天的持续计算。换言之,「超快」模式在一个工作日内就攻克了人类知识的前沿难题,并且以接近七倍的速度达到了相近的准确率。
## 大模型加速成为新战场
GPT-5.6 Sol 于 2026 年 6 月发布,同期推出的还有主打平衡的 Terra 与侧重速度的 Luna,整个模型家族在 7 月已通过 ChatGPT、Codex 与 API 向公众开放。「超快」模式的加入,补上了「极致低延迟」这一档,让开发者可以在同一个模型家族里,按场景自由取舍智能、速度与成本。
随着大模型能力持续进步,推理速度正成为越来越关键的竞争维度。谁能把前沿智能塞进更短的时间窗口,谁就能把人工智能真正嵌入语音助手、实时客服和自动化代理这些「每一秒都重要」的场景。OpenAI 与 Cerebras 联手推出的「超快」模式,预示着大模型竞赛正从「谁更聪明」悄悄转向「谁更快把聪明用出来」。
来源:OpenAI(Ultrafast 官方预览文档,https://openai.com/index/previewing-ultrafast/)







