ChatGPT 语音模式能调用 GPT-6 Astra 了

OpenAI 语音产品负责人 Atty Eleti 于 9 月 10 日宣布,ChatGPT 语音模式(ChatGPT Voice)迎来一次模型层面的升级:用户可以自由选择所需的模型以及推理深度,Pro 套餐更可直接调用 GPT-5.6 Sol 或 GPT-6 Astra。

语音不再只是”快”,而是可以”深”

按照介绍,在需要执行网络搜索或复杂推理时,语音模式将会自动调用用户所指定的模型。OpenAI 同时说明,每当语音模式将问题转交给底层文本模型处理时,都被视为发给该模型的一条消息。

这实际上改变了语音交互的分工方式。此前 ChatGPT 的语音体验由 GPT-Live 系列模型承担,该系列于 7 月 8 日推出,围绕对话的低延迟需求设计——GPT-Live-1 的即时档位在后台使用 GPT-5.5 Instant,中高档位使用 GPT-5.5 Thinking。虽然 OpenAI 在发布时曾表示语音可以调用前沿模型处理更难的问题,但当时开放给用户的控制项只有三档语音专属智能等级。

9 月 9 日的这次更新,把”Instant / Medium / High”三档独立语音智能等级正式停用,替换为与文字对话一致的模型选择和推理强度选择。结果是分工更清晰:GPT-Live 继续负责快速、可随时打断的口语交流,而 GPT-5.6 Sol 或 GPT-6 Astra 则接管需要额外推理或搜索的请求。用户无须在开口前判断”这个问题该不该放到语音里问”。

GPT-6 Astra:从文本框走向语音入口

GPT-6 Astra 于 9 月 3 日发布,比进入语音模式早了六天。该模型最初面向有限的机构开放,OpenAI 计划分阶段覆盖 ChatGPT Plus、Pro、Business、Enterprise,以及 API、微软 Azure 和亚马逊 Bedrock。

从定位看,Astra 面向更长链条的多步骤工作,覆盖浏览、软件工程、计算机操作和各类专业任务。这些能力改变了一次语音会话能承载的内容范围:用户可以从一个普通的口语提问开始,让 ChatGPT 搜索最新信息,再推进到更复杂的分析,全程不必离开语音界面,也不必在文字会话里把需求重述一遍。

需要提醒的是,Astra 已触及 OpenAI 设定的关键网络安全能力阈值,因此被附加了更严格的监控。当监测系统检测到可能属于未授权的行为时,相关保障措施可以暂停或停止工作。OpenAI 也承认,这些检查可能会中断合法任务,包括防御性安全工作。

额度规则简化,但不再有”降级续命”

伴随模型更新,OpenAI 同步调整了 GPT-Live 的每日使用限额规则,按滚动 24 小时计费:

  • Go:提供最长 3 小时的 GPT-Live-1 mini 使用时长,不再提供 GPT-Live-1 的访问权限。
  • Plus:提供最长 3 小时的 GPT-Live-1 使用时长(此前为 1 小时)。
  • Pro(100 美元/月):提供最长 15 小时的 GPT-Live-1 使用时长(此前为 12 小时)。
  • Pro(200 美元/月):无限制使用 GPT-Live-1。

相比此前,Plus 和 Pro(100 美元档)的额度都有明显提升。但有一处收紧值得注意:Plus 与 Pro 用户在用尽语音额度后,将不再降级切换至 GPT-Live mini,ChatGPT 改为在达到限额时提醒用户。这简化了模型阵容,也移除了过去在额度耗尽后仍能维持对话的低能力档位。

还有哪些能力没跟上

底层语音体验仍由 GPT-Live-1 或 GPT-Live-1 mini 提供,具体取决于订阅方案。GPT-Live 支持边听边说、联网搜索、记忆、文本与图像输入,以及可视化结果卡片。

不过它目前还不支持视频、屏幕共享、连接应用或插件——这些移动端的视觉能力仍通过 OpenAI 较早的 Advanced Voice 向符合条件的订阅者提供。对期待”语音 + 画面”完整体验的用户来说,这个缺口暂时还没有补上。