
OpenAI 宣布将实时语音模型 GPT-Live-1 引入 API,开发者可以据此构建支持实时语音交互的应用与业务流程。这是 ChatGPT 语音模式背后的原生全双工架构,首次向外部开发者开放。
不再”你说完我再说”
传统语音智能体本质上是一条串联流水线:先把用户说的话转成文字,交给大语言模型推理,再把回复文字转回语音。每一段衔接都会累积延迟,也让对话显得机械。
GPT-Live-1 把语音理解与语音输出整合进同一个模型,砍掉了中间多次转换。它支持全双工对话,能够在输出语音的同时继续聆听,并处理对话中的打断、停顿和背景噪声。
更进一步的是”分工”机制。语音层负责维持对话节奏,当请求需要更强的推理或更长的处理时间时,模型可以把任务委派给后端文本模型——可以是 GPT-6 Astra,也可以是更小的 Luna 或其他厂商的模型。等待推理结果的这段时间里,语音层会用应答、填充停顿的方式把对话撑住,等后端返回再自然地把答案织回对话中,而不是让用户对着空气干等。
技术上,这条委派链路通过事件驱动接口实现:语音会话生成 delegation_id,把上下文送往后端系统,结果通过 session.commentary.append 事件回流。开发者依然能看到模型听到和说出的内容,也能控制它何时接话。
评测数据与真实案例
OpenAI 公布的数据显示,GPT-Live-1 在 Full Duplex Bench 测试中的得分为 80.1%,比 GPT-Realtime-2.1 的 45.4% 高出约 30 个百分点;轮次切换延迟从 1.4 秒降至 0.8 秒;工具调用准确率从 60% 提升到 87%。搭配 GPT-6 Astra 中等推理强度时,该模型在 Tau3 端到端语音智能体任务测试中排名第一。
不过在更贴近真实业务的银行客服基准中,GPT-Live-1 的任务通过率为 32%,此前版本为 12.4%——进步明显,但仍有超过三分之二的任务未能通过,说明从跑分到可靠落地之间还有距离。
早期客户的数据更能说明问题。语言学习平台 Speak 接入后,学习者在思考停顿期间的误打断次数,相比此前基于轮次的系统减少近 80%。医疗科技公司 EliseAI 联合创始人兼首席技术官 Tony Stoyanov 表示,团队改用该模型后代码量减少 80%,删除约 2.3 万行代码。Yelp 已在 Yelp Host 和 Hatch 两项服务中使用 GPT-Live-1,该公司首席技术官 Alex Levy 称,由 AI 成功处理的来电数量有所增加,来电者的表达也更完整自然。
价格与可选声音
定价方面,GPT-Live-1 前端语音层为每分钟 0.05 美元,按每小时计算约 3 美元(按近期汇率约合 20.2 元人民币)。后端模型与智能体工具的费用另行计算——也就是说,智能体越频繁地调用推理模型,账单增长越快。开发者的取舍空间在于:像预约排期这类简单任务可以交给更便宜的小模型,把贵的前端推理留给真正需要的环节。
OpenAI 同时扩充了实时语音选项,新增 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta、Cinder 共 12 种声音,覆盖不同口音、方言和语言,并计划在未来数月持续增加语音与语言支持。
功能层面,该模型原生支持语音识别转写与回复文本输出,具备字母数字理解、关键词偏置和轮次检测能力。开发者可通过系统提示词调整语气、语速与对话风格,也可以自行配置后端模型、工具和智能体框架。它既能与 Codex 等工具连接,也可通过 OpenAI Presence 构建能查询企业系统、执行获批操作并在必要时转接人工的语音工作流。
在落地场景上,餐厅预订、客户服务等电话场景被官方列为典型用例。对于正在做呼叫中心、语音客服或语音助手的团队,这套 API 值得先拿真实业务流量试一遍,再决定是否全量替换原有方案。







