OpenAI 发布 GPT-6 Sol/Luna:API 价格减半,编程更省

美国当地时间 9 月 22 日(北京时间 9 月 23 日),OpenAI 发布 GPT-6 系列的两款新成员——GPT-6 Sol 与 GPT-6 Luna。两款模型沿用旗舰 GPT-6 Astra 的训练方法,把 Astra 在专业工作、事实性、编程、计算机操作与对齐方面的部分能力,带到更快、更经济的模型上。OpenAI 同时强调,Astra 依然是其整体上最优秀的模型,追求极致效果仍应选择 Astra。

价格:API 定价相比 GPT-5.6 促销价降 50%

价格是这次发布最直接的信号。GPT-6 Sol 每百万 token 输入 2 美元、输出 10 美元;GPT-6 Luna 每百万 token 输入 0.10 美元、输出 0.50 美元,两者均较 GPT-5.6 对应版本的促销价下降 50%。OpenAI 把降价归因于缓存与推理效率的提升:读取已缓存的输入 token 折扣最高可达 90%,开发者还能设置缓存断点,并在调整推理强度或开关工具时不丢失已缓存的上下文。

定位:Sol 面向复杂任务,Luna 主打高频重复

产品线分工比较清晰。GPT-6 Sol 面向编程、工作流自动化及其他复杂专业任务;GPT-6 Luna 则适合文档摘要、信息提取等任务量大、重复性高且目标明确的工作。两者都在专业工作、编程和计算机操作等任务上较上一代 GPT-5.6 有明显进步。

编程与智能体:以更低成本逼近竞品

OpenAI 公布的多数对比采用“单任务成本”口径。在覆盖 47 种工具的业务流程测试 AutomationBench 中,Sol 在 xhigh 强度下得分 33.2%,单任务成本约 0.27 美元,表现超过 Claude Opus 5,而成本仅为后者的 9%;Luna 在 high 强度下比前代提升 5.4%,每任务成本降低 58%。在智能体评测 Last Exam 中,Sol 在 max effort 下得分 56.4%,高于 Claude Opus 5 在该评测中的最高分,每任务成本低约 60%。

编程方面,在软件工程测试 DeepSWE v1.1 中,Sol 于 max effort 下取得 68.8%,距离 Claude Fable 5 的 69.9% 仅差 1.1 个百分点,而单任务成本低约 80%;Luna 取得 66.6%,接近 Opus 5 与 Fable 5 的 medium 水平,单任务成本分别低约 93% 和 96%。计算机操作测试 OSWorld 2.0 offline 中,Sol 在 xhigh effort 下得分 60.5%,与 Claude Opus 5 medium 的 60.3% 接近,单任务成本低约 80%。

可靠性与对齐

事实可靠性上,OpenAI 基于去标识化真实对话的测试显示,Sol 的错误率约为 GPT-5.6 Sol 的一半,接近 Astra 级可靠性;Luna 在高 effort 下可匹配 GPT-5.6 Sol,而成本约为其百分之一。OpenAI 也提示,这些对话样本本身偏“易出错”,并不代表日常使用的平均水平。对齐方面,两款模型在内部评测中均优于各自的 GPT-5.6 版本,包括关于自身编码工作的误导性声明发生率下降。

怎么用

自 9 月 23 日起,GPT-6 Sol 与 GPT-6 Luna 已在 ChatGPT Work 和 Codex 中向所有 Plus、Pro、Business、Enterprise 与 Edu 用户开放;免费用户与 Go 用户可在桌面应用中使用 Luna;两款模型暂未在 Chat 中提供;在 API 中的名称分别为 gpt-6-sol 与 gpt-6-luna。值得一提的是,同一天 Anthropic 也发布了 Claude Opus 5.5(每百万 token 输入 4 美元、输出 20 美元,较 Opus 5 降低 20%)。大模型竞争正在从“谁的模型更强”,越来越多地转向“完成同样的工作要花多少钱”。