GPT-6.1 Sol发布:性能追近Astra,价格仅1/5

OpenAI 在 2026 开发者活动日发布了全新的 GPT-6.1 Sol 模型。官方称,该模型在性能接近旗舰版 GPT-6 Astra 的同时,费用仅为后者的五分之一,是”目前同等性能下性价比最高的模型”。

定位:把旗舰性能打到中端价格

GPT-6 Astra 是 OpenAI 于 2026 年 9 月推出的旗舰级大语言模型,官方将其定位为”迄今最智能、最对齐(最符合人类意图)”的模型,重点面向长程多步骤任务与专业工作流。GPT-6.1 Sol 则在此基础上做了成本取舍:在标准输入与输出 token 价格上,仅为 Astra 的五分之一,但面向智能体编程、电脑操作和专业工作流等任务时,性能仍可接近旗舰水平。

四种处理模式与定价

GPT-6.1 Sol 提供四类处理模式,开发者可按延迟与成本需求灵活选择:Standard(标准)为正常速度,面向日常开发与一般应用;Batch(批量)采用异步批量处理,速度较慢,适合离线数据处理等非实时大批量任务;Flex(弹性)根据负载动态调整,适合需要平衡成本与速度的场景;Fast(快速)则优先处理、延迟最低,面向实时对话等敏感场景。

在短上下文(输入 token 不超过 27.2 万)下,Standard 模式的输入价格为每百万 token 2 美元、输出 10 美元;Batch 与 Flex 模式输入均为 1 美元、输出 5 美元;Fast 模式输入 4 美元、输出 20 美元。长上下文(输入超过 27.2 万 token)下,Standard 输入升至 4 美元、输出 15 美元,Fast 模式输入 8 美元、输出 30 美元。

官方表示,GPT-6.1 Sol 每百万 token 的缓存写入费用为 0.1 美元(按当前汇率约合 0.67 元人民币),相比上一代 GPT-6 Sol 定价降低 50%。

基准表现:接近旗舰,成本大幅下探

在软件工程基准 DeepSWE v1.1 上,较高推理强度下 GPT-6.1 Sol 的表现与 GPT-6 Astra 相当;在较低推理强度与成本条件下,其得分比 GPT-6 Sol 高出 6.4 个百分点。面向专业文档与复杂任务(GDP.pdf),它以不到 Opus 5.5 一半的任务成本取得了更好的结果。

在自动化工作流基准 AutomationBench(中等推理强度)上,GPT-6.1 Sol 得分比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一。电脑操作基准 OSWorld 2.0(离线、最大推理强度)中,其得分比 GPT-6 Sol 高 7 个百分点,成本不足后者一半;与 Astra 相比仅低 2.1 个百分点,但单任务成本约为 Astra 的七分之一。科学终端任务 Terminal-Bench Science 0.1(最大推理强度)中,其得分是 GPT-6 Sol 的两倍以上,单任务平均成本 5.47 美元,显著低于 Opus 5.5 的 23.21 美元和 Astra 的 23.80 美元。

可靠性与对齐改进

除能力外,GPT-6.1 Sol 在可靠性上也有提升。低推理强度下,事实错误比例从 GPT-6 Sol 的 11.4% 降至 7.7%,下降约 32%;在所有推理设置下,其错误率与 Astra 的差距控制在 1.9% 以内。官方称该模型更能遵循用户意图与安全约束,在困难评测中更少忽略失效的搜索工具、更能遵守明确限制,并减少未经授权的操作;安全测试中未观察到试图绕过自动化安全审查器的行为。

自 9 月 29 日起,GPT-6.1 Sol 向 ChatGPT Work 与 Codex 的 Plus、Pro、Business、Enterprise、Edu 用户开放;开发者可通过 API 以 gpt-6.1-sol 名称调用。