模型没变分数翻三倍:OpenAI 揪出两个 API 设置

同一个模型,同一套题目,成绩却相差三倍——问题不在模型,而在跑分时用的那套外围代码。

2026 年 7 月 29 日,OpenAI 发布了一篇技术博客,标题直白得像是自嘲:《开启两个设置,ARC-AGI-3 上的分数翻了三倍》。文章披露,旗下模型 GPT‑5.6 Sol 在这项公开基准测试上的糟糕表现,很大程度上并非模型能力不足,而是评测框架的两个默认设定把它的”记忆”清空了。

反常的低分

ARC-AGI-3 是一项衡量 AI 智能体学习与推理能力的基准测试。它的特别之处在于不告诉模型规则:智能体被丢进一个陌生的二维益智游戏里,只能靠自己观察、试错、总结,逐步推断玩法。目前有 25 个演示游戏公开在 arcprize.org/tasks 上,任何人都可以自己上手试。

在这项测试中,GPT‑5.6 Sol 只拿到 7.8% 的分数,上一代 GPT‑5.5 更是几乎玩不动,仅得 0.4%。

这个成绩让 OpenAI 团队感到困惑,因为同一个模型在别处的表现完全不是这个水平:它证明过数学界悬置多年的开放问题「循环双覆盖猜想」,通关过《宝可梦:火红》(使用纯视觉框架),在 Codex 的计算机操作能力加持下打通过《杀戮尖塔》,还完成了《Baba Is You》的前期关卡。研究者 Ethan Mollick 还展示过它在 Codex 中通关《杀戮尖塔 2》的每日随机挑战——这款游戏发布时间晚于模型的知识截止日期。

那么二维益智游戏究竟难在哪里?

两个设定,把模型变成了失忆症患者

深入排查后,OpenAI 找到了两处关键问题,都出在评测框架而非模型本身。

第一,每执行一步动作,模型的私有推理内容会被全部丢弃。 这意味着每走一步,GPT‑5.6 Sol 都要从零开始重新理解这个游戏。它能看到自己过去下过哪些指令、附带的简短备注,却看不到当初促成那些指令的计划、推断和思路。

第二,框架采用了滚动截断的方式管理上下文。 当对话内容超过 175,000 字符时,最早的消息会被直接删除。于是模型不但记不住自己想过什么,连做过什么也在逐渐遗忘。

两者叠加,一个本该在游戏中不断积累经验的智能体,被迫每回合都当一次新手。

换成生产环境的配置

OpenAI 的模型在训练时就带有私有推理消息机制:先在内部思考,再输出回复或工具调用,这些思考内容会作为对话历史保留下来;对话过长时则做摘要压缩后继续。ChatGPT 和 Codex 采用的正是这套逻辑。

为了对齐真实部署环境,团队用 Responses API 重新实现了 ARC-AGI-3 的运行框架。对 GPT‑5.6 而言,只要传入上一次响应的 ID,推理内容就会在工具调用和多轮对话之间自动保留。

改动后出现两个明显变化:模型在每步动作前的思考时间反而缩短了,因为不必再从头解读游戏;同时它在长时间交互中学得更快,能持续使用连贯的策略。

第二项改动是用上下文压缩(compaction)替换滚动截断。压缩不是删除最早的内容,而是把它总结保留下来。这样模型在长局游戏中能守住此前积累的认知,分数更高,输出的 token 反而更少。

最终数字

在官方框架下,GPT‑5.6 Sol 在 ARC-AGI-3 公共任务集上得分 13.3%;开启保留推理与上下文压缩后,得分升至 38.3%,约为原先的三倍,输出 token 减少约 6 倍。

评分采用的指标是 RHAE(相对人类操作效率),衡量模型表现与人类基准的比值。根据官方游戏日志估算,人类测试者的平均分约为 48%。测试中模型并不知道自己会被如何打分,也无法在过程中看到分数,每次动作只能得到当前画面的文本表示和所处关卡。

在其中一款游戏的排行榜上,此前没有任何前沿模型能通过第一关;换用 OpenAI 的运行框架后,GPT‑5.6 Sol 六关全部通关。

给开发者的三条建议

OpenAI 在结论中提醒:评测很少能孤立地衡量模型本身,它同时也在衡量一整套不那么显眼的选择——API 设置、运行框架设计和提示词写法。文章还提到,这并不是该团队第一次先被公开榜单上的低分吓一跳,随后发现评测方使用的通用框架把推理消息丢掉了。

对希望榨出模型最大性能的 API 开发者,OpenAI 给出的建议是照搬自家产品的配置:使用 Responses API 而不是旧版 Chat Completions API;开启保留推理;使用上下文压缩。对比不同模型时,也应优先参考采用上述设置的评测结果,因为那更接近 ChatGPT 和 Codex 中的真实使用状态。

需要说明的是,OpenAI 的这套框架是针对自家模型特性做的优化,而 ARC 团队坚持使用通用框架,本意正是让不同厂商的模型在同一条件下比较、并让模型短板更容易暴露。两种立场各有道理,但这场排查至少说明了一件事:看到一个跑分数字时,先问一句”是谁跑的、用什么跑的”,往往比数字本身更有信息量。

来源:OpenAI 官方博客《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》,2026 年 7 月 29 日