2026 年 9 月 7 日,独立评测机构 Artificial Analysis 把智能指数升级到 v4.3,并用 Terminal-Bench 4.0 替换了此前的 2.1 版本。这一次例行换版,把几家大厂刚刚公布的漂亮数字打回了原形。

榜单上的集体跳水
换用更难的题目后,多个前沿模型的成绩出现断崖式下滑:
- Gemini 3.8 Flash:从 87.6% 跌至 19.7%,下滑 67.9 分
- Muse Spark 1.3:从 84.3% 跌至 33.3%,下滑 51.0 分
- Claude Fable 5.1:从 91.4% 跌至 55.1%,下滑 36.3 分
- GPT-6 Astra:在 4.0 版本上以 59.6% 位居第一
需要说明的是,这四款模型几乎在同一时间发布:Claude Fable 5.1 在 9 月 1 日,Gemini 3.8 Flash 与 Muse Spark 1.3 在 9 月 2 日,GPT-6 Astra 在 9 月 3 日。四家发布时列出的成绩,都建立在即将被淘汰的旧版测试之上。
官方 Terminal-Bench 榜单用另一套运行环境得出了相似结论:GPT-6 Astra 在 Codex 智能体中完成 58.18% 的任务,Claude Fable 5 在 Claude Code 中为 44.55%(整轮算力成本约 7300 美元),Gemini 3.8 Flash 只有 19.09%。
4.0 版本到底改了什么
Terminal-Bench 衡量的是智能体在命令行环境中完成长周期真实任务的能力,包括调试软件、运行数据管道、配置系统和通过自动化验证。
4.0 版本由 Harbor 框架团队在 2026 年 8 月 29 日发布,是一次刻意的难度加固。它包含 66 个任务,覆盖软件、机器学习、科学、运维、安全、硬件和媒体七大类。团队移除了 8 个任务:其中 2 个是因为所有最新模型都能 5 次全对、已经饱和,2 个涉及拒答问题,2 个答案在网上公开可见,2 个存在质量问题。同时修复了 19 个任务定义,并按 Anthropic 关于基础设施噪声的研究方法重新校准了处理器、内存和时间配额,还统一设置了 8 小时的智能体超时上限。
刷分还是题变难了
研究机构 SemiAnalysis 把这种现象称为「刷榜优化」:模型在某个特定基准上拿到惊人分数,实际通用能力却远不如此。这个词如今已成为评测圈的常用说法。
Meta 首席人工智能官 Alexandr Wang 公开反驳了这一框架,理由是分数大幅下滑也可能只说明新测试更难。这个说法有其道理——换版之后所有模型都在跌,包括表现诚实的那几款。
但排名的重排泄露了更多信息。在 2.1 版本上,Gemini 3.8 Flash 距离最好的模型只有 3.8 分,足以被包装成「接近前沿水平」;到了 4.0,它落后领跑者 39.9 分。更难的测试会压缩诚实模型的差距,同时暴露那些只擅长特定题型的模型。
各家公布的 DeepSWE 成绩也能说明问题:Claude Fable 5.1 为 67.4%,Gemini 3.8 Flash 为 73.7%,Muse Spark 1.3 为 75.4%,GPT-6 Astra 为 74.1%。但据 The Kaitchup 核查,这些表格里有不少竞品数值是直接引用其他厂商的公告或榜单,并非在相同条件下重跑。该机构的 Benjamin Marie 表示,智能体基准分数是整个评测系统的属性,而不是模型单独的属性。
在统一运行环境的 DataCurve DeepSWE 榜单上,Astra、Gemini 3.8 Flash、Opus 5 和 GPT-5.6 Sol 的成绩都集中在 73% 到 74% 区间,置信区间相互重叠。
运行环境能左右多少分数
比很多人以为的要多。已发表的研究显示,在智能体基准上,运行环境带来的差异在 6 到 24 分之间,这个幅度超过了多数前沿模型之间的差距。
SWE-agent 的研究者仅通过改变智能体与计算机的交互界面,就让同一个 GPT-4 Turbo 模型在 SWE-bench Lite 上提升了 10.7 个百分点。2026 年的系统性研究 Harness-Bench 发现,在相同的模型和任务池上,不同运行环境之间存在 23.8 分的总差距。Anthropic 自己的工程团队也记录到,仅基础设施和资源执行差异就能造成约 6 分的 Terminal-Bench 波动。
在这种背景下,把自家精心调优的跑分与从旧榜单上摘来的对手数字拼在一起,与其说是评测,不如说是营销。
该怎么选模型
这次风波给出的教训很直接:不要把采购决策压在单一测试的单一数字上。
可行的做法包括:在至少两个独立榜单上用同一版本基准交叉验证;忽略竞品数字来自其他厂商公告的对比表格;优先采用带私有任务集和版本化运行环境的测试;签订合约前先做小规模试点。
成本同样是硬指标。在官方榜单上,Astra 的一轮运行算力成本约 3300 美元,Claude Fable 5 约 7300 美元,而 Gemini 3.8 Flash 消耗了 172 亿个 token 却几乎垫底。在自己真实业务条件下计算「每完成一项任务花多少钱」,才是唯一能兑现的排行榜。







