一道题四分钱,DeepSeek 拿下最难推理榜 61.4%

抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布了对 DeepSeek V4 Flash 0731 的验证结果。在最高推理档位下,这款模型在 ARC-AGI-1 半私有测试集上取得 89.0% 的成绩,单题成本约 0.02 美元;在难度更高的 ARC-AGI-2 半私有测试集上取得 61.4%,单题成本约 0.04 美元。

真正引发开发者讨论的不是分数本身,而是分数与成本的组合。

三档推理,三种性价比

DeepSeek 向 ARC Prize 提交了三个推理强度变体,分别是 Max(最高)、High(较高)和 Low(较低)。用户可以自行决定单次回答投入多少算力,这一选择会直接反映在每道题的花费上。三档的验证成绩如下:

  • 最高档 Max:ARC-AGI-1 得分 89.0%,ARC-AGI-2 得分 61.4%
  • 较高档 High:ARC-AGI-1 得分 87.0%,ARC-AGI-2 得分 56.0%
  • 较低档 Low:ARC-AGI-1 得分 84.0%,ARC-AGI-2 得分 46.0%

在 ARC-AGI-1 上,最高档与最低档之间只差 5 个百分点;但到了 ARC-AGI-2,两档差距拉开到 15.4 个百分点。这说明第二代基准对模型“想多久”这件事远比第一代敏感——同一个模型少思考一会儿,成绩就会明显滑落。

ARC Prize 尚未公布该模型在 ARC-AGI-3 上的成绩。

ARC-AGI 到底在考什么

ARC-AGI(抽象与推理语料库)由研究者弗朗索瓦·肖莱(François Chollet)设计,考察方向与常见的知识问答、代码生成类基准完全不同。每道题给出几组彩色网格的“输入—输出”示例,模型需要自行推断出其中的变换规则,再把规则套用到一个全新的输入上。

这类题目无法靠背诵互联网语料蒙混过关,考的是面对陌生问题时的泛化能力。ARC-AGI-2 在第一代基础上刻意提高了门槛:加入需要多条规则叠加才能解出的任务,同时剔除了大模型已经学会套路化应对的题型。因此 61.4% 这个数字的含金量,明显高于同一模型在第一代上的 89.0%。

评测采用半私有测试集,题目不对外公开,以避免答案被写进训练数据。本次公布的逐题明细覆盖 ARC-AGI-1 公开集的 400 道题与 ARC-AGI-2 公开集的 120 道题,逐条标注了三个档位各自的通过与失败情况。

成本这一栏,为什么比分数更受关注

ARC Prize 的验证流程把资源消耗视为衡量指标的一部分,所以结果页会把每题成本与得分并列展示。放在整个榜单的成本—分数坐标里,V4 Flash 的位置相当靠左上:分数进入第一梯队,横轴上的花费却低了一到两个数量级。

有开发者在技术社区讨论中指出,V4 Flash 最高档在这张图上的位置已经压过同为开放权重路线的 Kimi K3,与部分闭源前沿模型的得分区间接近,成本却只是后者的零头。需要说明的是,这类对比来自社区解读,并非 ARC Prize 的官方结论。

同样需要提醒的是,0.02 美元和 0.04 美元只对应本次评测中的单道基准题目,不能直接换算成实际业务开销。真实应用里的智能体往往要反复调用工具、维持超长上下文、产出大段文本,累计花费会远高于一道基准题。

开放权重阵营的位置在变化

过去两年,抽象推理长期被视为闭源前沿模型的专属优势区。测试时计算(让模型在回答前多想一会儿)的思路虽然把成绩推了上去,但高档位的单题成本一度停留在数美元量级,规模化使用并不现实。

DeepSeek 由梁文锋创办,总部位于杭州。此次 V4 Flash 0731 以开放权重形态拿到经第三方验证的成绩,意味着开发者既可以调用其接口,也可以自行部署后按需调节推理强度,在延迟、预算和准确率之间做取舍——这种灵活度,正是把推理能力塞进智能体流水线时最实际的考量。

来源:ARC Prize 基金会 ARC-AGI 验证结果页