Grok 4.6 基准跑分 61,xAI 重回第一梯队

智力指数 61:与 GPT-5.6 持平

评测机构 Artificial Analysis 于 2026 年 8 月 12 日发布数据:xAI 的新模型 Grok 4.6 在「人工智能智力指数」(Artificial Analysis Intelligence Index)中取得 61 分。这一分数较上一代 Grok 4.5 提升 5 分,相比更早的 Grok 4.3 则高出 23 分,让 xAI 时隔一个多月重回智力前沿,与 OpenAI 并列,整体仅次于 Anthropic。

从具体排位看,Grok 4.6 与 OpenAI 的 GPT-5.6 Sol(最高档)处于同一水平,落后 Anthropic 的 Claude Opus 5(最高档 63 分)和 Claude Fable 5(62 分),略高于中国的 Kimi K3。

智能体任务表现突出

Grok 4.6 的强项集中在智能体任务,而非静态推理。在衡量真实世界知识工作的 GDPval-AA v2 基准中,它的 Elo 评分达到 1753,仅次于 Claude Opus 5,且在与 Claude Fable 5、Qwen3.8 Max 的置信区间上重叠,难分伯仲。

在分类型任务上,τ³-Banking 客服测试取得 50.7%,与 Qwen3.8 Max 的 51.3% 并列前二;Terminal-Bench v2.1 终端软件任务取得 88.4%,与领先模型持平。能在知识工作、客服与终端操作三类任务上同时具备竞争力,再加上定价优势,使 Grok 4.6 在智力指数各项智能体评测的「性能对成本」帕累托前沿上占据一席。

价格不变,性价比登顶

在推理密集型负载中,输出令牌价格往往主导总成本。Grok 4.6 维持了与 Grok 4.5 相同的定价:每百万输入、输出令牌分别为 2 美元与 6 美元。这一价格比 Claude Opus 5(5 美元 / 25 美元)和 GPT-5.6 Sol(5 美元 / 30 美元)低六成以上。

实测中,Grok 4.6 处理单个任务的成本为 0.84 美元,与 Kimi K3 处于同一价位,但智力水平更高。评测方由此将其列入「智力对单任务成本」的帕累托前沿。在智力指数相差两分以内的可比模型中,Grok 4.6 以远低于对手的输出价格,提供了几乎相同的智力分数。

长程任务更省令牌

Grok 4.6 首次进入 AA-Briefcase 私有长程知识工作基准,Elo 评分 1577,处于 Fable 5 档位,落后于 Claude Opus 5 家族。但其效率特征同样突出:平均用约 53 轮、约 5 亿输入令牌完成任务,而 Claude Opus 5(最高档)平均需要约 103 轮、约 20 亿输入令牌。

长程智能体任务会快速累积上下文,因此一个用更少轮数、更少输入令牌得到相近答案的模型,其成本优势远超每令牌定价本身。上下文窗口方面,Grok 4.6 维持 50 万令牌,与 4.5 相同;缓存命中价每百万令牌 0.5 美元,高于 4.5 的 0.3 美元。

来源:Artificial Analysis