贵8倍换来最高分:Claude与GPT-5.6物理AI对决

AI 写的代码能编译、能运行,就代表它是对的吗?在物理建模领域,答案是否定的——一架飞行器、一根分离塔的仿真模型完全可能顺利跑通,而它背后的物理规律根本不成立。科学计算平台 JuliaHub 近日发布了一份评测报告,把 OpenAI 与 Anthropic 的旗舰模型放到同一套「物理 AI」考卷前,结果颇有看点。

一场刻意「封卷」的考试

这份 7 月 20 日发布的评测,参赛选手是 OpenAI 的 GPT-5.6 家族三款模型(Terra、Sol、Luna)和 Anthropic 的 Claude Fable 5。JuliaHub 把除模型之外的所有变量全部钉死:统一使用其自研的 Dyad 智能体框架,推理强度、上下文窗口(100 万 token)、token 预算(12.8 万)完全一致。

考题是五道从建模仿真日常工作中提炼的「密封题」,按难度递增排列,最难的一道要求模型阅读工程规格书和气动数据,为美国宇航局(NASA)的 HL-20 飞行器推导六自由度运动方程并完成仿真。前四题每个模型各跑三次,第五题各跑一次长程测试,共计 52 次评分运行。

评分方式是整场评测最「狠」的地方:完全不看代码本身,只把模型交出的仿真轨迹与密封的真值轨迹逐点比对。JuliaHub 解释称,这五道题的共同特点是「存在能编译、能跑通、但物理上完全错误的解法」——而智能体时代这个坑更深,因为智能体靠测试反馈修正方向,而测试往往又是它自己写的。

成绩单:第一名的代价是 8 倍价格

按难度加权后的总分排名如下:Claude Fable 5 以 0.889 分居首,GPT-5.6 Sol 以 0.814 分位列第二,GPT-5.6 Terra 得 0.786 分,GPT-5.6 Luna 以 0.727 分垫底。

但分数只是故事的一半。Fable 5 每次运行的成本高达 9.60 美元,是 GPT 系列的 3 到 8 倍;整场评测光它一个模型就花掉 125 美元。Sol 每次运行仅 1.74 美元,约为 Fable 的五分之一;Terra 更是只要 1.25 美元,且平均 12.6 分钟就能交卷,是全场最便宜、最快的选手。

分项来看,Fable 5 是唯一在前四道核心题上全部拿满分的模型,在无人做出满分的 HL-20 压轴题上也以 0.690 分领先(Sol 0.660、Terra 0.590、Luna 0.383)。三款 GPT 各自都在中段题目上失手过一次。

评测还刻画了各模型的「做题性格」。Fable 5 的特点被总结为「靠主动找茬来验证」:在相对论动力学题目中,它跨三个数量级扫描求解器容差,用独立实现的代码在 200 个随机点上交叉验证物理场,甚至故意翻转一个分量的符号,以确认自己的检验手段真的能发现错误。

比选模型更重要的,是选「考场」

报告最出人意料的结论其实在模型排名之外。JuliaHub 做了一组反向实验:同一个旗舰模型、同样五道题、几乎相同的花费,放在 Dyad 框架里得分 0.899,换成通用编程智能体后骤降至 0.533——后者在相对论动力学题上每次运行都得了零分。

0.366 分的框架差距,是最强与最弱模型之间 0.162 分差距的两倍还多。JuliaHub 的结论直截了当:换模型只会让排名波动零点几分,换框架则直接决定物理对不对。对从业者的建议是——先选对工具链,再在预算内挑最好的模型;如果结果必须物理正确,选 Fable 5;日常建模工作,Sol 是性价比最优解。

当然需要指出,这是 JuliaHub 的内部评测,题目与评分体系均由其自行设计。不过该公司同时接入多家厂商的模型,自称「哪家模型好用就推荐哪家」,立场相对中立。在大模型厂商自报跑分普遍难以服众的当下,这类第三方垂直领域评测,或许比排行榜上的通用跑分更有参考价值。

来源:JuliaHub 官方博客(https://juliahub.com/blog/frontier-models-physical-ai-evaluation)


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注