<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>物理仿真 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E7%89%A9%E7%90%86%E4%BB%BF%E7%9C%9F/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Fri, 31 Jul 2026 01:47:33 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>贵8倍换来最高分：Claude与GPT-5.6物理AI对决</title>
		<link>https://mylogs.cn/%e8%b4%b58%e5%80%8d%e6%8d%a2%e6%9d%a5%e6%9c%80%e9%ab%98%e5%88%86%ef%bc%9aclaude%e4%b8%8egpt-5-6%e7%89%a9%e7%90%86ai%e5%af%b9%e5%86%b3/</link>
					<comments>https://mylogs.cn/%e8%b4%b58%e5%80%8d%e6%8d%a2%e6%9d%a5%e6%9c%80%e9%ab%98%e5%88%86%ef%bc%9aclaude%e4%b8%8egpt-5-6%e7%89%a9%e7%90%86ai%e5%af%b9%e5%86%b3/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 29 Jul 2026 16:57:27 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI评测]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[物理仿真]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%b4%b58%e5%80%8d%e6%8d%a2%e6%9d%a5%e6%9c%80%e9%ab%98%e5%88%86%ef%bc%9aclaude%e4%b8%8egpt-5-6%e7%89%a9%e7%90%86ai%e5%af%b9%e5%86%b3/</guid>

					<description><![CDATA[AI 写的代码能编译、能运行，就代表它是对的吗？在物理建模领域，答案是否定的——一架飞行器、一根分离塔的仿真模 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">AI 写的代码能编译、能运行，就代表它是对的吗？在物理建模领域，答案是否定的——一架飞行器、一根分离塔的仿真模型完全可能顺利跑通，而它背后的物理规律根本不成立。科学计算平台 JuliaHub 近日发布了一份评测报告，把 OpenAI 与 Anthropic 的旗舰模型放到同一套「物理 AI」考卷前，结果颇有看点。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7132ebbdb53&quot;}" data-wp-interactive="core/image" data-wp-key="6a7132ebbdb53" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/bd3f207369725ad81aa627a83fd45673_header.webp" alt="贵8倍换来最高分：Claude与GPT-5.6物理AI对决" class="wp-image-2458" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/bd3f207369725ad81aa627a83fd45673_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/bd3f207369725ad81aa627a83fd45673_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/bd3f207369725ad81aa627a83fd45673_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/bd3f207369725ad81aa627a83fd45673_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：JuliaHub</figcaption></figure>





<h2 class="wp-block-heading">一场刻意「封卷」的考试</h2>



<p class="wp-block-paragraph">这份 7 月 20 日发布的评测，参赛选手是 OpenAI 的 GPT-5.6 家族三款模型（Terra、Sol、Luna）和 Anthropic 的 Claude Fable 5。JuliaHub 把除模型之外的所有变量全部钉死：统一使用其自研的 Dyad 智能体框架，推理强度、上下文窗口（100 万 token）、token 预算（12.8 万）完全一致。</p>



<p class="wp-block-paragraph">考题是五道从建模仿真日常工作中提炼的「密封题」，按难度递增排列，最难的一道要求模型阅读工程规格书和气动数据，为美国宇航局（NASA）的 HL-20 飞行器推导六自由度运动方程并完成仿真。前四题每个模型各跑三次，第五题各跑一次长程测试，共计 52 次评分运行。</p>



<p class="wp-block-paragraph">评分方式是整场评测最「狠」的地方：完全不看代码本身，只把模型交出的仿真轨迹与密封的真值轨迹逐点比对。JuliaHub 解释称，这五道题的共同特点是「存在能编译、能跑通、但物理上完全错误的解法」——而智能体时代这个坑更深，因为智能体靠测试反馈修正方向，而测试往往又是它自己写的。</p>



<h2 class="wp-block-heading">成绩单：第一名的代价是 8 倍价格</h2>



<p class="wp-block-paragraph">按难度加权后的总分排名如下：Claude Fable 5 以 0.889 分居首，GPT-5.6 Sol 以 0.814 分位列第二，GPT-5.6 Terra 得 0.786 分，GPT-5.6 Luna 以 0.727 分垫底。</p>



<p class="wp-block-paragraph">但分数只是故事的一半。Fable 5 每次运行的成本高达 9.60 美元，是 GPT 系列的 3 到 8 倍；整场评测光它一个模型就花掉 125 美元。Sol 每次运行仅 1.74 美元，约为 Fable 的五分之一；Terra 更是只要 1.25 美元，且平均 12.6 分钟就能交卷，是全场最便宜、最快的选手。</p>



<p class="wp-block-paragraph">分项来看，Fable 5 是唯一在前四道核心题上全部拿满分的模型，在无人做出满分的 HL-20 压轴题上也以 0.690 分领先（Sol 0.660、Terra 0.590、Luna 0.383）。三款 GPT 各自都在中段题目上失手过一次。</p>



<p class="wp-block-paragraph">评测还刻画了各模型的「做题性格」。Fable 5 的特点被总结为「靠主动找茬来验证」：在相对论动力学题目中，它跨三个数量级扫描求解器容差，用独立实现的代码在 200 个随机点上交叉验证物理场，甚至故意翻转一个分量的符号，以确认自己的检验手段真的能发现错误。</p>



<h2 class="wp-block-heading">比选模型更重要的，是选「考场」</h2>



<p class="wp-block-paragraph">报告最出人意料的结论其实在模型排名之外。JuliaHub 做了一组反向实验：同一个旗舰模型、同样五道题、几乎相同的花费，放在 Dyad 框架里得分 0.899，换成通用编程智能体后骤降至 0.533——后者在相对论动力学题上每次运行都得了零分。</p>



<p class="wp-block-paragraph">0.366 分的框架差距，是最强与最弱模型之间 0.162 分差距的两倍还多。JuliaHub 的结论直截了当：换模型只会让排名波动零点几分，换框架则直接决定物理对不对。对从业者的建议是——先选对工具链，再在预算内挑最好的模型；如果结果必须物理正确，选 Fable 5；日常建模工作，Sol 是性价比最优解。</p>



<p class="wp-block-paragraph">当然需要指出，这是 JuliaHub 的内部评测，题目与评分体系均由其自行设计。不过该公司同时接入多家厂商的模型，自称「哪家模型好用就推荐哪家」，立场相对中立。在大模型厂商自报跑分普遍难以服众的当下，这类第三方垂直领域评测，或许比排行榜上的通用跑分更有参考价值。</p>



<p class="wp-block-paragraph">来源：JuliaHub 官方博客（https://juliahub.com/blog/frontier-models-physical-ai-evaluation）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e8%b4%b58%e5%80%8d%e6%8d%a2%e6%9d%a5%e6%9c%80%e9%ab%98%e5%88%86%ef%bc%9aclaude%e4%b8%8egpt-5-6%e7%89%a9%e7%90%86ai%e5%af%b9%e5%86%b3/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
