<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI基准测试 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai%e5%9f%ba%e5%87%86%e6%b5%8b%e8%af%95/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Mon, 03 Aug 2026 07:08:07 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>哈布斯堡下巴青蛙，考倒了谁</title>
		<link>https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/</link>
					<comments>https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 07:08:35 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI基准测试]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Gemini]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[SVG生成]]></category>
		<category><![CDATA[国产AI]]></category>
		<category><![CDATA[大模型对比]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/</guid>

					<description><![CDATA[你给 AI 下过最离谱的指令是什么？ 一个独立开发者最近让 14 款主流大模型做同一件事：画一只带有“哈布斯堡 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你给 AI 下过最离谱的指令是什么？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729d7b500a9&quot;}" data-wp-interactive="core/image" data-wp-key="6a729d7b500a9" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header.webp" alt="哈布斯堡下巴青蛙，考倒了谁" class="wp-image-3415" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/f2e053a74e44b98da3104413d2c26986_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：frogs.vaguespac.es</figcaption></figure>





<p class="wp-block-paragraph">一个独立开发者最近让 14 款主流大模型做同一件事：画一只带有“哈布斯堡下巴”的青蛙 SVG。这个下颌前突的遗传特征本是欧洲皇室近亲结婚的产物，现在成了检验模型是否“听话”又“不瞎编”的基准测试。</p>



<p class="wp-block-paragraph">测试覆盖 Claude 5 系列、GPT-5.5 / GPT-5.4-mini、Gemini 2.5 Pro / 3.6 Flash、Grok 4.5、DeepSeek-v4-pro、Kimi k3、GLM-5.1、Qwen3.7-Max、Llama 4 Maverick、Mistral Large 2512。每个模型跑 3 次，记录耗时和输出体积。</p>



<h2 class="wp-block-heading">成绩差得离谱</h2>



<p class="wp-block-paragraph">结果差异巨大。Llama 4 最快，6.9 秒、仅 536 字节；Kimi k3 最慢，169.1 秒。最“戏精”的是 Gemini 3.6 Flash，生生给青蛙加了皇室项圈、金羊毛勋章和阴郁表情；DeepSeek-v4-pro 则给青蛙穿上长袍，脑补出“傲慢俯视”的解说词。</p>



<p class="wp-block-paragraph">说白了，这个测试看的不是谁画得好看，而是谁能按要求干活、不多加戏。在代码和图形生成场景里，后者比前者重要得多——你今天让它画只青蛙，明天可能就是让它生成一段控制代码，多出来的“皇室想象”就是 bug。</p>



<h2 class="wp-block-heading">你的判断标准该更新了</h2>



<p class="wp-block-paragraph">下次你想快速判断一个 AI 是“直男”还是“戏精”，不妨也丢一个精确到细节的奇怪任务给它。看它到底是按指令执行，还是忍不住自我发挥。</p>



<p class="wp-block-paragraph">来源：Frogs — the Habsburg-jaw SVG benchmark（frogs.vaguespac.es）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e5%93%88%e5%b8%83%e6%96%af%e5%a0%a1%e4%b8%8b%e5%b7%b4%e9%9d%92%e8%9b%99%ef%bc%8c%e8%80%83%e5%80%92%e4%ba%86%e8%b0%81/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>模型没变分数翻三倍：OpenAI 揪出两个 API 设置</title>
		<link>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/</link>
					<comments>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 02:44:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI基准测试]]></category>
		<category><![CDATA[ARC-AGI-3]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Responses API]]></category>
		<category><![CDATA[上下文压缩]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/</guid>

					<description><![CDATA[模型没变分数翻三倍：OpenAI 揪出两个 API 设置]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">同一个模型，同一套题目，成绩却相差三倍——问题不在模型，而在跑分时用的那套外围代码。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729d7b509b5&quot;}" data-wp-interactive="core/image" data-wp-key="6a729d7b509b5" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header.webp" alt="模型没变分数翻三倍：OpenAI 揪出两个 API 设置" class="wp-image-3377" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenAI</figcaption></figure>





<p class="wp-block-paragraph">2026 年 7 月 29 日，OpenAI 发布了一篇技术博客，标题直白得像是自嘲：《开启两个设置，ARC-AGI-3 上的分数翻了三倍》。文章披露，旗下模型 GPT‑5.6 Sol 在这项公开基准测试上的糟糕表现，很大程度上并非模型能力不足，而是评测框架的两个默认设定把它的&#8221;记忆&#8221;清空了。</p>



<h2 class="wp-block-heading">反常的低分</h2>



<p class="wp-block-paragraph">ARC-AGI-3 是一项衡量 AI 智能体学习与推理能力的基准测试。它的特别之处在于不告诉模型规则：智能体被丢进一个陌生的二维益智游戏里，只能靠自己观察、试错、总结，逐步推断玩法。目前有 25 个演示游戏公开在 arcprize.org/tasks 上，任何人都可以自己上手试。</p>



<p class="wp-block-paragraph">在这项测试中，GPT‑5.6 Sol 只拿到 7.8% 的分数，上一代 GPT‑5.5 更是几乎玩不动，仅得 0.4%。</p>



<p class="wp-block-paragraph">这个成绩让 OpenAI 团队感到困惑，因为同一个模型在别处的表现完全不是这个水平：它证明过数学界悬置多年的开放问题「循环双覆盖猜想」，通关过《宝可梦：火红》（使用纯视觉框架），在 Codex 的计算机操作能力加持下打通过《杀戮尖塔》，还完成了《Baba Is You》的前期关卡。研究者 Ethan Mollick 还展示过它在 Codex 中通关《杀戮尖塔 2》的每日随机挑战——这款游戏发布时间晚于模型的知识截止日期。</p>



<p class="wp-block-paragraph">那么二维益智游戏究竟难在哪里？</p>



<h2 class="wp-block-heading">两个设定，把模型变成了失忆症患者</h2>



<p class="wp-block-paragraph">深入排查后，OpenAI 找到了两处关键问题，都出在评测框架而非模型本身。</p>



<p class="wp-block-paragraph"><strong>第一，每执行一步动作，模型的私有推理内容会被全部丢弃。</strong> 这意味着每走一步，GPT‑5.6 Sol 都要从零开始重新理解这个游戏。它能看到自己过去下过哪些指令、附带的简短备注，却看不到当初促成那些指令的计划、推断和思路。</p>



<p class="wp-block-paragraph"><strong>第二，框架采用了滚动截断的方式管理上下文。</strong> 当对话内容超过 175,000 字符时，最早的消息会被直接删除。于是模型不但记不住自己想过什么，连做过什么也在逐渐遗忘。</p>



<p class="wp-block-paragraph">两者叠加，一个本该在游戏中不断积累经验的智能体，被迫每回合都当一次新手。</p>



<h2 class="wp-block-heading">换成生产环境的配置</h2>



<p class="wp-block-paragraph">OpenAI 的模型在训练时就带有私有推理消息机制：先在内部思考，再输出回复或工具调用，这些思考内容会作为对话历史保留下来；对话过长时则做摘要压缩后继续。ChatGPT 和 Codex 采用的正是这套逻辑。</p>



<p class="wp-block-paragraph">为了对齐真实部署环境，团队用 Responses API 重新实现了 ARC-AGI-3 的运行框架。对 GPT‑5.6 而言，只要传入上一次响应的 ID，推理内容就会在工具调用和多轮对话之间自动保留。</p>



<p class="wp-block-paragraph">改动后出现两个明显变化：模型在每步动作前的思考时间反而缩短了，因为不必再从头解读游戏；同时它在长时间交互中学得更快，能持续使用连贯的策略。</p>



<p class="wp-block-paragraph">第二项改动是用上下文压缩（compaction）替换滚动截断。压缩不是删除最早的内容，而是把它总结保留下来。这样模型在长局游戏中能守住此前积累的认知，分数更高，输出的 token 反而更少。</p>



<h2 class="wp-block-heading">最终数字</h2>



<p class="wp-block-paragraph">在官方框架下，GPT‑5.6 Sol 在 ARC-AGI-3 公共任务集上得分 13.3%；开启保留推理与上下文压缩后，得分升至 38.3%，约为原先的三倍，输出 token 减少约 6 倍。</p>



<p class="wp-block-paragraph">评分采用的指标是 RHAE（相对人类操作效率），衡量模型表现与人类基准的比值。根据官方游戏日志估算，人类测试者的平均分约为 48%。测试中模型并不知道自己会被如何打分，也无法在过程中看到分数，每次动作只能得到当前画面的文本表示和所处关卡。</p>



<p class="wp-block-paragraph">在其中一款游戏的排行榜上，此前没有任何前沿模型能通过第一关；换用 OpenAI 的运行框架后，GPT‑5.6 Sol 六关全部通关。</p>



<h2 class="wp-block-heading">给开发者的三条建议</h2>



<p class="wp-block-paragraph">OpenAI 在结论中提醒：评测很少能孤立地衡量模型本身，它同时也在衡量一整套不那么显眼的选择——API 设置、运行框架设计和提示词写法。文章还提到，这并不是该团队第一次先被公开榜单上的低分吓一跳，随后发现评测方使用的通用框架把推理消息丢掉了。</p>



<p class="wp-block-paragraph">对希望榨出模型最大性能的 API 开发者，OpenAI 给出的建议是照搬自家产品的配置：使用 Responses API 而不是旧版 Chat Completions API；开启保留推理；使用上下文压缩。对比不同模型时，也应优先参考采用上述设置的评测结果，因为那更接近 ChatGPT 和 Codex 中的真实使用状态。</p>



<p class="wp-block-paragraph">需要说明的是，OpenAI 的这套框架是针对自家模型特性做的优化，而 ARC 团队坚持使用通用框架，本意正是让不同厂商的模型在同一条件下比较、并让模型短板更容易暴露。两种立场各有道理，但这场排查至少说明了一件事：看到一个跑分数字时，先问一句&#8221;是谁跑的、用什么跑的&#8221;，往往比数字本身更有信息量。</p>



<p class="wp-block-paragraph">来源：OpenAI 官方博客《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》，2026 年 7 月 29 日</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
