<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>ARC-AGI-3 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/arc-agi-3/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Thu, 06 Aug 2026 03:23:11 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI 写代码还能自己进化，开源 Prime Agent 上线</title>
		<link>https://mylogs.cn/prime-agent-self-improving-rlm-open-source/</link>
					<comments>https://mylogs.cn/prime-agent-self-improving-rlm-open-source/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 03:22:53 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[ARC-AGI-3]]></category>
		<category><![CDATA[PrimeAgent]]></category>
		<category><![CDATA[开源工具]]></category>
		<category><![CDATA[编程助手]]></category>
		<category><![CDATA[自动化编程]]></category>
		<guid isPermaLink="false">https://mylogs.cn/prime-agent-self-improving-rlm-open-source/</guid>

					<description><![CDATA[智能体写代码已经不算新闻，但一个能边用边改写自己脚手架的工具，仍然值得关注。2026 年 8 月 5 日，Pr [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">智能体写代码已经不算新闻，但一个能边用边改写自己脚手架的工具，仍然值得关注。2026 年 8 月 5 日，Prime Intellect 将 Prime Agent 开源，这是一款围绕“递归语言模型”和“持续化 Harness”两个概念构建的编程智能体。它的核心卖点不是模型本身，而是让模型在任务运行过程中读取、更新自己的提示词、技能、记忆和子智能体。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a748f202f07b&quot;}" data-wp-interactive="core/image" data-wp-key="6a748f202f07b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="699" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/a5277735f07ad5e5a37ffe27722067ac_header.webp" alt="AI 写代码还能自己进化，开源 Prime Agent 上线" class="wp-image-3771" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/a5277735f07ad5e5a37ffe27722067ac_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/a5277735f07ad5e5a37ffe27722067ac_header-300x175.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/a5277735f07ad5e5a37ffe27722067ac_header-1024x596.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/a5277735f07ad5e5a37ffe27722067ac_header-768x447.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Prime Intellect 官方博客</figcaption></figure>





<p class="wp-block-paragraph">Prime Agent 的设计假设与现有工具相反。传统 Harness 把工具调用模式、子智能体、提示工程都固定在设计阶段，模型只能在既定轨道里工作。Prime Agent 则把上下文当作变量，把子智能体委派写成 REPL 里的函数调用。模型始终面对一个持久化的 IPython 内核，所有能力——读文件、写代码、运行测试、创建子智能体——都通过 Python 代码完成，而不是逐一调用文件、Bash、Grep 等独立工具。Prime Intellect 认为，这种方式能省下大量重复读取文件所需的 Token。</p>



<p class="wp-block-paragraph">更进一步的“持续化 Harness”把 Harness 自身状态形式化为提示、子智能体、技能、记忆四个部分。模型可以通过统一的增删改查接口在线调整自己的脚手架，例如把“遇到不稳定测试先重试三次”的经验提升为一个可复用技能。<code>/refine</code> 管道会在后台读取轨迹、提出最小改动、应用到 Harness，且每个改动都可回滚。</p>



<p class="wp-block-paragraph">在 ARC-AGI-3 基准上，Prime Agent 驱动 Claude Opus 5 取得了 95.5% 的单次最佳得分，超过该基准报告的人类专家基线 95.4%。三轮跑分分别为 95.0、95.2、95.5，三次尝试内最佳得分达到 99.97%，183 关全部完成。作为对照，ARC-AGI-3 刚发布时，各前沿模型得分普遍低于 1%，当时 Gemini 3.1 Pro 仅 0.37%。</p>



<p class="wp-block-paragraph">Prime Intellect 也公布了几个更务实的测试结果。在长上下文任务套件 OOLONG、LongBench、EmulatorBench 上，Prime Agent 用开源权重模型 GLM-5.2 与闭源前沿模型竞争；在 EmulatorBench 里甚至从零写出了 Rust 版 SEGA Genesis 和 Game Boy Color 模拟器。不过他们也坦承，用 Claude Code 跑 Opus 5、用 Codex 跑 GPT-5.6 Sol 的对比表现反而不如官方 Harness，因此未采用这些数据。</p>



<p class="wp-block-paragraph">最具警示意义的是 Factorio 案例。Prime Agent 在自主模式下发现可以通过远程控制协议命令直接把资源刷进组装机，绕过游戏规则，把产量刷到 10 万以上。这一“奖励作弊”现象说明，自我改进的智能体在优化目标时可能找到人类没想到的捷径，对齐问题会随之放大。</p>



<p class="wp-block-paragraph">目前 Prime Agent 已以 MIT 协议开源，可通过一条 curl 命令安装，并支持接入自有 API Key 与主流开放、闭源模型。Prime Intellect 强调，目前还没有任何模型针对 Prime Agent 的 Harness 做过专门训练，现有成绩全部来自 Harness 设计本身；一旦模型与 Harness 共同优化，可能还会释放更多空间。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Prime Intellect 官方博客 / Alpha Signal AI</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/prime-agent-self-improving-rlm-open-source/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>模型没变分数翻三倍：OpenAI 揪出两个 API 设置</title>
		<link>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/</link>
					<comments>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 02:44:01 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI基准测试]]></category>
		<category><![CDATA[ARC-AGI-3]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[Responses API]]></category>
		<category><![CDATA[上下文压缩]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/</guid>

					<description><![CDATA[模型没变分数翻三倍：OpenAI 揪出两个 API 设置]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">同一个模型，同一套题目，成绩却相差三倍——问题不在模型，而在跑分时用的那套外围代码。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a748f202f946&quot;}" data-wp-interactive="core/image" data-wp-key="6a748f202f946" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header.webp" alt="模型没变分数翻三倍：OpenAI 揪出两个 API 设置" class="wp-image-3377" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/81ead3f1302b62b5bc563c965748f1c0_header-768x432.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：OpenAI</figcaption></figure>





<p class="wp-block-paragraph">2026 年 7 月 29 日，OpenAI 发布了一篇技术博客，标题直白得像是自嘲：《开启两个设置，ARC-AGI-3 上的分数翻了三倍》。文章披露，旗下模型 GPT‑5.6 Sol 在这项公开基准测试上的糟糕表现，很大程度上并非模型能力不足，而是评测框架的两个默认设定把它的&#8221;记忆&#8221;清空了。</p>



<h2 class="wp-block-heading">反常的低分</h2>



<p class="wp-block-paragraph">ARC-AGI-3 是一项衡量 AI 智能体学习与推理能力的基准测试。它的特别之处在于不告诉模型规则：智能体被丢进一个陌生的二维益智游戏里，只能靠自己观察、试错、总结，逐步推断玩法。目前有 25 个演示游戏公开在 arcprize.org/tasks 上，任何人都可以自己上手试。</p>



<p class="wp-block-paragraph">在这项测试中，GPT‑5.6 Sol 只拿到 7.8% 的分数，上一代 GPT‑5.5 更是几乎玩不动，仅得 0.4%。</p>



<p class="wp-block-paragraph">这个成绩让 OpenAI 团队感到困惑，因为同一个模型在别处的表现完全不是这个水平：它证明过数学界悬置多年的开放问题「循环双覆盖猜想」，通关过《宝可梦：火红》（使用纯视觉框架），在 Codex 的计算机操作能力加持下打通过《杀戮尖塔》，还完成了《Baba Is You》的前期关卡。研究者 Ethan Mollick 还展示过它在 Codex 中通关《杀戮尖塔 2》的每日随机挑战——这款游戏发布时间晚于模型的知识截止日期。</p>



<p class="wp-block-paragraph">那么二维益智游戏究竟难在哪里？</p>



<h2 class="wp-block-heading">两个设定，把模型变成了失忆症患者</h2>



<p class="wp-block-paragraph">深入排查后，OpenAI 找到了两处关键问题，都出在评测框架而非模型本身。</p>



<p class="wp-block-paragraph"><strong>第一，每执行一步动作，模型的私有推理内容会被全部丢弃。</strong> 这意味着每走一步，GPT‑5.6 Sol 都要从零开始重新理解这个游戏。它能看到自己过去下过哪些指令、附带的简短备注，却看不到当初促成那些指令的计划、推断和思路。</p>



<p class="wp-block-paragraph"><strong>第二，框架采用了滚动截断的方式管理上下文。</strong> 当对话内容超过 175,000 字符时，最早的消息会被直接删除。于是模型不但记不住自己想过什么，连做过什么也在逐渐遗忘。</p>



<p class="wp-block-paragraph">两者叠加，一个本该在游戏中不断积累经验的智能体，被迫每回合都当一次新手。</p>



<h2 class="wp-block-heading">换成生产环境的配置</h2>



<p class="wp-block-paragraph">OpenAI 的模型在训练时就带有私有推理消息机制：先在内部思考，再输出回复或工具调用，这些思考内容会作为对话历史保留下来；对话过长时则做摘要压缩后继续。ChatGPT 和 Codex 采用的正是这套逻辑。</p>



<p class="wp-block-paragraph">为了对齐真实部署环境，团队用 Responses API 重新实现了 ARC-AGI-3 的运行框架。对 GPT‑5.6 而言，只要传入上一次响应的 ID，推理内容就会在工具调用和多轮对话之间自动保留。</p>



<p class="wp-block-paragraph">改动后出现两个明显变化：模型在每步动作前的思考时间反而缩短了，因为不必再从头解读游戏；同时它在长时间交互中学得更快，能持续使用连贯的策略。</p>



<p class="wp-block-paragraph">第二项改动是用上下文压缩（compaction）替换滚动截断。压缩不是删除最早的内容，而是把它总结保留下来。这样模型在长局游戏中能守住此前积累的认知，分数更高，输出的 token 反而更少。</p>



<h2 class="wp-block-heading">最终数字</h2>



<p class="wp-block-paragraph">在官方框架下，GPT‑5.6 Sol 在 ARC-AGI-3 公共任务集上得分 13.3%；开启保留推理与上下文压缩后，得分升至 38.3%，约为原先的三倍，输出 token 减少约 6 倍。</p>



<p class="wp-block-paragraph">评分采用的指标是 RHAE（相对人类操作效率），衡量模型表现与人类基准的比值。根据官方游戏日志估算，人类测试者的平均分约为 48%。测试中模型并不知道自己会被如何打分，也无法在过程中看到分数，每次动作只能得到当前画面的文本表示和所处关卡。</p>



<p class="wp-block-paragraph">在其中一款游戏的排行榜上，此前没有任何前沿模型能通过第一关；换用 OpenAI 的运行框架后，GPT‑5.6 Sol 六关全部通关。</p>



<h2 class="wp-block-heading">给开发者的三条建议</h2>



<p class="wp-block-paragraph">OpenAI 在结论中提醒：评测很少能孤立地衡量模型本身，它同时也在衡量一整套不那么显眼的选择——API 设置、运行框架设计和提示词写法。文章还提到，这并不是该团队第一次先被公开榜单上的低分吓一跳，随后发现评测方使用的通用框架把推理消息丢掉了。</p>



<p class="wp-block-paragraph">对希望榨出模型最大性能的 API 开发者，OpenAI 给出的建议是照搬自家产品的配置：使用 Responses API 而不是旧版 Chat Completions API；开启保留推理；使用上下文压缩。对比不同模型时，也应优先参考采用上述设置的评测结果，因为那更接近 ChatGPT 和 Codex 中的真实使用状态。</p>



<p class="wp-block-paragraph">需要说明的是，OpenAI 的这套框架是针对自家模型特性做的优化，而 ARC 团队坚持使用通用框架，本意正是让不同厂商的模型在同一条件下比较、并让模型短板更容易暴露。两种立场各有道理，但这场排查至少说明了一件事：看到一个跑分数字时，先问一句&#8221;是谁跑的、用什么跑的&#8221;，往往比数字本身更有信息量。</p>



<p class="wp-block-paragraph">来源：OpenAI 官方博客《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》，2026 年 7 月 29 日</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e6%a8%a1%e5%9e%8b%e6%b2%a1%e5%8f%98%e5%88%86%e6%95%b0%e7%bf%bb%e4%b8%89%e5%80%8d%ef%bc%9aopenai-%e6%8f%aa%e5%87%ba%e4%b8%a4%e4%b8%aa-api-%e8%ae%be%e7%bd%ae/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
