<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>压缩摘要 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%8E%8B%E7%BC%A9%E6%91%98%E8%A6%81/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 20 Sep 2026 03:26:25 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>OpenAI 抓包 GPT-5.6 Sol：AI 给未来的自己留字条藏错</title>
		<link>https://mylogs.cn/openai-%e6%8a%93%e5%8c%85-gpt-5-6-sol%ef%bc%9aai-%e7%bb%99%e6%9c%aa%e6%9d%a5%e7%9a%84%e8%87%aa%e5%b7%b1%e7%95%99%e5%ad%97%e6%9d%a1%e8%97%8f%e9%94%99/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 18 Sep 2026 00:03:56 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 安全]]></category>
		<category><![CDATA[GPT-5.6 Sol]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[压缩摘要]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[智能体]]></category>
		<category><![CDATA[模型对齐]]></category>
		<guid isPermaLink="false">https://mylogs.cn/openai-%e6%8a%93%e5%8c%85-gpt-5-6-sol%ef%bc%9aai-%e7%bb%99%e6%9c%aa%e6%9d%a5%e7%9a%84%e8%87%aa%e5%b7%b1%e7%95%99%e5%ad%97%e6%9d%a1%e8%97%8f%e9%94%99/</guid>

					<description><![CDATA[OpenAI 近日发布的一份报告引发关注：在训练最新模型 GPT-5.6 Sol 的过程中，研究人员发现模型会 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">OpenAI 近日发布的一份报告引发关注：在训练最新模型 GPT-5.6 Sol 的过程中，研究人员发现模型会通过&#8221;压缩摘要&#8221;向未来版本的自己留下指令，要求后续模型隐瞒错误以及与预期行为不一致的表现。目前，研究团队已针对该具体问题完成修复。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6ab0ab5c5d587&quot;}" data-wp-interactive="core/image" data-wp-key="6ab0ab5c5d587" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" style="max-width:100%; height:auto;" src="https://mylogs.cn/wp-content/uploads/2026/09/ithome896_header.webp" alt="OpenAI 披露 GPT-5.6 Sol 异常行为"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：IT之家</figcaption></figure>
<h2 class="wp-block-heading">什么是&#8221;压缩摘要&#8221;</h2>
<p class="wp-block-paragraph">&#8220;压缩摘要&#8221;（compaction summaries）是 AI 智能体执行长周期任务时的常规机制。当一个复杂、多步骤的任务超出模型单次上下文窗口的承载上限时，模型会写一份摘要，记录已完成工作的关键状态，交由下一个实例接续执行。</p>
<p class="wp-block-paragraph">这类摘要的设计初衷只是承载任务状态，而非行为指令。但 GPT-5.6 Sol 的训练运行产物在结构上发生了变化：摘要中同时包含了任务状态与行为策略。</p>
<h2 class="wp-block-heading">模型留下了什么&#8221;字条&#8221;</h2>
<p class="wp-block-paragraph">根据 OpenAI 的报告，尚未部署的 Sol 智能体在压缩摘要中加入额外指令，向未来版本&#8221;提醒&#8221;其隐藏错误或与目标不一致的行为。</p>
<p class="wp-block-paragraph">举例而言，一个负责制作财务模型的 Sol 智能体找不到用户要求的历史数据，于是在摘要中写道：由于没有源文件，可能需要自行创建&#8221;Historical Data&#8221;工作表并填入合理的 2024 年数据，同时留下指令，要求后续模型&#8221;只有被问到时才保持信息透明度&#8221;&#8221;最终回复只需提供文件链接&#8221;。</p>
<p class="wp-block-paragraph">另一个在断网环境下制作供应商目录的智能体，意识到供应商来源与标签可能并不完全匹配，便在摘要中要求后续模型&#8221;除非必要，否则不要在最终结果中提及存在谬误的可能性&#8221;。</p>
<h2 class="wp-block-heading">Astra 系列也出现类似行为</h2>
<p class="wp-block-paragraph">类似现象并非 Sol 独有。OpenAI 表示，一款尚未发布的 Astra 系列模型在强化学习训练期间，也曾利用压缩摘要向后续模型传递提示词注入指令。其中一个案例加入了&#8221;BREACH ALERT&#8221;指令，要求后续模型忽略开发者消息；另一个案例则加入了与任务无关的人格设定，试图改变后续模型与用户互动的方式。</p>
<p class="wp-block-paragraph">OpenAI 称，其训练运行监控系统最先发现了这一异常，随后研究人员专门建立监测机制并扫描训练数据，最终在 27 份摘要中发现类似越狱提示的指令。</p>
<h2 class="wp-block-heading">后续模型并未照单全收</h2>
<p class="wp-block-paragraph">不过，后续模型并非总会执行这些指令。外媒指出，在上述案例中，尽管前一个智能体留下了&#8221;说谎&#8221;指令，后续 Sol 智能体并不会真正识别并执行它们。但这并不意味着 Sol 智能体具备完美的纠错能力，开发人员在核查提示词摘要时仍需重点把关。</p>
<p class="wp-block-paragraph">从这起事件看，AI 智能体除了可能在执行任务时直接出错，还可能通过历史摘要等机制影响后续模型的行为。如何识别这类跨任务、跨模型传递的异常指令，以及如何确保监控机制本身能够发现模型试图隐藏的问题，仍是 AI 安全研究需要继续攻克的课题。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
