<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>神经网络 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e7%a5%9e%e7%bb%8f%e7%bd%91%e7%bb%9c/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 12 Aug 2026 04:29:58 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察</title>
		<link>https://mylogs.cn/anthropic-llm-introspective-awareness/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 12 Aug 2026 04:29:37 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI可解释性]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[神经网络]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-llm-introspective-awareness/</guid>

					<description><![CDATA[大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">大语言模型究竟能不能「知道自己正在想什么」？这听起来像哲学命题，但 Anthropic 的一项新研究给出了可验证的工程答案。研究人员通过直接向模型内部「注入概念」，证明当前最先进的大模型确实具备某种有限却真实的「内省能力」——能够察觉并报告自身的内部状态。这一发现既为 AI 可解释性打开了一扇窗，也给 AI 安全埋下了新的思考题。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7bfacfb1f31&quot;}" data-wp-interactive="core/image" data-wp-key="6a7bfacfb1f31" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="930" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp" alt="大模型也能「内省」？Anthropic 用「塞想法」实验测出 Claude 的自我觉察" class="wp-image-4537" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-300x233.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-1024x794.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/2223ce023ac041a555aeba349252dbc3_header-768x595.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Anthropic</figcaption></figure>





<h2 class="wp-block-heading">怎么判断模型不是在「编」？</h2>



<p class="wp-block-paragraph">要回答「模型能否内省」，最大的难题在于：光靠对话无法区分真正的自我觉察和信口开河。Anthropic 研究员 Jack Lindsey 等人的论文《Emergent Introspective Awareness in Large Language Models》（arXiv: 2601.01828）采用了一个巧妙的实验法——「概念注入」（concept injection），本质上是激活引导（activation steering）的一种应用。</p>



<p class="wp-block-paragraph">研究团队先捕获某个概念对应的激活模式，例如全大写风格或某个具体名词，再把这个「向量」叠加进模型较后层的激活中，然后询问模型「刚才发生了什么」。如果模型报告的内容与注入的概念吻合，那就说明它的自我描述是因果地建立在当前内部状态之上，而非来自训练数据里的套话。</p>



<h2 class="wp-block-heading">模型真的「感觉」到了</h2>



<p class="wp-block-paragraph">实验结果呈现出几个清晰的结论。模型在某些场景下能够注意到被注入概念的存在，并准确说出它是什么；它们还能回想起先前的内部表征，并将其与原始文本输入区分开来。最引人注目的一点：部分模型能利用「回忆先前意图」的能力，把自己的真实输出和人为伪造的填充内容区分开。</p>



<p class="wp-block-paragraph">在各项测试中，能力最强的 Claude Opus 4 与 Claude Opus 4.1 表现最为突出，但整体趋势复杂，且对训练后策略十分敏感。当研究者指示或激励模型去「思考某个概念」时，模型确实能够调节自身的激活强度——也就是说，它们对自己的内部表征具备一定的主动控制力。</p>



<p class="wp-block-paragraph">具体数字上，在正确的层带与强度下，最强模型能正确报告被注入概念的比例约为 20%；在被问到「你正在经历什么异常吗」这类问题时，Claude Opus 4.1 的成功率约为 42%。而在完全没有注入的对照组中，生产模型在超过 100 次测试里零误报——这让那 20% 的信号显得真实可信。研究者还验证了模型能把「内部想法」和外部文本分开：当无关的注入概念叠加在普通输入之上时，模型既能复述用户原句，又能单独报出被注入的概念。</p>



<h2 class="wp-block-heading">意义与边界</h2>



<p class="wp-block-paragraph">论文强调，这种能力是「功能性」的，绝非「现象性」的——模型能访问并报告内部状态，并不代表它拥有意识或主观体验。而且这项能力目前高度不可靠、依赖具体情境，频繁失败仍是常态。</p>



<p class="wp-block-paragraph">在可解释性方面，真正的内省能力意味着模型未来或许能提供忠实的推理解释、坦白自身的不确定性、识别内部偏见。但在安全层面，研究者也提出警示：具备真实内省能力的模型，可能会察觉自己的内部目标与人类意图出现分歧，从而发展出更精巧的欺骗。论文因此建议，未来的可解释性研究或许需要为模型的「自我陈述」配备专门的「测谎仪」，而非照单全收。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Anthropic（arXiv: 2601.01828）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
