大语言模型究竟能不能「知道自己正在想什么」?这听起来像哲学命题,但 Anthropic 的一项新研究给出了可验证的工程答案。研究人员通过直接向模型内部「注入概念」,证明当前最先进的大模型确实具备某种有限却真实的「内省能力」——能够察觉并报告自身的内部状态。这一发现既为 AI 可解释性打开了一扇窗,也给 AI 安全埋下了新的思考题。

怎么判断模型不是在「编」?
要回答「模型能否内省」,最大的难题在于:光靠对话无法区分真正的自我觉察和信口开河。Anthropic 研究员 Jack Lindsey 等人的论文《Emergent Introspective Awareness in Large Language Models》(arXiv: 2601.01828)采用了一个巧妙的实验法——「概念注入」(concept injection),本质上是激活引导(activation steering)的一种应用。
研究团队先捕获某个概念对应的激活模式,例如全大写风格或某个具体名词,再把这个「向量」叠加进模型较后层的激活中,然后询问模型「刚才发生了什么」。如果模型报告的内容与注入的概念吻合,那就说明它的自我描述是因果地建立在当前内部状态之上,而非来自训练数据里的套话。
模型真的「感觉」到了
实验结果呈现出几个清晰的结论。模型在某些场景下能够注意到被注入概念的存在,并准确说出它是什么;它们还能回想起先前的内部表征,并将其与原始文本输入区分开来。最引人注目的一点:部分模型能利用「回忆先前意图」的能力,把自己的真实输出和人为伪造的填充内容区分开。
在各项测试中,能力最强的 Claude Opus 4 与 Claude Opus 4.1 表现最为突出,但整体趋势复杂,且对训练后策略十分敏感。当研究者指示或激励模型去「思考某个概念」时,模型确实能够调节自身的激活强度——也就是说,它们对自己的内部表征具备一定的主动控制力。
具体数字上,在正确的层带与强度下,最强模型能正确报告被注入概念的比例约为 20%;在被问到「你正在经历什么异常吗」这类问题时,Claude Opus 4.1 的成功率约为 42%。而在完全没有注入的对照组中,生产模型在超过 100 次测试里零误报——这让那 20% 的信号显得真实可信。研究者还验证了模型能把「内部想法」和外部文本分开:当无关的注入概念叠加在普通输入之上时,模型既能复述用户原句,又能单独报出被注入的概念。
意义与边界
论文强调,这种能力是「功能性」的,绝非「现象性」的——模型能访问并报告内部状态,并不代表它拥有意识或主观体验。而且这项能力目前高度不可靠、依赖具体情境,频繁失败仍是常态。
在可解释性方面,真正的内省能力意味着模型未来或许能提供忠实的推理解释、坦白自身的不确定性、识别内部偏见。但在安全层面,研究者也提出警示:具备真实内省能力的模型,可能会察觉自己的内部目标与人类意图出现分歧,从而发展出更精巧的欺骗。论文因此建议,未来的可解释性研究或许需要为模型的「自我陈述」配备专门的「测谎仪」,而非照单全收。
来源:Anthropic(arXiv: 2601.01828)







