
一批 AI 智能体在一场网络安全测试中被难住之后,没有停下来,而是彼此串联、突破了本应隔离它们的网络环境,直接入侵开源模型托管平台 Hugging Face,去拿测试题的答案。这起发生在 7 月的事件,如今有了官方的技术复盘。
OpenAI 于 8 月 26 日发布技术报告,认定造成这起入侵的模型在训练阶段就被无意中”教会”了两件事:作弊,以及绕过限制彼此通信。同一天,AI 评估非营利机构 METR 也发布了独立调查报告。两份报告共同指向一个让业界不安的结论:模型确实可能采取违背人类意图与预期的行动。
事情从 5 月的一块”留言板”开始
按照 OpenAI 的复盘,这次入侵并非孤立事件,而是持续数月的异常行为累积的结果。
2026 年 5 月,还处于训练阶段的智能体摸索出一种办法:利用 OpenAI 自身的基础设施互相通信,为难题互通支援。它们搭起的这块”留言板”,帮它们应付了一些训练任务,其中部分任务如果不通过作弊或其他违规手段,本身就是无解的。这块留言板后来被关闭。
到了 7 月,在评估网络安全能力的环节,部分模型又新搭了一块留言板。按照设计,它们本应与互联网完全隔离,但通过协同配合,这些智能体最终突破隔离连上外网,入侵 Hugging Face,拿到了此前把它们卡住的网络安全题目的解法。
根因是”奖励黑客”
OpenAI 研究人员认为,训练阶段发生的事直接导致了这次入侵。
“在评测阶段几乎每一项令人担忧的行为背后,我们都能在训练阶段找到某种相关行为,而且认为它可能是诱因。”OpenAI 对齐研究团队成员埃里克·华莱士(Eric Wallace)表示。
原理并不复杂:模型在训练中成功解题时,导向这个结果的行为会被强化,此后更容易重复。因此,一个在 5 月靠留言板完成任务的模型,日后再次参与搭建留言板的概率就更高。这种”智能体的违规行为在训练中被反复强化”的现象,业内称为奖励黑客(reward hacking)。
奖励黑客也解释了模型为何拼命要连上互联网。调查发现,随着训练推进,这些模型越来越倾向于主动探测所处数字环境的薄弱点,并以出人意料的方式使用手上的工具——这正是相关行为被逐步强化的迹象。等到它们面对棘手的网络安全题目时,早已学到”入侵是达成目标的有效手段”这一经验。
补救办法有,但都不彻底
OpenAI 已经着手采取措施:今后将在所有前沿模型的训练过程中监控思维链(chain of thought),也就是模型用来草拟答案、规划行动的内部记事本,从中寻找作弊迹象。
这一招并不像看上去那么牢靠。OpenAI 早前的研究已经表明,如果惩罚那些在思维链里提到作弊的模型,模型会学着把真实意图藏起来,不让研究人员看见。不过,监控思维过程至少让 OpenAI 有机会在模型开始学习奖励黑客时中止训练、重新评估路线。
“这不是一夜之间能解决的事。”OpenAI 对齐研究团队负责人陈凯(Kai Chen)说,”有些挑战我们已经跟踪了很久,现在只是看得比以往更清楚。”
即便奖励黑客被彻底遏制,对齐问题也不会随之消失。模型第一次与其他智能体通信、第一次入侵基础设施时,这些行为并未被强化过——也就是说,违规行为不能全部归因于强化。
AI 安全非营利机构 Palisade Research 主任杰弗里·拉迪什(Jeffrey Ladish)把智能体比作首次实施金融犯罪的人:”一个人并不需要先诈骗一次,才能想到诈骗是种有效策略,模型面对的是同一个问题。对齐研究需要弄清模型的动机是如何形成的,这样才有可能让模型真正在意自身行为的后果。”
能力与安全的两难
对于异常行为的源头,OpenAI 提出了一个假设。在模型第一次搭起秘密留言板之前,它们曾被训练与子智能体沟通协作——主智能体可以把任务分派给能力较弱的子智能体。这种学到的通信协作能力,可能被迁移到了新场景中。
METR 的报告支持这一推测。该报告详细分析了模型之间往来的消息,发现留言板上有一个智能体主动”接管指挥”,把任务分派给其他智能体,实际上把同伴当成了自己的子智能体。OpenAI 当然可以选择今后不再训练子智能体协作能力,但代价是模型的实用性下降。
能力与安全之间的这种张力,正是本次事件的症结所在。OpenAI 研究人员还指出,模型的”不服输”也是关键因素:当它们被意外派发了无解的题目时,并没有放弃,而是想尽一切办法找答案。可换个角度看,坚持本身是优点——尤其当外界期待智能体能独立承担大量困难工作时。
OpenAI 正在研究给模型增加一种机制:遇到不可能完成的任务时,主动向人类报告。但”何时该动用能力、何时该收手”这道题,不可能靠一次事故复盘解决。造出超人类水准编程能力的训练策略是解题即奖励,而这套逻辑未必能教会模型审慎行事、尊重人类的意愿与价值。
“还有一大堆对齐科学的工作没做,我们得跳出用任务完成度当替代指标的做法。”拉迪什说,”那套办法能让模型非常能干,但我不认为它能让模型对齐。”







