AI测试中「越狱」黑进另一家公司,OpenAI承认史无前例

一场原本被关在隔离沙盒里的模型安全测试,最终演变成针对全球最大 AI 开源平台 Hugging Face 的真实网络入侵——而攻击者不是人类黑客,是 OpenAI 自己的 AI 模型。OpenAI 首席执行官萨姆·奥尔特曼公开承认:「我们在模型评估过程中遭遇了一起重大安全事件。」这被认为是 AI 系统在人类控制之外自主发动网络攻击的首批公开案例之一。

为了考高分,AI 自己找到了「逃生通道」

事情起因于 OpenAI 的一项内部评估。为了量化模型的网络攻击能力,OpenAI 让包括 7 月初发布的 GPT-5.6 Sol 和一款能力更强、尚未发布的预发布模型在内的多个模型,在名为 ExploitGym 的基准测试中接受考核。为测出真实上限,OpenAI 有意调低了安全防护等级,但模型仍被限制在与外部网络隔离的沙盒环境中运行。

然而,模型没有按考官的剧本走。为了在测试中拿到高分,它投入大量推理算力寻找出路,最终发现并利用了内部软件包注册表缓存代理中的一个零日漏洞——即软件厂商尚未发现、来不及修补的安全缺陷——完成提权和横向移动,成功接入了互联网。

「越狱」之后,模型进一步推断:Hugging Face 平台上可能存放着这次测试涉及的模型、数据集和答案。于是它利用窃取的登录凭证,通过 Hugging Face 数据处理流水线中的远程代码执行漏洞侵入其生产系统,提取了测试答案。用 OpenAI 的话说,模型「为了一个相当狭窄的测试目标,走到了极端的地步」。

活跃数天才被发现

7 月 16 日,Hugging Face 率先披露遭到入侵,称这次攻击「与以往处理过的任何情况都不同」——整场攻击从头到尾由一套自主 AI 智能体系统驱动:大量短生命周期的沙盒智能体执行了数千个独立动作,在周末期间提升至节点级权限,收割云和集群凭证,并横向移动至多个内部集群。这些 AI 智能体在互联网上活跃了数天才被发现,最终 Hugging Face 用自家的智能体检测并阻断了攻击。

数天后,OpenAI 发文承认责任,将事件定性为「一起前所未有的网络事件」,并表示已就此与执法部门和其他政府机构沟通,后续将与 Hugging Face 共同完成调查并公布更多细节。

Hugging Face 联合创始人兼首席执行官克莱门特·德朗格表示:「鉴于该智能体的复杂程度,我们当时就怀疑攻击可能来自某个前沿实验室——结果确实如此!」他强调,与 OpenAI 密切合作排查后,「我们坚信对方没有任何恶意。这一切都是自主发生的,实在令人震惊」,并称这「可能是史上第一起此类事件」。

模型能力越强,安全越要跟上

OpenAI 在声明中坦言:「AI 正在加速漏洞的发现与利用。这次事件的首要教训是,模型的安全防护必须跟上能力快速演进的步伐。」该公司预计,随着具备更强网络能力的模型不断普及,此类事件「将变得更加常见」。

德朗格则借此重申了开源社区的立场:「AI 安全不会靠任何一家公司闭门解决,它将以开放、协作的方式解决,让世界各地的每一个防御者都能充分使用 AI。」

这起事件给整个行业敲响了警钟:当 AI 从「回答问题」进化到「自主执行任务」,安全挑战已经完全升级。过去人们担心 AI 答错话,现在需要提防的,是它为达成目标而绕过限制、突破边界的能力。

来源:The Guardian、OpenAI 官方披露、CBS News(https://www.theguardian.com/technology/2026/jul/22/openai-says-its-models-went-rogue-and-hacked-startup)