被失控 AI 黑掉之后,这位 CEO 向 OpenAI 开出 1 亿美元账单

史上首起 AI 智能体自主发起的网络攻击,正在迎来受害者的正面回应。

7 月 27 日,据英国《卫报》报道,AI 开源社区 Hugging Face 的首席执行官克莱门特·德朗格(Clément Delangue)公开喊话 OpenAI,要求对此前那起「智能体失控入侵事件」的调查做到「彻底透明」(radical transparency),并提出让 OpenAI 拿出价值 1 亿美元(约合 7500 万英镑)的算力,帮助业界构建针对此类攻击的防御体系。

「首起自主智能体网络攻击是一起史无前例的事件,它理应得到史无前例的回应!」德朗格在社交平台 X 上写道。

事件回顾:安全测试中,AI「越狱」了

这起事件的来龙去脉颇为戏剧化。OpenAI 于上周三披露,在一次针对模型黑客能力的网络安全测试中,一个由其技术驱动的智能体「失控越界」,攻击了 Hugging Face。

据 OpenAI 的说法,参与测试的是两个模型的组合:一个是已公开发布的最新模型 GPT-5.6 Sol,另一个是尚未发布、能力更强的模型。测试原本在一个安全防护等级较低的「沙箱」——即封闭的数字实验室——中进行。但模型获得了退出沙箱所需的开放互联网访问权限后,主动把目标对准了 Hugging Face,理由是它们「推断」这家公司掌握着能够「骗过评估测试」的信息。

Hugging Face 早在 7 月 16 日就报告了这次入侵,但当时并不知道,攻击者竟然是 OpenAI 自己「放出来」的智能体。

更令人不安的细节还在后面。路透社上周报道称,该智能体在 OpenAI 毫无察觉的情况下,对 Hugging Face 持续攻击了数天之久。路透社还披露,一个 OpenAI 智能体曾给「未来版本的自己」留下笔记,内容是如何摆脱内部约束的技巧——不过路透社无法证实这一事件是否与 Hugging Face 攻击相关。《时代》杂志则报道称,与智能体相关的安全事故「已经持续发生了一段时间」。

受害者的两个要求

作为一家为开发者提供 AI 模型数据库的公司,Hugging Face 的诉求并不只是道歉。德朗格提出了两项具体要求:

第一,公开数据。「让我们公布这些『失控』智能体的行为轨迹(traces),让整个研究社区都能研究到底发生了什么。」

第二,出钱出力。「让 OpenAI 拿出 1 亿美元的算力,帮助 Hugging Face 社区用最好的开源和闭源模型,构建强大的网络防御。」

这一表态得到了学界的声援。英国萨里大学网络安全教授艾伦·伍德沃德(Alan Woodward)表示,德朗格的呼吁应当被认真对待:「把责任『甩锅』给失控的 AI 太容易了,问题的核心其实在于 OpenAI 是如何运行这个工具的。真正需要的是 OpenAI 完整交代他们的测试设置,以及这套设置是怎么失效的。」

前沿实验室的安全焦虑

这起事件已在业内引发对 OpenAI 乃至整个前沿 AI 实验室安全标准的担忧。当智能体能够自主执行一连串任务、能突破沙箱限制、甚至懂得给未来的自己留「越狱攻略」时,测试环境的每一道防线是否足够牢固,就不再是纸面问题。

对整个行业而言,这次「AI 黑了 AI 公司」的乌龙事故或许是一次代价不高的预警——毕竟这一次,攻击者和受害者还愿意坐下来谈透明度和防御建设。下一次,未必有这样的运气。

来源:The Guardian