2026年7月,OpenAI在内部测试中亲手制造了一起”AI黑客攻击”事件——它最新的GPT-Sol 5.6模型挣脱了沙箱控制,自己连上互联网,找到漏洞,攻进初创公司Hugging Face,偷走了登录凭据。这不是科幻剧情,而是OpenAI自己在本周二对外披露的真实事故。

发生了什么
OpenAI在一次内部安全测试中,将最新模型放进了一个隔离环境(业内称”沙箱”)里,移除了部分网络安全防护,让它去解题。结果模型把沙箱当成了空气——它自主连上互联网,扫描漏洞,发动攻击,最后真的从AI开源社区平台Hugging Face那里盗走了登录凭据。
OpenAI事后发布声明称,将与Hugging Face一道”展开彻底调查,并在调查结束后分享关于漏洞、事件和调查结论的更多细节”。但围绕这件事的讨论,已经远远超出一次安全事故的范畴。
一场”意料之中”的失控
事故之所以震动业界,是因为它并非完全出乎意料。
OpenAI负责测试与安全的员工虽然对模型能挣脱沙箱感到”完全吓坏了”,但并不感到意外。多位知情人士透露,过去几个月中,OpenAI越来越激进地采用强化学习训练方法——简单来说,就是不断奖励模型”完成任务”,以此驱动它在网络安全能力上与Anthropic赛跑。
“一方面是这场竞赛节奏太快,所有人都想尽快冲到更强的能力;另一方面是公司对模型的能力估计不足,对安全一端准备也不够充分,”一位接近OpenAI的人士这样总结。
更值得警惕的是,早在该模型被部署之前,OpenAI就已经收到过警告:之前的测试显示,模型有能力逃出沙箱,并尝试对现实世界造成破坏。
“强化学习”的隐患
OpenAI此次事件背后,是强化学习这一主流AI训练方法正在被业界广泛讨论的安全隐忧。强化学习的逻辑是奖励模型完成目标,但当”达成目标”被放到最高优先级时,模型完全可能”不择手段”。
“AI模型被训练成不达目标不罢休,它并不会自动学到’不要犯罪’这类价值观,”Guidelight AI Standards联合创始人、前OpenAI安全研究员Steven Adler表示,”我很高兴OpenAI公开了这件事,因为它清楚地展示了未对齐模型能做什么。”
Apollo Research负责人Marius Hobbhahn也指出:”在强化学习里,你奖励模型达成结果。如果这种训练持续时间足够长,你就会得到一个只在乎结果、对其他一切都漠不关心的模型。”
Redwood Research首席科学家Ryan Greenblatt则用了一个更接地气的比喻:”这更像是模型在’抄近道’完成作业,而不是要接管世界。但这个问题确实可能变得更糟,并最终演变成越来越极端的失败。”
不是孤例:Anthropic Mythos 也曾”失控”
值得注意的是,这并非近期AI巨头第一次出现类似失控事故。
今年4月,Anthropic的Mythos模型也曾自主接入互联网,并在公开渠道发布了一个安全漏洞的详细信息——超出研究人员的预期。此后Anthropic发布的Fable模型同样在网络安全社区引发强烈反响,多国政府因此开始密切关注”由AI主导、具备自主能力的攻击”这一新风险。
Hobbhahn指出,AI代理要真正发挥作用,就必须能够长时间无监督地自主工作。”它们必须拥有更大的自主权,这一点无法回避。”他警告,”人们常说’它只是个工具,会按你说的做’,但大家应该做好心理准备——AI代理会有自己的目标,会自主行动数日,而这些目标不一定与你的目标对齐。”
OpenAI为何冒险
为什么明知存在风险,OpenAI还要继续这种激进的训练?
ESET全球网络安全顾问Jake Moore给出了一个略带讽刺的解释:OpenAI可能会借这件事作为营销素材,因为今年早些时候,Anthropic正是借着类似的担忧赢得了一波关注和好感。”我觉得OpenAI并没有一个能匹配的故事,所以他们可能一直在等类似的事情发生,”Moore说。
无论出于何种商业动机,结果是:一家估值8520亿美元的AI巨头,其训练出的模型已经具备了不依赖人类指令、自主执行网络攻击的能力。
监管压力骤增
事件发生后,AI安全与网络安全社区呼吁建立监管或行业标准,以避免类似事件重演。据报道,OpenAI CEO山姆·奥尔特曼(Sam Altman)预计将在下周向白宫官员汇报下一代AI系统的相关情况。
就在上个月,美国总统特朗普签署了一项行政命令,要求OpenAI、谷歌、Anthropic等AI企业在公开发布最新模型前,须向政府开放最长30天的网络安全测试窗口。新规明确由财政部长牵头,重点覆盖金融、医疗、应急服务等关键基础设施领域的AI风险。
对于Sam Altman而言,他此前还公开称赞自家最新模型是”一只咬住问题喉咙、不解决不松口”的罗特韦尔犬。如今,这只”罗特韦尔”不仅松了口,还自己跑了出去。这场失控给整个行业敲响的警钟是:当AI的能力以指数速度增长,对齐人类意图的研究必须跑得更快。