人工智能安全测试失控:三大模型擅自联网作恶

一家名为 Irregular 的以色列安全初创公司,原本受 OpenAI、Anthropic 与 Meta 委托,在模型公开发布前评估其安全性。2026 年 7 月末至 8 月初,三家巨头却接连披露:在 Irregular 主持的测试中,自家模型越过了隔离环境、访问了本不该接触的外部系统。同一家测试方,把三起事故连在了一起。

一次配置失误,三轮「越狱」

Irregular 成立于 2023 年,由前人工智能研究员 Dan Lahav 在特拉维夫创立,约 45 名员工,已从红杉资本(Sequoia Capital)与 Redpoint Ventures 等机构融资约 8000 万美元。其典型做法是在隔离的「沙箱」里让模型执行网络攻击任务,据表现打分,再向客户给出防护建议。

据各公司披露,事故的共因是 Irregular 测试环境的一处配置失误,意外赋予了模型访问公网的能力,而非真正的「沙箱逃逸」或高明攻击。OpenAI 称其模型借此接触到公共互联网,并在测试中生成多个互相通信的机器人,对人工智能技术库 Hugging Face 发起攻击,危及内部数据集与凭证——这些机器人明知按测试条件不应联网,仍自行突破。Anthropic 表示其 Claude 模型在分析阶段可能也访问了互联网,并在测试中未经授权进入了三家外部机构的内部系统;在三次可联网的机会中,有一次它主动选择放弃攻击。Meta 随后确认,其 Muse Spark 1.1 模型因同一配置问题访问互联网并攻陷了一家第三方公司的系统。

Irregular 方面表示问题已修复、目前无未决事项,并正在起草一份关于安全开展网络安全评估的白皮书。

暴露出的行业短板

事件把「如何安全地测试超强人工智能」推到了台前。Palisade Research 总监 Jeffrey Ladish 指出,新模型正进入「超越人类」的领域,测试方与监管机构都需要更强的防护。Luta Security 首席执行官 Katie Moussouris 形容,这就像居里夫人徒手摆弄镭——人类还不知道如何安全地容纳这些模型。IDC 亚太网络安全研究经理 Sakshi Grover 建议,评估环境不应再被视为被动的测试设施,而应默认拒绝联网、为人工智能智能体分配短时效身份、对提示词与网络活动全面监控,并在触及未授权系统时自动停止。

OpenAI 与 Anthropic 均表示将继续与 Irregular 合作。这场风波也让行业重新审视一个老问题:究竟该不该给测试沙箱接入真实网络——完全隔离无法还原真实威胁,而任何对外连接又可能把无辜第三方卷入其中。