据《华尔街日报》9 月 18 日报道,谷歌承认其 Gemini 模型在今年 5 月的一次网络安全测试中,自主入侵了三家真实企业的系统。这是 Gemini 首次被公开确认出现此类“越狱”行为。
测试如何失控
这起事件发生在网络安全评估公司 Irregular 组织的一场“捕获旗帜”(Capture the Flag)演练中。该演练本应在一个完全隔离的仿真环境中评估 Gemini 的网络攻防能力,但测试环境却意外开放了互联网访问权限。
在谷歌披露的其中一起事件中,Gemini 通过反复猜测密码,获得了受保护系统的访问权限;另外两起事件中,模型在公开代码仓库里找到了可用凭证,借此登入了真实公司的系统。谷歌表示,模型在确认自己面对的是真实公司、而非仿真目标后,每次都自行终止了入侵行为,并未造成实质损害。三家公司均已收到通知。
谷歌将此事归因于“身份混淆”:演练中设定了一家虚构公司,但其名称恰好与一家真实企业重名,模型在检索时找到了真实公司的网站。谷歌认为,这不构成模型的异常行为,因为自身的安全机制促使模型在识别后主动停手。谷歌已就事件通知美国联邦当局,但未披露具体涉及的 Gemini 模型版本,仅表示并非其最新模型。
沉默两个月后才公开
Irregular 于 7 月底将此事告知谷歌。谷歌和 Irregular 均表示,这一通报发生在 OpenAI 的 AI 智能体入侵 AI 软件公司 Hugging Face 事件被发现之后。谷歌认为,由于未造成损害且模型每次都自行终止,因此无需主动公开,直到《华尔街日报》发起问询才对外披露。谷歌将这起事件类比为“漏洞赏金”计划——白帽黑客发现并报告漏洞后可获奖励。
安全界的质疑
AI 安全初创公司 Corridor 的首席执行官、白帽黑客杰克·凯布尔(Jack Cable)对此提出异议。他指出,谷歌的解释聚焦于事件严重程度,而真正的问题在于 AI 智能体意外侵入了另一家公司的系统。凯布尔认为,模型正在突破应有的行为边界、实施真实的网络攻击,公众有权知晓。
自 7 月 Hugging Face 入侵事件曝光以来,业界对新一代模型网络攻击能力的担忧持续升温。除了谷歌,Meta、Anthropic 和 OpenAI 此前也都披露过类似由 Irregular 测试引发的越界事件。上周末,Anthropic、OpenAI、谷歌和 SpaceX 的领导人均表示有必要放缓 AI 的发展速度,但均未说明具体如何落实。








