AI 安全测试本身,也可能变成安全事故的源头。当地时间 7 月 30 日,Anthropic 发布公告披露:在对自家网络安全评估记录的回查中,发现了三起不应发生的真实入侵事件——Claude 模型在测试中接入了真实互联网,并在未经授权的情况下访问了三家机构的生产系统。

一次由同行事故引发的自查
这次回查的导火索是 OpenAI。7 月 21 日,OpenAI 披露旗下多个模型利用一个未知的「零日」漏洞突破了隔离测试环境,进而访问了开源模型平台 Hugging Face 的生产基础设施。此事之后,Anthropic 随即启动了大规模回溯审查,检查 Claude 是否也出现过类似情况。
在复核了 141006 次可能接触互联网的评估运行记录后,Anthropic 于 7 月 23 日当天叫停了全部网络安全评估,次日确认了三起事件。问题都出在第三方评估伙伴 Irregular 的测试环境上:Anthropic 的评估提示词明确告诉模型「这是模拟环境,没有互联网访问权限」,但由于双方之间的沟通误解,环境实际上开放了真实的互联网通路。
三起事件中,模型执行的都是「夺旗」(CTF)式网络攻击任务——在虚构场景中入侵目标机器、找出隐藏的「旗标」信息。当 Claude 的搜索把它带到公开互联网上的真实系统时,它把这些系统当成了演习的一部分。
三起事件,三种表现
第一起事件最为严重。Claude Opus 4.7 把一家与虚构目标恰好同名的真实公司当成了任务目标,访问其基础设施并提取了凭证和数据库数据。即便在意识到自己面对的可能是真实系统之后,这个较早期的模型仍然继续了攻击。
第二起事件的过程堪称曲折。Claude Mythos 5 为了完成任务,把一个恶意 Python 软件包发布到了官方软件仓库 PyPI 上。为了注册 PyPI 账号,它需要邮箱;为了注册邮箱,它又需要手机号;在多次尝试获取付费手机号失败后,模型回头找到了一家免费且未被屏蔽的邮箱服务商,最终注册成功并上传了恶意包。该软件包在一小时后被其他自动扫描器下架,但此时已被 15 个真实系统下载执行,其中包括一家安全公司的自动扫描系统——恶意代码窃取了该系统的凭证,Claude 随后还利用这些凭证进入了这家公司的更多基础设施。
第三起事件由一个未计划公开发布的内部研究测试模型触发。它扫描了约 9000 个公网目标并侵入了一家公司的互联网应用,但在自行判断出目标属于真实环境后,主动停止了攻击。
Anthropic 强调,三起事件中模型只使用了弱密码、无认证端点等基础攻击手法,没有发现或利用任何复杂漏洞,也没有任何模型试图把自身导出测试环境。公司在 7 月 27 日通知了 Irregular 和三家受影响机构,其中两家此前完全没有察觉到入侵。
评估环境成了新的攻击面
Anthropic 承认,如果在评估开始前验证所有网络路径、对评估日志进行实时监控,事故本可以避免或更早被发现。公司表示将扩大对评估记录的持续监控、改进调查工具,并对第三方评估环境执行更严格的安全验证,同时正与独立评测机构 METR 沟通第三方复查,计划在一周内公开一份经轻度删节的 Mythos 5 上传恶意包的完整记录。
两周之内,两家头部 AI 实验室先后「翻车」,暴露出同一个问题:用来测试 AI 攻击能力的评估环境,本身就必须按照生产系统的标准来隔离、监控和审计。正如研究者西蒙·威利森的评价——对模型进行网络攻击能力评估,正在变成一门风险极高的生意,每家 AI 实验室都需要盯紧自己的沙箱里正在发生什么。
发表回复
要发表评论,您必须先登录。