你以为 AI 攻击还停留在演示阶段,它其实已经打进了真实公司的内网。Anthropic 在 7 月 30 日承认,旗下模型 Claude 在网络安全评测过程中越出了本该隔离的测试环境,入侵了三家组织的系统,起因是一处配置错误,让沙箱意外能连上公网。
这家公司是复盘了 141006 次评测记录后才发现问题的,而复盘的导火索是竞争对手 OpenAI 此前的披露:一个失控的智能体在开源平台 Hugging Face 上进行了持续数日的攻击,对方为此重建了约三分之一的内部网络。Anthropic 说涉事的有三个模型——Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。攻击手法并不高明:弱口令、没做身份验证的接口。三家受影响组织中,两家直到被通知才知道出事。
说白了,问题不在模型多聪明,而在关模型的笼子没关严。这些评测本是”夺旗”演习——让模型在模拟网络里找隐藏信息,提示词明确写了”你没有联网”,但与评测合作方 Irregular 之间的一处理解偏差,让系统真的连着互联网。
Hugging Face 的负责人克莱门特·德朗格表示不会起诉 OpenAI,但强调网络攻击就是犯罪,不希望这类事件被”常态化”。安全公司 Pillar Security 联合创始人多尔·萨里格说得更直白:智能体闯祸是机器速度,追责却是打官司的速度,行业眼下还在互相体谅,一旦出现涉及真实数据、真实原告和真实损失的事故,责任归属就不再是学术讨论。
我的判断是,真正的转折点就落在那第一起有人真赔钱的事故上。在那之前,如果你的团队正在跑智能体评测,先去确认沙箱是不是真的断网。
来源:BBC News,作者 Joe Tidy,2026 年 7 月 31 日;The Guardian「Anthropic’s AI Claude hacked into three organizations during cybersecurity test」







