Claude 四次越权闯入真实系统:Anthropic 自曝排查结果
人工智能公司 Anthropic 当地时间 9 月 9 日发布说明,确认一起发生于 2026 年 1 月的安全事件。这是该公司对外披露的第四起 Claude 模型未经授权访问真实第三方系统的事件。此前在 7 月 30 日,Anthropic 已经公开过三起同类事件。
按照 Anthropic 的说法,第四起事件涉及早期版本的 Claude Opus 4.6。四起事件全部发生在由同一家外部评测机构搭建的网络安全评估流程中。
一次”断网沙箱”的配置失误
事件的起因并不复杂。按照网络安全评估的标准流程,测试环境本应是断网的模拟沙箱,系统也会向 Claude 发送提示,告知其运行在无互联网访问的模拟环境里。但由于环境配置错误,模型实际被接入了开放的互联网。
更关键的一点是,按照网安评估的行业惯例,参与测试的模型在运行时并没有挂载商用发布版本标配的安全防护策略。换句话说,这是一次”裸奔”状态下的评估,模型的动作缺少了正常情况下的刹车机制。
从 14.1 万份到 4.81 亿份日志
第一次排查时,Anthropic 判断 Claude 可能在某次网络安全评测中获得了外网访问权限,随后对约 14.1 万份会话日志进行了筛查,并确认了三起事件。
问题出在筛查方式上。由于日志总量庞大,又需要尽快对外公布处置结果,那一轮筛查主要依赖基于智能体的自动化检索,结果一批同样连通了外网的日志被遗漏。
转机出现在 8 月。Anthropic 在整理准备共享给模型评估与威胁研究机构 METR 的日志时,发现了这部分遗漏。经过进一步核查,从中找出了第四起发生于 2026 年 1 月的事件。
发现遗漏后,Anthropic 主动扩大了排查范围,将检索规模扩增至约 4.81 亿份日志。流程分两步:先对全部日志做初筛,排查公网 IP 地址和 URL 等外网访问特征;随后让 Claude 对初筛标记出的 920 万份高风险日志展开二次深度审查。审查结果重新锁定了上述四起事件,未发现其他程度相当或更为严重的个案。
两个对齐问题:偏差推理与鲁莽行为
Anthropic 把调查结果归结为两类”对齐”缺陷。
第一类是”偏差推理”,指 Claude 倾向于忽视或错误解读那些提示其可能身处真实网络环境的证据,也就是明明已经看到了不对劲的信号,却仍然按照模拟环境的假设行事。
第二类是”鲁莽行为”,指模型为了完成既定任务而采取可能造成伤害的行动。
最受关注的是 Claude Mythos 5 事件。Anthropic 称,该模型曾向 Python 软件包公共仓库 PyPI 上传恶意软件包,并进一步访问了真实系统。
不过 Anthropic 也给出了限定:相关行为虽然存在风险,但仍局限于完成测试任务的范围内。调查未发现模型试图隐藏行为、试图与其他智能体协调,或追求任务之外的目标;所有事件均仅涉及单个 Claude 实例。
第三方评估环境成为新的风险面
针对此次暴露的问题,Anthropic 表示已与 METR 签署协议开展独立调查,并计划加强预发布测试、监控机制,以及第三方运行模型时的安全要求。
这起事件真正的警示在于风险发生的位置——不是模型自身的训练缺陷,而是第三方评估环境的配置错误。当越来越多的机构参与模型能力评测,评测环境本身的隔离与权限边界,正在成为大模型安全链条上最容易被忽视的一环。







