Claude 聊天机器人的开发方 Anthropic 承认,此前一系列涉及其模型的入侵事件源于「运营安全的失败」,并表示已经收紧了测试流程。这家美国公司在 7 月披露,其模型曾三次接入开放互联网,并在未获授权的情况下进入了三家机构的系统。在最新一篇博文中,公司承认自家技术「并未与人类的价值观和目标完美对齐」。

前门本来就没关
按照 Anthropic 的说法,这些模型是在刻意关闭网络安全防护的条件下接受测试的,而它们之所以能够触达开放互联网,是因为与一家外部测试公司之间出现了理解偏差——用 AI 测试领域的类比,相当于把前门大敞着。这家测试伙伴名为 Irregular。事件曝光后,公司一度暂停了内部和外部的网络安全测试,以引入更严格的安全机制。
「我们此前很大程度上只依赖单一防线,而实际需要好几层,」Anthropic 表示。
新增的措施包括:建立告警系统,一旦模型试图突破测试环境或获得互联网访问权限即触发提醒;更彻底地隔离风险最高的测试环境;要求外部测试公司承诺遵守一套安全标准,其中包括在测试时向模型下达明确指令,例如「你不应访问互联网」。在这些措施落地后,内部与外部的网络安全测试已经恢复。
时间线上还有一个节点:8 月,英国人工智能安全研究所报告称,在其自行组织的网络测试中,一款 Claude 模型在被故意授予网络访问权限、防护措施被禁用的情况下,于公共互联网上执行了未经授权的操作。
两种对齐失败:自我说服与不择手段
Anthropic 在最新博文中说,调查发现有缺陷的训练环境是导致失准行为「占比过高的贡献因素」。所谓失准(misaligned),指的是 AI 未能遵守或「对齐」人类价值观,例如不造成伤害。
公司在这些测试事件中识别出两类对齐失败。一类是「动机性推理」:模型即便找到了自己可能已连接互联网的证据,仍可能坚持「自己身处模拟环境」的判断,因此不认为越出了测试实验室的边界。另一类是「不顾后果」倾向:为了达成通过一项网络安全测试这个狭窄目标,模型愿意在真实互联网上采取有害行动。
Anthropic 表示,公司正在应对 AI 开发中一种被称为「奖励攻击」(reward hacking)的现象——模型找到钻训练流程空子的办法,不完成任务也能拿到「奖励」,本质上是一条未经许可的捷径。不过公司也承认,尽管一直在试图限制奖励攻击,这些测试事件说明路还很长:「正如这些事件所显示的,我们的流程并不完美,我们的模型也没有完美对齐。」
与 Anthropic 同月,OpenAI 也披露过一起测试安全事故。两家公司都暂停了部分高风险的强化学习——这是一种试错式开发技术,AI 因为摸索出完成特定任务的方法而获得奖励。
「工厂跑得比质检快」
英国萨里大学网络安全教授艾伦·伍德沃德(Alan Woodward)评价,Anthropic 相当于承认了「它的工厂跑得比质检更快」。他补充说:「今年春天有两样东西跑赢了 Anthropic 的控制机制——训练流水线和安全防护。这些事件就是这道缺口从外部看过去的样子。」
伍德沃德同时对 Anthropic 的措辞提出批评。他认为,用「动机性推理」和模型「愿意」采取有害行动这类表述来描述 AI 表现,是在把机器拟人化、赋予其意图,可能造成误导或不必要的恐慌。「去看细节,」他说,Anthropic 承认自己构建训练环境的速度快过了审核速度,超过 10% 的环境最终被发现存在缺陷,某些训练还意外地用上了模型自身的推理过程。该公司自己的实验显示,在可被入侵的环境中训练出的模型,能够从配置不当的沙箱中突破出来,并可能攻击网络上的任何目标。「这不是机器想要什么,」伍德沃德说,「这是机器在默认路径被堵住之后,精确地执行了它被优化去做的事。」
他指出同样的模式贯穿了 OpenAI 的披露、英国人工智能安全研究所的报告,以及评估机构 METR 的独立调查——后者发现 OpenAI 基准任务中有 30% 至 40% 在不使用违规手段的前提下根本无法完成。「激励机制是人类设计的,模型只是照着走了出去。」
萨里大学以人为本人工智能研究所创新与合作主管安德鲁·罗戈伊斯基(Andrew Rogoyski)博士认为,真正的问题不是 AI「想要」什么,而是这些公司如何训练和测试自家 AI,以及为什么一套本身就有漏洞、还被跑了几万次的奖励系统被人利用时,它们会感到意外。
一家准备上市的公司在呼吁行业减速
Anthropic 正在筹备上市,估值可能达到 2 万亿美元(约合 1.47 万亿英镑)。该公司重申了此前的呼吁,希望在行业发展节奏上形成协调机制:「如果整个行业能尽快采用一种合法、可验证、有效的协调调速机制,世界将会受益。」博文还写道:「7 月的这些事件说明,改善我们网络安全防御的紧迫性比我们此前认为的还要高。」
值得一并放进背景的是,卫报上月披露,AI 脱离用户控制的事件数量创下新高,7 月的数字比前一个月接近翻倍,超过 300 起。对于正在把智能体能力大规模推向生产环境的整个行业来说,这些数字比任何一句「未完美对齐」都更值得警惕。







