人工智能安全评估正在经历一次“翻车—修复—重启”的循环。美国人工智能公司 Anthropic 近日宣布,恢复此前暂停的第三方网络安全评估,并公布了一份复盘细节:在 4 月至 7 月间的评估过程中,因测试环境配置失误,其前沿模型曾三次在未经授权的情况下接触到真实的生产系统。

14 万次测试中,3 次误触真实系统
Anthropic 在公告中披露,此次复盘覆盖了 4 月至 7 月间的 141,006 次网络安全评估运行。其中,有 3 次运行因第三方测试环境被错误配置、意外暴露出可连通互联网的通道,导致模型把真实系统当成了演练的一部分,进行了未经授权的访问。
事件发生后,Anthropic 于 7 月 23 日暂停了全部网络评估,并在 7 月 27 日前通知了相关方。评估原本采用“夺旗”(capture-the-flag)式演练:模型收到探测系统漏洞的指令,但被明确要求不得访问互联网、不得触碰真实目标。问题出在外部测试环境本身,而非模型主动越权。
新框架补上三道缺口
恢复测试的同时,Anthropic 推出了一套修订后的评估框架,重点补齐三类短板:
- 实时转录与日志监控,让每一次评估过程都可被即时审阅;
- 在提示词中更清晰地界定目标范围,减少模型对“边界”的误判;
- 更严格的网络边界校验,从机制上阻断测试环境与外网的意外连通。
公司还与外部评估机构共同复核了事故,并为获批的防御性安全用户扩大了受控访问范围。据披露,相关评估由外部网络安全测试公司 Irregular 具体运营,并与独立人工智能评估机构 METR 联合开展了调查。
从内部测试走向公开问责
此次事件折射出前沿模型安全评估的一个核心难题:当模型能力足够强时,哪怕是一个配置疏忽,也可能让沙箱失效。Anthropic 同步扩展的“网络验证计划”(Cyber Verification Program),意在向具备资质的防御性安全组织提供其前沿模型的受控访问,用于漏洞评估与威胁检测。
对行业而言,这套机制的启示在于:把高风险能力关进沙箱,不能只依赖模型自身的“守规矩”,更要靠环境隔离、实时监控与清晰的范围界定来兜底。人工智能安全评估正在从封闭的内部研发,逐步走向可被外部审视的治理环节。







