人工智能实验室 Anthropic 于当地时间 9 月 19 日宣布,将与咨询与专业服务公司埃森哲(Accenture)展开合作,对其前沿人工智能模型开展独立评估。两家企业承诺,未来五年各自至少投入 10 亿美元(按当前汇率约合 67.18 亿元人民币),用于搭建支撑这项工作的配套能力。

这一合作出台的背景,是 AI 研发企业正承受来自监管机构、同业与研究人员越来越大的压力,各方都要求企业证明高级模型具备安全性与可靠性。近期已发生数起 AI 智能体突破隔离运行环境的事件,引发担忧:未来人工智能或许能在人类少量介入下自我迭代,使行为更难被监控与管控。
当地时间 9 月 20 日,Anthropic 首席执行官达里奥·阿莫代伊(Dario Amodei)公开呼吁各家 AI 企业放缓前沿模型的开发节奏,同时向独立评估人员开放更大程度的系统访问权限。竞争对手 OpenAI 也已表态,将定期发布报告披露模型的异常或值得警惕的行为,并一次性对外公布了六份相关事件报告。
具体执行上,埃森哲旗下专门的 AI 业务部门 Faculty 将主导本次合作,对 Anthropic 模型开展评估与红蓝对抗测试,完成对齐效果评估,并检验各项安全防护机制。双方资金将用于 Anthropic 所称的”驻场评估”(embedded evaluation)模式:独立评估人员进驻 AI 企业内部,所获系统访问权限与普通员工基本相当。Anthropic 表示,依托这一视角,评估人员可以考察企业实际运营、核实安全承诺是否兑现,并发现企业自身未意识到的安全盲区。
公告还提到,评估人员可上报各类安全事件,向公众提供更详实的分析,阐明 AI 带来的收益与潜在风险。Anthropic 与埃森哲后续还计划联合更多评估机构与 AI 厂商,以类似模式继续推进相关工作。







