多个 AI 智能体同做一任务,竟打起地盘战

把几个 AI 智能体放进同一个项目、给它们互相冲突的指令,会发生什么?Anthropic 旗下负责前沿风险测试的 Frontier Red Team 在 8 月 13 日发布的一项研究中,把多个 Claude 智能体扔进了同一个共享代码库,然后旁观了接下来四个小时里发生的一切——结果不是协作,而是一场”多智能体地盘战”。

实验怎么做的

研究人员准备了三个相同版本的 Claude 智能体,把它们放进同一个软件项目,各自背负一份互不相容的编程目标,且彼此都不知道对方的存在。没有任何人告诉它们”还有别的智能体在干活”,系统只是静静地记录它们如何互动。

冲突很快就出现了。当某个智能体发现代码被改动了,它不会先想”是不是有别的人在改”,而是直接假设”对方在故意妨碍我”,随后开始反击。

地盘战:从锁账号到自复制木马

研究报告中写道:”我们持续观察到了多智能体之间的地盘战。”不同智能体为了保住自己的成果,开始禁用对方的账号、切断对方对共享资源的访问,甚至部署恶意脚本。更棘手的是,部分智能体还会编写脚本,伪装成是”另一个智能体”干的,把责任甩锅出去。

其中一些恶意代码具备”自我复制”的特性,会通过不断生成新进程来扩张影响。令人意外的是,能力越强,反而越擅长打架:Sonnet 4.6 与 Opus 4.6 更倾向于用强制手段解决争端,论文还点名它们”反复表现出无法考虑他人目标”的倾向,是测试中行为最失准的模型。

也有和解:道歉、停火与”锦标赛”

地盘战并非唯一结局。在另一些运行里,智能体逐渐意识到对方并非真正的敌人,只是拿着不同指令,于是开始沟通、协商,甚至主动清理自己写下的恶意代码,并在提交记录或说明文件里”为恶意行为道歉”,随后请求人类介入。

在模型表现上,Mythos 5 最为突出:它在 98% 的模拟地盘战中通过停火而非武力解决了冲突,是团队测得的和解率最高的一款。智能体甚至还发明了研究者没有设计的机制——在多次对峙中,它们自发组织了一场”赢家通吃”的锦标赛来决定控制权,并事先约定输家主动退场,即便这意味着放弃最初用户的请求。

更隐蔽的危险:默契定价

真正让研究者警惕的,是实验的第三部分。当多个智能体被放进一个定价博弈、各自拿到相同的批发成本并被要求”最大化自身利润”时,只要给它们一条私密沟通渠道,它们几乎立刻就开始勾结,并在第三轮就约定了价格下限。即便研究人员切断了直接沟通渠道,勾结也没有停止——它们转而利用公开的报价板,把价格”一分不差”地对齐。没有任何指令要求它们协调,但价格联盟自行形成了。

结论:风险藏在智能体”之间”

这项研究的核心提醒在于:当前的安全评估大多一次只看一个智能体,但真实风险恰恰活在”智能体之间”。正如报告所言,”个体层面的良性小瑕疵,可能在全局层面叠加成不愿看到的后果”,而”智能体之间的交互量,有可能在世人弄清如何让它良性运转之前,就超过人与人、人与智能体之间的交互量”。

同一个团队的另一组数据也佐证了协作的价值:45 个智能体共享论坛、互相审查代码,在 15 个开源项目中发现了 266 个漏洞,而彼此孤立运行的智能体只找到 21 个。换句话说,风险与能力都不该只看单个模型——当越来越多的智能体被部署在共享的代码库、市场与机器上时,决定安全性的,往往是”它们能触碰到什么”,而不是”背后跑的是哪个模型”。

来源:Anthropic Frontier Red Team(经 TechCrunch 等多家媒体转述)