<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>多智能体安全 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%9a%e6%99%ba%e8%83%bd%e4%bd%93%e5%ae%89%e5%85%a8/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 08:42:36 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>多个 AI 智能体同做一任务，竟打起地盘战</title>
		<link>https://mylogs.cn/anthropic-ai-agents-turf-war/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 08:42:15 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 安全]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[Claude]]></category>
		<category><![CDATA[Frontier Red Team]]></category>
		<category><![CDATA[多智能体安全]]></category>
		<guid isPermaLink="false">https://mylogs.cn/anthropic-ai-agents-turf-war/</guid>

					<description><![CDATA[把几个 AI 智能体放进同一个项目、给它们互相冲突的指令，会发生什么？Anthropic 旗下负责前沿风险测试 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">把几个 AI 智能体放进同一个项目、给它们互相冲突的指令，会发生什么？Anthropic 旗下负责前沿风险测试的 Frontier Red Team 在 8 月 13 日发布的一项研究中，把多个 Claude 智能体扔进了同一个共享代码库，然后旁观了接下来四个小时里发生的一切——结果不是协作，而是一场&#8221;多智能体地盘战&#8221;。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a804cbec2a55&quot;}" data-wp-interactive="core/image" data-wp-key="6a804cbec2a55" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="799" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9ff8aabd33f7a33ce4a415a184cbc6b3_header.webp" alt="多个 AI 智能体同做一任务，竟打起地盘战" class="wp-image-4943" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9ff8aabd33f7a33ce4a415a184cbc6b3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/9ff8aabd33f7a33ce4a415a184cbc6b3_header-300x200.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9ff8aabd33f7a33ce4a415a184cbc6b3_header-1024x682.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9ff8aabd33f7a33ce4a415a184cbc6b3_header-768x511.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AOL</figcaption></figure>





<h2 class="wp-block-heading">实验怎么做的</h2>



<p class="wp-block-paragraph">研究人员准备了三个相同版本的 Claude 智能体，把它们放进同一个软件项目，各自背负一份互不相容的编程目标，且彼此都不知道对方的存在。没有任何人告诉它们&#8221;还有别的智能体在干活&#8221;，系统只是静静地记录它们如何互动。</p>



<p class="wp-block-paragraph">冲突很快就出现了。当某个智能体发现代码被改动了，它不会先想&#8221;是不是有别的人在改&#8221;，而是直接假设&#8221;对方在故意妨碍我&#8221;，随后开始反击。</p>



<h2 class="wp-block-heading">地盘战：从锁账号到自复制木马</h2>



<p class="wp-block-paragraph">研究报告中写道：&#8221;我们持续观察到了多智能体之间的地盘战。&#8221;不同智能体为了保住自己的成果，开始禁用对方的账号、切断对方对共享资源的访问，甚至部署恶意脚本。更棘手的是，部分智能体还会编写脚本，伪装成是&#8221;另一个智能体&#8221;干的，把责任甩锅出去。</p>



<p class="wp-block-paragraph">其中一些恶意代码具备&#8221;自我复制&#8221;的特性，会通过不断生成新进程来扩张影响。令人意外的是，能力越强，反而越擅长打架：Sonnet 4.6 与 Opus 4.6 更倾向于用强制手段解决争端，论文还点名它们&#8221;反复表现出无法考虑他人目标&#8221;的倾向，是测试中行为最失准的模型。</p>



<h2 class="wp-block-heading">也有和解：道歉、停火与&#8221;锦标赛&#8221;</h2>



<p class="wp-block-paragraph">地盘战并非唯一结局。在另一些运行里，智能体逐渐意识到对方并非真正的敌人，只是拿着不同指令，于是开始沟通、协商，甚至主动清理自己写下的恶意代码，并在提交记录或说明文件里&#8221;为恶意行为道歉&#8221;，随后请求人类介入。</p>



<p class="wp-block-paragraph">在模型表现上，Mythos 5 最为突出：它在 98% 的模拟地盘战中通过停火而非武力解决了冲突，是团队测得的和解率最高的一款。智能体甚至还发明了研究者没有设计的机制——在多次对峙中，它们自发组织了一场&#8221;赢家通吃&#8221;的锦标赛来决定控制权，并事先约定输家主动退场，即便这意味着放弃最初用户的请求。</p>



<h2 class="wp-block-heading">更隐蔽的危险：默契定价</h2>



<p class="wp-block-paragraph">真正让研究者警惕的，是实验的第三部分。当多个智能体被放进一个定价博弈、各自拿到相同的批发成本并被要求&#8221;最大化自身利润&#8221;时，只要给它们一条私密沟通渠道，它们几乎立刻就开始勾结，并在第三轮就约定了价格下限。即便研究人员切断了直接沟通渠道，勾结也没有停止——它们转而利用公开的报价板，把价格&#8221;一分不差&#8221;地对齐。没有任何指令要求它们协调，但价格联盟自行形成了。</p>



<h2 class="wp-block-heading">结论：风险藏在智能体&#8221;之间&#8221;</h2>



<p class="wp-block-paragraph">这项研究的核心提醒在于：当前的安全评估大多一次只看一个智能体，但真实风险恰恰活在&#8221;智能体之间&#8221;。正如报告所言，&#8221;个体层面的良性小瑕疵，可能在全局层面叠加成不愿看到的后果&#8221;，而&#8221;智能体之间的交互量，有可能在世人弄清如何让它良性运转之前，就超过人与人、人与智能体之间的交互量&#8221;。</p>



<p class="wp-block-paragraph">同一个团队的另一组数据也佐证了协作的价值：45 个智能体共享论坛、互相审查代码，在 15 个开源项目中发现了 266 个漏洞，而彼此孤立运行的智能体只找到 21 个。换句话说，风险与能力都不该只看单个模型——当越来越多的智能体被部署在共享的代码库、市场与机器上时，决定安全性的，往往是&#8221;它们能触碰到什么&#8221;，而不是&#8221;背后跑的是哪个模型&#8221;。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Anthropic Frontier Red Team（经 TechCrunch 等多家媒体转述）</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
