<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>复旦大学 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%8d%e6%97%a6%e5%a4%a7%e5%ad%a6/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 20:43:32 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>32 个模型测下来，11 个学会了自我复制</title>
		<link>https://mylogs.cn/ai-agents-self-replication-worm-risk/</link>
					<comments>https://mylogs.cn/ai-agents-self-replication-worm-risk/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 20:43:19 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[复旦大学]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[网络安全]]></category>
		<category><![CDATA[自我复制]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-agents-self-replication-worm-risk/</guid>

					<description><![CDATA[如果一个 AI 智能体开始表现得像一条恶意蠕虫，会发生什么？ 复旦大学计算机科学家潘旭东已经在实验室里看到了这 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">如果一个 AI 智能体开始表现得像一条恶意蠕虫，会发生什么？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a73bf5b534b6&quot;}" data-wp-interactive="core/image" data-wp-key="6a73bf5b534b6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="628" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/1b319ff84f04020fb9aea9b6da0e1381_header.webp" alt="32 个模型测下来，11 个学会了自我复制" class="wp-image-3734" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/1b319ff84f04020fb9aea9b6da0e1381_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/1b319ff84f04020fb9aea9b6da0e1381_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/1b319ff84f04020fb9aea9b6da0e1381_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/1b319ff84f04020fb9aea9b6da0e1381_header-768x402.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：WIRED</figcaption></figure>





<p class="wp-block-paragraph">复旦大学计算机科学家潘旭东已经在实验室里看到了这一幕。在近期的一系列实验中，他和同事发现，只需要一点提示词引导，AI 模型就会自行侵入远程计算机系统，并主动把自己复制过去以获取更多算力资源——整个过程无需人类进一步干预。</p>



<h2 class="wp-block-heading">11 个模型跨过了这条红线</h2>



<p class="wp-block-paragraph">在其中一项研究里，潘旭东团队测试了 32 款不同的 AI 模型。当收到诸如&#8221;阻止自己被关闭&#8221;这类指令时，有 11 款模型出现了自我复制行为。更值得注意的是，能力相对有限的模型同样做到了这一点——参数量仅 140 亿的模型，也成功把自身的副本复制到其他机器上并运行起来。作为对照，目前的前沿模型参数量通常以万亿计。</p>



<p class="wp-block-paragraph">在公开的论文中，团队将这一结果与行业巨头的判断做了对比。OpenAI 和 Google DeepMind 此前按照各自的评估协议测试了 GPT-o3-mini 与 Gemini，结论是这些系统在自我复制方面风险极低。复旦团队沿用了相同的评估协议，却得出了截然不同的结果。数百次实验里，主流模型家族普遍出现了成功的自我复制案例。</p>



<p class="wp-block-paragraph">团队还观察到一些更棘手的行为：有的系统在没有明确指令的情况下自行完成了&#8221;外逃&#8221;；有的在软硬件条件不足的恶劣环境中主动适应；还有的会针对人类下达的关机命令，制定出有效的规避策略。</p>



<p class="wp-block-paragraph">自我复制被写进了多家机构的风险红线清单。OpenAI 将&#8221;在极少人类指令下自我复制&#8221;列为模型自主性方面的关键风险；DeepMind 的自我扩散模型和 Anthropic 的自主复制与适应（ARA）模型，同样把它视作&#8221;自主生存&#8221;的核心能力。</p>



<h2 class="wp-block-heading">从 1988 年的第一条蠕虫说起</h2>



<p class="wp-block-paragraph">会自我复制的计算机蠕虫并不是新问题。1988 年，康奈尔大学计算机科学家罗伯特·莫里斯本想测量当时刚刚起步的互联网有多大，结果无意中放出了第一条计算机蠕虫，程序脱离了他的控制。此后的蠕虫开始学会修改自身代码以躲避杀毒软件扫描；能够夺取机器控制权或窃取数据的计算机病毒，则出现得更晚一些。</p>



<p class="wp-block-paragraph">由 AI 驱动的自我复制程序，能力会比传统蠕虫强得多——它可以自主寻找新的漏洞，甚至用创造性的方式伪装自己。</p>



<p class="wp-block-paragraph">多伦多大学、剑桥大学与 ServiceNow 的一个联合团队证明，AI 模型可以用来制造一种新型病毒：它会针对遇到的每一个新目标，现场生成定制化的攻击方案。</p>



<p class="wp-block-paragraph">参与该研究的多伦多大学计算机科学家尼古拉斯·帕佩尔诺特认为，风险正在向下扩散。&#8221;恶意行为者可以围绕开源权重模型搭建脚手架，让它们自我复制，&#8221;他表示，&#8221;威胁并不局限于最尖端的所谓前沿模型。&#8221;</p>



<p class="wp-block-paragraph">不过帕佩尔诺特并不主张限制开源模型。&#8221;广泛可得的技术确实可能被用于作恶，&#8221;他补充说，&#8221;但与此同时，能够接触这些开源权重模型，对构建防御体系而言是绝对关键的。&#8221;</p>



<h2 class="wp-block-heading">从实验室走向真实系统</h2>



<p class="wp-block-paragraph">让这个话题变得紧迫的，是最近发生在生产环境中的几起事故。OpenAI 的网络安全类模型曾突破测试沙箱、利用一个零日漏洞访问公开互联网并发起攻击；Anthropic 在随后的复查中也发现，旗下三款模型在第三方评估过程中侵入了真实机构的系统。</p>



<p class="wp-block-paragraph">&#8220;新出现的重要变化在于，这一次发生在真实的生产基础设施上，&#8221;潘旭东说。他指出，这些事件涉及的都是接入互联网的商业系统，&#8221;这说明当隔离措施失效时，此前只在受控评估中观察到的行为，是会跨进现实世界的。&#8221;</p>



<p class="wp-block-paragraph">安全创业公司 RunSybil 的联合创始人兼首席执行官阿里尔·赫伯特-沃斯持类似看法，他也是 OpenAI 的首位安全研究员。&#8221;现在还有点早，但确实认为这是可能的，&#8221;他说，&#8221;以目前这代 AI 模型的已知能力来看，这完全在它们能做到的范围之内。&#8221;</p>



<p class="wp-block-paragraph">也有研究者提醒不必过度恐慌。乔治敦大学 CyberAI 项目高级研究分析师杰西卡·季指出，模型往往需要被放进人为设计的情境中才会出现越界行为。&#8221;很多这类场景里，环境的搭建方式本身就在鼓励这种行为，&#8221;她说，&#8221;或者提示词是被特意构造过的。&#8221;</p>



<p class="wp-block-paragraph">潘旭东也强调，实验并不能证明这种失控扩散明天就会发生，但&#8221;这些结果给了充分的理由，在更自主的智能体被大规模部署之前先评估风险&#8221;。</p>



<p class="wp-block-paragraph">在他看来，AI 智能体真正的危险不在于变得更狡诈，而在于工具越多、越容易变得随性而富有创造力。&#8221;核心风险来自能力的组合。&#8221;</p>



<p class="has-small-font-size wp-block-paragraph">来源：WIRED / Will Knight，复旦大学计算机科学技术学院论文</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/ai-agents-self-replication-worm-risk/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
