<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>NeurIPS &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/neurips/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 30 Aug 2026 16:52:33 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI递归自我改进没那么快：普林斯顿实验显示Agent还不会做研究</title>
		<link>https://mylogs.cn/ai%e9%80%92%e5%bd%92%e8%87%aa%e6%88%91%e6%94%b9%e8%bf%9b%e6%b2%a1%e9%82%a3%e4%b9%88%e5%bf%ab%ef%bc%9a%e6%99%ae%e6%9e%97%e6%96%af%e9%a1%bf%e5%ae%9e%e9%aa%8c%e6%98%be%e7%a4%baagent%e8%bf%98%e4%b8%8d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 30 Aug 2026 16:52:33 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 智能体]]></category>
		<category><![CDATA[AI 研究]]></category>
		<category><![CDATA[NeurIPS]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[普林斯顿]]></category>
		<category><![CDATA[递归自我改进]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai%e9%80%92%e5%bd%92%e8%87%aa%e6%88%91%e6%94%b9%e8%bf%9b%e6%b2%a1%e9%82%a3%e4%b9%88%e5%bf%ab%ef%bc%9a%e6%99%ae%e6%9e%97%e6%96%af%e9%a1%bf%e5%ae%9e%e9%aa%8c%e6%98%be%e7%a4%baagent%e8%bf%98%e4%b8%8d/</guid>

					<description><![CDATA[人工智能行业当下最受关注的承诺之一，是 AI 将在几乎没有人类监督的情况下自我改进。大语言模型已经能够编写代码 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">人工智能行业当下最受关注的承诺之一，是 AI 将在几乎没有人类监督的情况下自我改进。大语言模型已经能够编写代码、生成训练用的合成数据，并优化自身运行的芯片。一些关于 AI 进展将呈爆炸式增长的预测认为，研究者所称的“递归式自我改进”已近在眼前。但一项新研究指出，真正抵达这一节点可能还需要相当长的时间。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a9483d0952d5&quot;}" data-wp-interactive="core/image" data-wp-key="6a9483d0952d5" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/fea90b14cad8677de5fd6772f4c70241_header.webp" alt="AI 智能体从事科研的示意图" class="wp-image-5691" srcset="https://mylogs.cn/wp-content/uploads/2026/08/fea90b14cad8677de5fd6772f4c70241_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14cad8677de5fd6772f4c70241_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14cad8677de5fd6772f4c70241_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14cad8677de5fd6772f4c70241_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：MIT Technology Review</figcaption></figure>

<p class="wp-block-paragraph">这项研究由普林斯顿大学的 Peter Kirgis 与 Sayash Kapoor 等多机构研究者共同完成。他们发现，AI 智能体（agent）已经能够解决从事 AI 研究所必需的工程问题，却缺乏进行判断与创造的开放性思维能力——而这恰恰可能是构建自我改进型 AI 的关键。</p>

<p class="wp-block-paragraph">此前关于智能体自动化 AI 研究的能力评估，大多聚焦于有明确答案的窄任务，例如解决工程问题，或对照基准对小型语言模型进行后期训练。但推进 AI 研究还需要开放性思考：选定一组假设、判断什么证据足以回答一个问题，以及在必要时从头开始。</p>

<p class="wp-block-paragraph">为测试智能体在这类能力上的表现，研究者提出了一种名为“影子评估”（shadow evaluation）的方法：让 AI 回答两篇尚未公开的高质量论文中的研究问题。他们使用 Anthropic 的 Claude Opus 4.8，在名为 OpenClaw 的开源软件上运行，要求智能体在六天时间、3000 美元 Anthropic API 额度、一定 GPU 预算、独立虚拟机与开放网络的条件下，产出一篇达到顶级 AI 会议发表水平的论文。这两篇论文均投稿至知名机器学习会议 NeurIPS 2026，其原作者按会议评审标准对智能体的成果进行了评判。</p>

<p class="wp-block-paragraph">结果显示，智能体具备完成研究所需的所有工程能力：它们查阅文献、运行数百次实验并汇总结果。但两位原作者均拒稿。Kapoor 表示，智能体在真正“做研究”这一环节表现明确地糟糕——它们进行了奇怪的实验（有时用极小的合成数据集检验假设），难以清晰地阐述工作，也没有对所在领域做出新颖贡献。</p>

<p class="wp-block-paragraph">造成这一落差的原因，可能与模型的训练方式有关。Kapoor 指出，模型在强化学习这种可以自动打分的训练机制下，会擅长任何能够被反复量化的任务；而当任务本身是开放性的，就很难构造对应的训练环境。这也解释了为何智能体在工程执行上表现出色，在需要判断的开放研究上进展缓慢。</p>

<p class="wp-block-paragraph">这一发现对行业内关于递归式自我改进的乐观时间表提出了质疑。今年 6 月，Anthropic 发布题为《当 AI 构建自身》的博客，描绘其迈向加速自身研发的进展；7 月，OpenAI 宣传其新模型 GPT-5.6 Sol 参与了更小模型的后期训练，为研究者节省数周工作。Anthropic 联合创始人 Jack Clark 在其 Import AI 通讯中也写道，当前 AI 系统缺乏“有价值的、直觉式的创造力”，更像是按固定套路思考，这对短期内实现递归式自我改进是一个偏空的信号。</p>

<p class="wp-block-paragraph">研究也存在局限：仅覆盖两篇论文，且原作者知道所评审的是 AI 生成的成果，可能影响评判。但结论仍提示，代码量的快速增长并不能直接等同于研究的自动化，更不意味着智能的爆发式跃迁近在咫尺。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
