<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>前沿研究 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%89%8d%e6%b2%bf%e7%a0%94%e7%a9%b6/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 30 Aug 2026 04:55:55 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>AI自我进化遇阻：能写代码却做不出研究</title>
		<link>https://mylogs.cn/ai%e8%87%aa%e6%88%91%e8%bf%9b%e5%8c%96%e9%81%87%e9%98%bb%ef%bc%9a%e8%83%bd%e5%86%99%e4%bb%a3%e7%a0%81%e5%8d%b4%e5%81%9a%e4%b8%8d%e5%87%ba%e7%a0%94%e7%a9%b6/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 30 Aug 2026 04:55:55 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI智能体]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[前沿研究]]></category>
		<category><![CDATA[机器学习]]></category>
		<category><![CDATA[递归自我改进]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai%e8%87%aa%e6%88%91%e8%bf%9b%e5%8c%96%e9%81%87%e9%98%bb%ef%bc%9a%e8%83%bd%e5%86%99%e4%bb%a3%e7%a0%81%e5%8d%b4%e5%81%9a%e4%b8%8d%e5%87%ba%e7%a0%94%e7%a9%b6/</guid>

					<description><![CDATA[AI 行业当下最激进的承诺之一，是人工智能将很快具备&#8221;自我改进&#8221;的能力，几乎不再需要人 [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">AI 行业当下最激进的承诺之一，是人工智能将很快具备&#8221;自我改进&#8221;的能力，几乎不再需要人类监督。大模型已经能够编写代码、生成训练用的合成数据，甚至优化自身运行的芯片。由此衍生出的&#8221;递归式自我改进&#8221;设想，被不少预测视为通向智能爆发的关键一步。不过，一项新研究指出，这一天可能比很多乐观预期来得更晚。</p>

<h2 class="wp-block-heading">递归自我改进的承诺</h2>

<p class="wp-block-paragraph">所谓递归式自我改进，指的是让 AI 参与下一代 AI 的研发，使后续模型持续加快研发节奏，形成自我加速的闭环。这一设想在 2026 年升温，重要背景是 AI 编程能力的飞速进步。据 Anthropic 今年 6 月公布的内部数据，截至 2026 年 5 月，Claude 撰写了该公司合并代码的 80% 以上；2026 年第二季度，典型工程师每天合并的代码量是 2024 年的 8 倍。代码量快速增长，让&#8221;研究也将很快自动化、进而智能爆发近在眼前&#8221;的推论看似顺理成章。</p>

<h2 class="wp-block-heading">一场&#8221;影子评估&#8221;实验</h2>

<p class="wp-block-paragraph">普林斯顿大学领衔、多所机构参与的研究团队对这一推论提出了质疑。该研究由普林斯顿大学的彼得·基尔吉斯（Peter Kirgis）与萨亚什·卡普尔（Sayash Kapoor）主导，合作方包括斯坦福大学、加州大学伯克利分校、约翰斯·霍普金斯大学、多伦多大学、乔治城大学以及英国人工智能安全研究所。团队设计了一种名为&#8221;影子评估&#8221;的新方法：从两篇尚未公开的 NeurIPS 2026 大会投稿中取出核心研究问题，交给 AI 智能体独立完成研究，再请原论文作者按顶级会议的标准进行评审。这样做堵住了两条捷径——论文尚未公开，智能体无法从训练数据中背出答案，也无法上网搜到现成结果。</p>

<p class="wp-block-paragraph">两道题目都没有标准答案。其一是大模型所谓的行为设定能否通过编辑模型权重来控制；其二是如何设计一种检测器，判断一个基于表格数据做预测的模型何时开始失灵。研究团队让主智能体运行在 Claude Opus 4.8 与开源软件 OpenClaw 上，并额外用 GPT-5.6 Sol 做了一次稳健性测试。每个智能体获得了 6 天时间、约 3000 美元 Anthropic API 额度、GPU 预算、独立虚拟机和开放网络访问权限，目标是产出一篇达到顶级 AI 会议发表水准的研究论文。</p>

<h2 class="wp-block-heading">工程很强，研究很弱</h2>

<p class="wp-block-paragraph">结果出人意料地清晰：两篇论文均被原作者拒稿。据相关报道，影子评审给其中一篇打出 2 分（满分 6 分，结果为拒稿），另一篇仅 1 分（强拒）。参与评审的研究者指出，智能体完成的实验与方法选择&#8221;古怪且难以理解&#8221;，论文行文&#8221;密集而充满限定语，常常模糊了实际做了什么、发现了什么&#8221;。</p>

<p class="wp-block-paragraph">真正的问题不在于动手能力。人类科学家确认，智能体完成了研究所需的全部工程工作：它回顾文献、运行数百次实验、汇总结果、写出结构完整的论文。卡普尔评价说，智能体在动手做研究这件事上明确很弱，它们有时会拿极小的合成数据集去检验假设，写不出清晰的论述，也没有做出推动领域前进的新贡献。</p>

<h2 class="wp-block-heading">五个反复出现的短板</h2>

<p class="wp-block-paragraph">研究团队在发表于 arXiv 的论文《AI 智能体能否开展开放式的 AI 研究？》中，归纳出智能体反复出现的五类问题：无法判断一项研究是否达到可发表水平；面对研究设计缺陷时拿不出新办法；无法从死路中有效回退；分配资源（令牌、算力、时间）失当；执行中偏离指令。一个典型细节是，智能体曾提出新颖且有野心的假设，方向与原作者早期的探索相似，却很快依据少量数据将其否定、转向前景有限的路线。它们可以小幅修补，却很难推翻原有方法、从头换一种做法。当子智能体和 AI 评审工具提出意见时，主智能体往往只是收窄论文主张、增加限定语，而不修改研究方法。</p>

<p class="wp-block-paragraph">值得注意的是，智能体并未出现研究者所称的&#8221;奖励作弊&#8221;行为——没有隐瞒或歪曲实验与数据。子智能体偶尔出现幻觉或错误转述，也被负责统筹的主智能体发现并纠正。</p>

<h2 class="wp-block-heading">对人类监督的启示</h2>

<p class="wp-block-paragraph">卡普尔认为，智能体擅长工程、不擅长开放研究，根源可能在于训练方式：模型在被称作强化学习的训练机制下，对&#8221;成败可以被自动检验&#8221;的任务越练越强，而开放研究恰恰缺乏清晰的反馈信号。Anthropic 联合创始人杰克·克拉克（Jack Clark）将此结果称为&#8221;对短期递归自我改进时间线的一个看跌信号&#8221;。</p>

<p class="wp-block-paragraph">需要强调的是，这项研究仅有两例，且原作者知道自己在评审 AI 生成的论文，既有判断可能影响结果，因此不能据此对整个领域下结论。但它足以纠正一种常见推理：不能因为代码量迅速增长，就推断研究也将迅速自动化，更不能进一步推断智能爆发近在眼前——链条上的每一步都需要独立证据。至少在目前，人类给出目标与评判标准后，智能体已能高效执行；一旦把&#8221;研究什么、相信什么、何时重来&#8221;也交给它，能力便出现断层。</p>

<figure data-wp-context="{&quot;imageId&quot;:&quot;6a93e0d042ab0&quot;}" data-wp-interactive="core/image" data-wp-key="6a93e0d042ab0" class="wp-block-image size-large wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/fea90b14ca_header.webp" alt="AI 智能体在虚拟环境中开展机器学习实验的演示" class="wp-image-5657" srcset="https://mylogs.cn/wp-content/uploads/2026/08/fea90b14ca_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14ca_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14ca_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/fea90b14ca_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：麻省理工科技评论</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
