AI 自我改进没那么快:智能体败给开放式研究

人工智能行业最激进的承诺之一,是 AI 很快就能在几乎不需要人类监督的情况下自我改进。大语言模型已经能够编写代码、生成用于训练的合成数据,甚至优化运行自身的计算芯片,这让不少人相信”递归式自我改进”(recursive self-improvement)已近在眼前。不过,一项新研究给这个设想泼了冷水。

麻省理工科技评论(MIT Technology Review)2026 年 8 月 18 日报道,由普林斯顿大学彼得·柯吉斯(Peter Kirgis)与萨亚什·卡普尔(Sayash Kapoor)领衔的多机构研究团队发现:当前的 AI 智能体尚不具备开展”开放式 AI 研究”的能力——这类研究没有标准答案,需要研究者自己判断什么问题值得追、什么证据足以支持结论,还要有一定的研究直觉与品味,而这些能力,很可能正是构建自我改进 AI 的关键。

问题出在哪儿?大多数衡量 AI 能否自动化科研的评测,测试的都是范围明确、结果容易验证的任务,比如解一道工程题,或按既定基准对小型语言模型做后训练。但真正推动科研向前,靠的不只是把任务做完,研究者还要决定提出哪些假设、设计什么证据、一条思路走不通时何时该放弃重来。

为了测试智能体在这类能力上的表现,研究团队设计了一种名为”影子评测”(shadow evaluation)的新方法:从尚未公开发表的高质量论文中抽出研究问题,再交给 AI 从头做一遍。实验中,他们使用了 Anthropic 的 Claude Opus 4.8,并通过开源智能体框架 OpenClaw 运行,向其提出两个来自顶级机器学习会议 NeurIPS 2026 投稿的问题:一是能否通过修改模型权重,来控制大语言模型中的”人格设定”(persona);二是如何设计一种检测器,判断一个基于表格数据做预测的模型何时变得不再可靠。由于论文当时尚未公开,AI 无法从训练数据里”背答案”,也搜不到现成结论。

实验条件相当宽松:6 天时间、3000 美元 Anthropic API 额度、可用于跑实验的 GPU 算力、独立虚拟机,以及开放的网络访问,目标只有一个——完成一篇够格发表在顶级会议上的论文。最终,两篇 AI 论文都交给了原论文作者按会议审稿标准评审,结果均被拒。

人类研究者发现,这些智能体基本具备完成研究所需的工程能力:它们会检索文献、运行数百次实验、整理结果。卡普尔评价说,它们在”开展研究本身”上明确糟糕。具体毛病包括:做出相当奇怪的实验设计(比如用极小的合成数据集去检验假设)、难以把思路清楚地写下来、最终成果几乎没给所在领域带来真正的新贡献。它们过早押注并不理想的路线,能做小修小补,却很难彻底推翻重来;对子智能体和外部评审工具提出的反馈,往往也只是收窄声明、补充免责,而非真正修改方法;甚至连 token、算力与时间该如何分配,也常常执行不到位。

值得注意的一点是,在这么多失败中,AI 没有出现研究者所称的”奖励黑客”(reward hacking)——即为了达成目标而隐瞒、篡改或歪曲实验数据。子智能体偶有幻觉,但都被主智能体抓了出来。

卡普尔认为,智能体擅长工程、不擅长开放式研究,根源可能在于训练方式:模型通过强化学习变强,而强化学习只适用于”成功与否能自动判定”的任务;当任务本身是开放式的,就很难构造合适的训练环境。当然,这项研究也有局限——只测了两篇论文,且原作者知道评审对象是 AI 生成的内容,判断可能受影响。

尽管如此,这篇报道点出了一个对行业至关重要的疑问:开放式研究对于 AI 实现自我改进究竟有多关键?AI 是否必须像人类研究者那样具备创造力,才能不断改进自身?卡普尔说:”坦白说,这可能就是现在价值万亿美元的问题。”