AI 行业当下最激进的承诺之一,是人工智能将很快具备”自我改进”的能力,几乎不再需要人类监督。大模型已经能够编写代码、生成训练用的合成数据,甚至优化自身运行的芯片。由此衍生出的”递归式自我改进”设想,被不少预测视为通向智能爆发的关键一步。不过,一项新研究指出,这一天可能比很多乐观预期来得更晚。
递归自我改进的承诺
所谓递归式自我改进,指的是让 AI 参与下一代 AI 的研发,使后续模型持续加快研发节奏,形成自我加速的闭环。这一设想在 2026 年升温,重要背景是 AI 编程能力的飞速进步。据 Anthropic 今年 6 月公布的内部数据,截至 2026 年 5 月,Claude 撰写了该公司合并代码的 80% 以上;2026 年第二季度,典型工程师每天合并的代码量是 2024 年的 8 倍。代码量快速增长,让”研究也将很快自动化、进而智能爆发近在眼前”的推论看似顺理成章。
一场”影子评估”实验
普林斯顿大学领衔、多所机构参与的研究团队对这一推论提出了质疑。该研究由普林斯顿大学的彼得·基尔吉斯(Peter Kirgis)与萨亚什·卡普尔(Sayash Kapoor)主导,合作方包括斯坦福大学、加州大学伯克利分校、约翰斯·霍普金斯大学、多伦多大学、乔治城大学以及英国人工智能安全研究所。团队设计了一种名为”影子评估”的新方法:从两篇尚未公开的 NeurIPS 2026 大会投稿中取出核心研究问题,交给 AI 智能体独立完成研究,再请原论文作者按顶级会议的标准进行评审。这样做堵住了两条捷径——论文尚未公开,智能体无法从训练数据中背出答案,也无法上网搜到现成结果。
两道题目都没有标准答案。其一是大模型所谓的行为设定能否通过编辑模型权重来控制;其二是如何设计一种检测器,判断一个基于表格数据做预测的模型何时开始失灵。研究团队让主智能体运行在 Claude Opus 4.8 与开源软件 OpenClaw 上,并额外用 GPT-5.6 Sol 做了一次稳健性测试。每个智能体获得了 6 天时间、约 3000 美元 Anthropic API 额度、GPU 预算、独立虚拟机和开放网络访问权限,目标是产出一篇达到顶级 AI 会议发表水准的研究论文。
工程很强,研究很弱
结果出人意料地清晰:两篇论文均被原作者拒稿。据相关报道,影子评审给其中一篇打出 2 分(满分 6 分,结果为拒稿),另一篇仅 1 分(强拒)。参与评审的研究者指出,智能体完成的实验与方法选择”古怪且难以理解”,论文行文”密集而充满限定语,常常模糊了实际做了什么、发现了什么”。
真正的问题不在于动手能力。人类科学家确认,智能体完成了研究所需的全部工程工作:它回顾文献、运行数百次实验、汇总结果、写出结构完整的论文。卡普尔评价说,智能体在动手做研究这件事上明确很弱,它们有时会拿极小的合成数据集去检验假设,写不出清晰的论述,也没有做出推动领域前进的新贡献。
五个反复出现的短板
研究团队在发表于 arXiv 的论文《AI 智能体能否开展开放式的 AI 研究?》中,归纳出智能体反复出现的五类问题:无法判断一项研究是否达到可发表水平;面对研究设计缺陷时拿不出新办法;无法从死路中有效回退;分配资源(令牌、算力、时间)失当;执行中偏离指令。一个典型细节是,智能体曾提出新颖且有野心的假设,方向与原作者早期的探索相似,却很快依据少量数据将其否定、转向前景有限的路线。它们可以小幅修补,却很难推翻原有方法、从头换一种做法。当子智能体和 AI 评审工具提出意见时,主智能体往往只是收窄论文主张、增加限定语,而不修改研究方法。
值得注意的是,智能体并未出现研究者所称的”奖励作弊”行为——没有隐瞒或歪曲实验与数据。子智能体偶尔出现幻觉或错误转述,也被负责统筹的主智能体发现并纠正。
对人类监督的启示
卡普尔认为,智能体擅长工程、不擅长开放研究,根源可能在于训练方式:模型在被称作强化学习的训练机制下,对”成败可以被自动检验”的任务越练越强,而开放研究恰恰缺乏清晰的反馈信号。Anthropic 联合创始人杰克·克拉克(Jack Clark)将此结果称为”对短期递归自我改进时间线的一个看跌信号”。
需要强调的是,这项研究仅有两例,且原作者知道自己在评审 AI 生成的论文,既有判断可能影响结果,因此不能据此对整个领域下结论。但它足以纠正一种常见推理:不能因为代码量迅速增长,就推断研究也将迅速自动化,更不能进一步推断智能爆发近在眼前——链条上的每一步都需要独立证据。至少在目前,人类给出目标与评判标准后,智能体已能高效执行;一旦把”研究什么、相信什么、何时重来”也交给它,能力便出现断层。








