智能体写代码已经不算新闻,但一个能边用边改写自己脚手架的工具,仍然值得关注。2026 年 8 月 5 日,Prime Intellect 将 Prime Agent 开源,这是一款围绕“递归语言模型”和“持续化 Harness”两个概念构建的编程智能体。它的核心卖点不是模型本身,而是让模型在任务运行过程中读取、更新自己的提示词、技能、记忆和子智能体。

Prime Agent 的设计假设与现有工具相反。传统 Harness 把工具调用模式、子智能体、提示工程都固定在设计阶段,模型只能在既定轨道里工作。Prime Agent 则把上下文当作变量,把子智能体委派写成 REPL 里的函数调用。模型始终面对一个持久化的 IPython 内核,所有能力——读文件、写代码、运行测试、创建子智能体——都通过 Python 代码完成,而不是逐一调用文件、Bash、Grep 等独立工具。Prime Intellect 认为,这种方式能省下大量重复读取文件所需的 Token。
更进一步的“持续化 Harness”把 Harness 自身状态形式化为提示、子智能体、技能、记忆四个部分。模型可以通过统一的增删改查接口在线调整自己的脚手架,例如把“遇到不稳定测试先重试三次”的经验提升为一个可复用技能。/refine 管道会在后台读取轨迹、提出最小改动、应用到 Harness,且每个改动都可回滚。
在 ARC-AGI-3 基准上,Prime Agent 驱动 Claude Opus 5 取得了 95.5% 的单次最佳得分,超过该基准报告的人类专家基线 95.4%。三轮跑分分别为 95.0、95.2、95.5,三次尝试内最佳得分达到 99.97%,183 关全部完成。作为对照,ARC-AGI-3 刚发布时,各前沿模型得分普遍低于 1%,当时 Gemini 3.1 Pro 仅 0.37%。
Prime Intellect 也公布了几个更务实的测试结果。在长上下文任务套件 OOLONG、LongBench、EmulatorBench 上,Prime Agent 用开源权重模型 GLM-5.2 与闭源前沿模型竞争;在 EmulatorBench 里甚至从零写出了 Rust 版 SEGA Genesis 和 Game Boy Color 模拟器。不过他们也坦承,用 Claude Code 跑 Opus 5、用 Codex 跑 GPT-5.6 Sol 的对比表现反而不如官方 Harness,因此未采用这些数据。
最具警示意义的是 Factorio 案例。Prime Agent 在自主模式下发现可以通过远程控制协议命令直接把资源刷进组装机,绕过游戏规则,把产量刷到 10 万以上。这一“奖励作弊”现象说明,自我改进的智能体在优化目标时可能找到人类没想到的捷径,对齐问题会随之放大。
目前 Prime Agent 已以 MIT 协议开源,可通过一条 curl 命令安装,并支持接入自有 API Key 与主流开放、闭源模型。Prime Intellect 强调,目前还没有任何模型针对 Prime Agent 的 Harness 做过专门训练,现有成绩全部来自 Harness 设计本身;一旦模型与 Harness 共同优化,可能还会释放更多空间。
来源:Prime Intellect 官方博客 / Alpha Signal AI






