OpenAI 于 2026 年 9 月 10 日将 Agents API 开放给所有开发者公开测试。这套 API 把驱动 Codex 与 ChatGPT for Work 的同一套智能体编排框架(harness)包装成一个托管服务:开发者不再需要自己手写”保活会话、压缩上下文、崩溃后恢复”这三段重复脚手架,只需一次调用,就能让 OpenAI 跑起这个循环。这标志着 OpenAI 从”卖模型”进一步走向”卖智能体运行时”。

它到底是什么
Agents API 通过 OpenAI 托管的接口,向应用提供 Codex 的 harness。在 OpenAI 自己的表述里,它负责管理工作会话、编排、上下文压缩与恢复,而应用只需提供工具,并选择智能体在哪里执行。文档定义了四个核心对象:
– agent(智能体):打包模型、指令、工具与 MCP 服务器; – environment(环境):可选沙箱,智能体在其中访问文件、加载技能、运行命令; – session(会话):一个持久实例,跨任务持续工作并响应输入; – events / items(事件与条目):发送的输入与产出的输出。
其中”持久(durable)”一词最关键:一个 session 被设计为可存活,OpenAI 称基础设施能让智能体可靠运行数天。
托管框架替你干的活
公开测试版中,有四个能力直接对应着各团队过去手工维护的代码:
– 上下文压缩(context compaction):会话接近上下文上限时自动压缩早期内容,保留智能体继续所需的信息,工作流可跨多个上下文窗口运行,无需自建摘要逻辑。 – 工具搜索(tool search):不再把每个工具定义都塞进提示词,而是按需加载相关定义,降低 Token 消耗、保护模型缓存。 – 程序化工具调用:智能体可并行运行调用、链式串联相关操作、在代码中过滤或合并结果。 – 子智能体(subagents):以多智能体模式把任务拆成独立片段,并行委托给各自持有独立上下文的子智能体,由主智能体协调并合并结果。配置只需两行:
"agent": {
"model": "gpt-6-astra",
"multi_agent": { "enabled": true, "max_concurrent_subagents": 3 }
}
智能体跑在哪里
执行位置留给开发者选择,共有三种:OpenAI 托管的沙箱、自有基础设施、或合作方沙箱。OpenAI 公布了九家首发合作方:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop 与 Vercel。托管沙箱运行在与 Codex、ChatGPT 相同的隔离架构之上,可配置文件、包、技能与插件;自有与合作伙伴路线则用于那些通常会劝退托管服务的场景——自有 VPC 内部署、特定密钥存储,或特定的 CPU、GPU、内存配置。
怎么收费
OpenAI 在公告中称使用 Agents API”没有额外费用”,严格意义上确实没有名为”Agents API”的账单条目。但文档更精确:模型用量按所选模型的 API 费率计费,OpenAI 工具按标准费率计费,OpenAI 托管的沙箱按标准容器费率计费。由于持久智能体是一个保持温热的容器,在围绕长寿命会话做架构设计前,值得先了解这些容器费率。
早期客户数据
OpenAI 公布了若干早期客户说法作为佐证,应作为方向性参考而非基准:
– Ciridae 的 CTO 称其评测分数从 0.71 升至 0.85,子智能体流程带来约 4 倍延迟下降; – SafetyKit 在将案例审查流程迁移后,单案例成本下降 60%; – Hypha 称把 harness 与沙箱分离后,失败的智能体响应减少 86%。
这些数字的形状,与并行委托本应对墙上时钟时间产生的作用一致。
值得注意的取舍
公开测试期内,数据处理仍留在美国境内,且即便在自托管沙箱上也不支持零数据保留。更重要的权衡是依赖关系:采用 Agents API,意味着把应用的编排层锁定在 OpenAI 的实现上,并随 OpenAI 的模型发布进行版本对齐,而不是独立拥有这一层。对于差异化在于工具、数据与工作流、而非智能体循环本身的团队,这笔交易相当直接;而旨在跨多家模型供应商工作的智能体平台,更可能把 GitHub 上开源的 Codex harness 而非这套托管 API,视为更相关的采纳对象。
结语
框架如 LangGraph、CrewAI 帮助开发者拼出智能体管线,但让长寿命智能体在生产中稳定存活的运维负担,过去一直由各个团队自行承担。Agents API 把这块负担收归托管,是”模型供给”向”智能体运行时”延伸的明确一步,也与 Anthropic、Google 的 agent 框架形成正面竞争。







