OpenAI Decisions API:150毫秒完成实时决策

OpenAI 在 2026 开发者日活动上推出了一款名为 Decisions API 的全新接口。它面向实时、低延迟的分类与路由场景,约 150 毫秒即可返回结果,比通过常规 API 调用小型模型 Luna 快约 10 倍,把大模型的能力从”对话”推进到了”实时决策”。

把”智能”压缩成结构化决策

Decisions API 为”快速单次决策”而设计。它把模型(当前基于 OpenAI 小型模型 Luna)的智能,聚焦到一组用户预先定义的问题与有限答案集合上,以极低延迟返回结构化的决策结果。

开发者向接口提供上下文(文本或图片),并预先定义好”问题 + 可选答案”,接口随后返回选中的答案及置信度等结构化信息,供后续业务逻辑直接使用。在同类方案中,目前主要对标的是 TypeSafe 的 Jev,二者都专注于将模型智能转化为快速决策。

典型落地场景

在客服与工单系统中,Decisions API 可根据用户描述自动判定问题类型、优先级以及应分配的团队。在内容审核与策略选择上,它能从几个预定义策略(例如允许、限流、人工复审)中快速做出选择。

在多步工作流里,它可作为 Agent 编排中的”决策节点”——决定下一步调用哪个工具或子 Agent,而不是让大模型自由发挥。在已有规则引擎之上,它也能处理模糊地带,在有限选项内给出建议决策,再由规则引擎做最终裁定。

低延迟背后的工程取舍

常规大模型调用往往需要在完整推理链路中生成自然语言,延迟与成本都偏高。Decisions API 的思路是把任务收窄:答案空间由开发者预先限定,模型只需在有限集合内给出最优解并附带置信度,因此可以在 150 毫秒量级完成,适合对延迟敏感、且决策可被结构化的业务环节。

对需要实时响应的系统而言,这类”小模型 + 窄答案空间”的接口,提供了在成本与速度之间取得平衡的新选项:既保留语言模型对模糊输入的理解能力,又避免把每一次判断都交给定价更高的旗舰模型处理。