DeepSeek V4 Pro 转正:软件工程跑分涨 5 倍

8 月 12 日深夜,DeepSeek 在官方 API 文档中把 deepseek-v4-pro 对应的模型版本换成了 DeepSeek-V4-Pro-0813,旗舰模型由此结束近四个月的预览期,正式转入通用可用状态。调用方式没有变化,开发者仍用原来的模型名即可拿到新版本,不需要改动一行代码。模型聚合平台 OpenRouter 的页面同步把这一版标记为正式发布,上线日期记为 2026 年 8 月 12 日。

官方这次没有发布博客,只在 API 文档的模型与价格页面更新了参数,随后从官方群流出的一张评测对比表成了外界了解新版能力的主要依据。

规格:百万上下文,38.4 万输出

DeepSeek-V4-Pro-0813 支持 100 万 token 上下文长度,最大输出长度达到 38.4 万 token,同时提供思考模式与非思考模式,其中思考模式默认开启。对于需要一次性读入长代码仓库、处理大规模文档,或者连续执行大量步骤的智能体任务,这样的规格意味着单次调用能承载的内容量相当可观,多轮拆分与拼接的开销随之减少。

接口能力上,新版支持 JSON 结构化输出、工具调用与 Responses API,同时兼容 OpenAI 与 Anthropic 两套请求格式,对话前缀续写处于测试阶段,FIM 补全同样是测试功能且仅限非思考模式使用。换句话说,DeepSeek 在接口层已经基本对齐了当下主流的智能体开发工具链,切换成本被压到很低。

架构方面,V4 Pro 沿用此前公开的混合专家设计,总参数规模 1.6 万亿,每次推理激活约 490 亿参数。并发限制上,Pro 版为 500,轻量的 Flash 版为 2500,产品分层意图明确:高频轻量任务走 Flash,复杂长任务走 Pro。

跑分:智能体项目全面拉升,四项超过 Opus 4.8

官方评测表最直观的信号是与预览版的落差。在考察模型在真实终端环境中执行命令、解决系统问题的 Terminal Bench 2.1 上,正式版拿到 87.9 分,预览版为 72.1 分,三个月抬升 15.8 分。面向长周期真实软件工程任务的 DeepSWE 变化更剧烈,从预览版的 12.8 分跃升至 62.7 分,接近原来的五倍——预览版在这项测试上基本处于「做不完任务」的状态。

横向对比中,V4-Pro-0813 有四个项目超过 Anthropic 上一代旗舰 Opus 4.8:

  • Terminal Bench 2.1:87.9 对 85.0
  • 网络安全攻防基准 Cybergym:83.3 对 78.3
  • DeepSWE:62.7 对 58.0
  • 工作流智能体基准 AutomationBench:31.8 对 27.2

另有 Agents’ Last Exam 一项两者打平,均为 25.7。

与更强的 Fable 5 相比,差距仍在,但个别项目已经反超。Cybergym 上 V4 Pro 以 83.3 略微领先 83.1,AutomationBench 上 31.8 高于 29.1,是表中三个模型的最高分。Terminal Bench 2.1 几乎追平,87.9 对 88.0,只差 0.1 分。需要留意的是,表中对 Fable 5 的标注是带回退机制的成绩。

短板同样清楚。代码仓库生成任务 NL2Repo 上 V4 Pro 为 61.5,落后 Opus 4.8 的 69.7;工具调用综合测试 Toolathlon-Verified 为 74.1,低于 Opus 的 76.2 与 Fable 5 的 77.9;数据科学任务 DSBench-Hard 为 67.2,不及 Opus 的 71.7;DSBench-FullStack 为 71.1,略低于 Opus 的 71.6,与 Fable 5 的 77.2 差距更明显。知识推理测试 HLE 的表现比较特殊:不带工具时 V4 Pro 只有 42.7,明显低于 Opus 的 49.8 和 Fable 5 的 53.3;一旦允许调用工具,成绩升至 60.0,反超 Opus 的 57.9,逼近 Fable 5 的 63.0。

这组数字勾勒出的画像是:单纯拼静态知识储备,V4 Pro 不占优势;一旦进入需要动手、需要连续调用工具推进的场景,它的位置明显靠前。

价格:输出每百万 token 6 元,未跟随涨价

计费标准方面,deepseek-v4-pro 每百万 token 的价格为缓存命中输入 0.025 元、缓存未命中输入 3 元、输出 6 元。同系列的 deepseek-v4-flash 对应为 0.02 元、1 元和 2 元,两项主要计费项上 Pro 恰好是 Flash 的三倍。

放到国际同类产品的价目表里,这个数字的分量会更清楚。按每百万输出 token 折算,Fable 5 定价 50 美元,GPT-5.6 Sol Max 为 30 美元,同一晚发布的 Grok 4.6 为 6 美元,而 V4 Pro 约为 0.87 美元。0.1 分的跑分差距背后,是数十倍的价格落差。

值得注意的是,DeepSeek 官网此前挂出的「计划近期整体上调 API 服务定价,预计涨幅较大」提示仍未撤下,而这次正式版并没有跟着调价。对开发者而言,这更像是一个窗口期,而非长期承诺。

来源:OpenRouter、DeepSeek 官方 API 文档