原定 9 月 14 日 12:00 就要退场的 DeepSeek V4 Pro,最终没有退场。9 月 11 日,DeepSeek 宣布,为响应用户需求,决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 调用服务,计费方式保持不变。
这已经是五天内的第三次调整。
五天三次变卦
9 月 9 日,DeepSeek 首次公告:在 V4.1 Pro 上线之前,会把对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
9 月 10 日,公司发布 V4.1 Flash 模型,同时宣布把 V4 Pro 的下线时间明确到北京时间 2026 年 9 月 14 日 12:00。
9 月 11 日,下线决定取消。按最新口径,deepseek-v4-pro 这个模型名将长期存在,调用它拿到的仍然是 V4 Pro,价格维持原有水平。
接班的新模型,到底差在哪
V4.1 Flash 是 DeepSeek 全新模型结构系列中尺寸最小的一款,总参数 552B,采用 Causal-Encoder-Decoder 非对称结构:输入阶段每 token 只激活 8B 参数,输出阶段激活 16B。它具备原生多模态视觉理解能力,上下文长度 100 万 token,最大输出 384K,并以 MIT 许可在 Hugging Face 开源。
官方说法是,经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。
但把模型卡上的 instruct 对比逐项摊开,结论要复杂一些:Codeforces 评分从 3348 升到 3471,提升 123 分;MathArena Apex 从 65.3 微升至 65.6;而 GPQA Diamond 从 92.4 降到 90.9,HLE(无工具)从 42.7 降到 36.8。
换句话说,这是一次用知识类分数换取代码、数学、智能体执行能力和价格的交易,而非全面领先。对重度依赖长链条推理与知识密集型任务的团队,这种取舍并不总是划算——这也是 V4 Pro 被保留下来的直接原因。
便宜这么多,靠的是什么
V4.1 Flash 的成本优势主要来自两处。
一是非对称激活。同尺寸模型中,它的单 token 激活量明显更低。
二是 KV Cache 压缩。与上一代相比,V4.1 Flash 对 HBM 的需求降到四分之一,对 SSD 的需求降到八分之一,全局 KV Cache 压缩到每 token 890 字节。在智能体场景中,缓存命中费用往往占总成本的大头,缓存压得小,账单就跟着降。
现行价格对照
DeepSeek 继续沿用峰谷定价:高峰时段为北京时间周一至周五 9:00 至 12:00、14:00 至 18:00,其余为闲时,闲时价格为高峰时段的一半。计价单位均为每百万 tokens。
deepseek-flash 闲时价格为:输入缓存命中 0.02 元、缓存未命中 1 元、输出 4 元;高峰时段分别为 0.04 元、2 元、8 元。
deepseek-v4-pro 闲时价格为:输入缓存命中 0.15 元、缓存未命中 4.5 元、输出 13.5 元;高峰时段分别为 0.30 元、9.0 元、27.0 元。
两者输出价相差约 3.4 倍,这正是迁移的经济动力所在。
给开发者的三点提醒
第一,模型名不再等于模型本身。此前 deepseek-v4-flash、deepseek-v4-flash-vision-exp 两个旧模型名已经下线,出于兼容暂时路由到 V4.1 Flash。只靠锁定模型名来锁定能力的做法,在这次事件中已经失效。
第二,V4 Pro 得以保留,但 V4.1 Pro 尚未上线,也没有给出时间。推理能力要求高的业务,短期内仍应把 V4 Pro 作为主要选项,并预留回退方案。
第三,如果业务对价格敏感、对时延和吞吐要求高,把负载切到 deepseek-flash 更划算;批量、非实时的任务安排在闲时执行,成本还能再降一半。







