DeepSeek V4.1 Flash 将上线:API 最高降 60%

9 月 9 日,DeepSeek 开放平台发布通知,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型。官方表示,经内部及外部多方测试,V4.1 Flash 在性能、费用、响应速度、总处理用时等指标上已全面超越 V4 Pro。

与模型发布同步的还有一次价格调整。距离上一次大幅涨价不到一个月,DeepSeek 宣布下调 Flash 系列定价,其中输入缓存命中部分降幅达到 60%。

V4 Pro 请求将自动切换,按更低单价计费

按照官方说明,在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,平台会把所有指向 V4 Pro 的接口请求全部路由到 V4.1 Flash,并按 V4.1 Flash 的单价计费。

这意味着现有 V4 Pro 调用方无需改动任何代码,即可切换到性能更强的新模型,同时支付费用反而下降。在模型迭代通常伴随涨价的行业惯例下,这种”升级与降价同步”的做法并不多见。

新价格:空闲时段与高峰时段相差一倍

新价格自北京时间 2026 年 9 月 10 日 12 时起执行,覆盖 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 两款模型,定位更高的 V4 Pro 价格保持不变。

空闲时段每百万 token 价格为:输入缓存命中 0.02 元,输入缓存未命中 1 元,输出 4 元。此前这三项价格分别为 0.05 元、1.5 元和 4.5 元,降幅依次为 60%、33.33% 和 11.11%。

高峰时段各项目价格为空闲时段的两倍,即输入缓存命中 0.04 元、输入缓存未命中 2 元、输出 8 元。高峰时段定义为北京时间周一至周五的 9:00 至 12:00 与 14:00 至 18:00,其余时间均为空闲时段。

与 8 月涨价前的水平相比,缓存命中与未命中的输入价格已回落至 0.02 元和 1 元,但输出价格仍高于涨价前的 2 元。

一个月前刚涨过价,V4 Pro 最高涨幅达 11 倍

时间线值得留意。8 月 13 日 V4 Pro 正式版上线时,DeepSeek 同步上调 API 价格,V4 Pro 系列最高涨幅达 11 倍,高峰时段每百万输出 token 最高达到 27 元。当时有开发者反映高峰时段成本明显上升,性价比优势被削弱。

不到一个月后,Flash 系列迎来降价。有开发者按自身智能体工作流估算,综合调用成本可能下降约 40%,实际降幅取决于缓存命中率、输入输出 token 占比以及任务能否错峰执行。错峰与提高缓存复用率,成为压低成本的两个主要抓手。

新模型:新架构、原生多模态,速度提升近两倍

9 月 8 日,DeepSeek 在官方交流群开启 V4.1 Flash 中间版本内测。据介绍,该版本采用新的模型结构,原生支持多模态,在能力、速度和成本上均有优化。

参与测试的社区用户反馈,其生成速度约为每秒 284 个 token,而当前 V4 模型约为每秒 97 个 token,速度提升接近两倍。对于需要反复迭代的编程场景,这一提升具备明显的实用价值。

在内测同步发放的问卷中,官方直接询问用户该模型能否全面替代线上运行的 V4 Pro。业内人士认为,这说明 DeepSeek 对 V4.1 Flash 的定位不只是 Flash 系列的内部迭代,而是希望以 Flash 的定价和速度,逼近甚至达到 Pro 级别的能力。

目前该测试版本名称带有”expires-on-0910″标识,暗示将在此后下线,正式版的实际表现成为市场关注焦点。

性价比仍是核心打法

第三方评测机构 Artificial Analysis 的数据显示,DeepSeek V4 Flash 的智能指数约为 53,低于 GPT-5.6 Sol 的 61 和 Claude Opus 5 的 63;但按单任务估算成本约为 0.25 美元,而后两者分别为 1.23 美元和 2.34 美元。

这种差距凸显了 DeepSeek 一贯的策略:即便在绝对能力上不占首位,凭借显著更低的推理成本,仍能在规模化调用的开发者群体中保持吸引力。对普通消费者而言,API 降价的影响相对间接,能否传导为更低的 AI 服务价格或更宽松的使用额度,还要看开发者与应用厂商的取舍。