据 DeepSeek 开放平台公告,Flash 系列模型将于北京时间 2026 年 9 月 10 日 12 时起执行新定价。此次调整后,空闲时段输出价格降至每百万 Token 4 元,输入缓存命中价格降至每百万 Token 0.02 元,最高降幅达 60%。
新价格方案一览
本次调价覆盖 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 两款模型,两者执行相同价格标准。空闲时段与高峰时段价格如下:
| 计费项 | 空闲时段(调价后) | 高峰时段(调价后) |
|---|---|---|
| 输入缓存命中 | 0.02 元 / 百万 Token | 0.04 元 / 百万 Token |
| 输入缓存未命中 | 1 元 / 百万 Token | 2 元 / 百万 Token |
| 输出 | 4 元 / 百万 Token | 8 元 / 百万 Token |
高峰时段为空闲时段价格的两倍,时段划分维持此前规则:周一至周五 9:00–12:00、14:00–18:00。
降幅拆解:缓存命中成本下降最显著
与调价前相比,输入缓存命中价格从空闲 0.05 元、高峰 0.10 元降至 0.02 元和 0.04 元,降幅为 60%;输入缓存未命中从 1.5 元、3.0 元降至 1 元和 2 元,降幅约 33.33%;输出价格从 4.5 元、9 元降至 4 元和 8 元,降幅约 11.11%。
对于批处理、多轮对话、Agent 循环调用等上下文反复出现的场景,缓存命中价格下降带来的成本优势最为直接。一次性问答场景的成本下降则相对有限。
价格调整的时间背景
这是 DeepSeek 在 2026 年 8 月上线峰谷分时定价后,首次对 Flash 系列整体降价。此前有报道称,DeepSeek 今年前 7 个月营收约 4.75 亿元,算力投入约 110 亿元,该数据未经官方确认。
与此同时,国内大模型市场的价格竞争仍在持续。智谱 AI 此前已为 GLM-5.3-Flash 推出夜间免费策略,行业整体仍在单位 Token 边际价格上继续下探。
开发者影响
Flash 系列本就面向高并发、低延迟的推理场景。此次降价后,重复调用成本进一步降低,对于需要频繁调用 API 的自动化工作流、客服机器人、代码助手等应用,成本结构会有所优化。不过,开发者仍需结合实际调用模式评估降价带来的真实收益,尤其注意高峰时段的溢价规则。








