9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型。这是其全新模型结构系列中尺寸最小的一款,具备原生多模态视觉理解能力。同日,该模型上线国家超算互联网,API 服务与权重文件同步开放。
官方对新结构的设计目标表述得很直接:能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大的参数规模。

5520 亿参数,输入和输出用两套算力
V4.1 Flash 是一个总参数量 552B 的混合专家(MoE)模型,采用了全新的 Causal-Encoder-Decoder(因果编码器—解码器)结构。
这套结构最大的特点是输入与输出不对称:处理输入时只激活 80 亿参数,生成输出时激活 160 亿参数。也就是说,读取信息和生成内容被分配了不同的计算规模。DeepSeek 称,其成本显著低于已知的同尺寸模型。
这种设计与智能体(Agent)的工作方式高度契合。处理代码仓库、长文档和历史对话时,模型往往需要”读很多、写很少”——吞下海量上下文,再输出相对有限的判断、代码或操作指令。把输入环节的计算开销压下来,对这类任务的整体效率改善是直接的。
除结构外,V4.1 Flash 还采用了新的预训练方式,并经过了更大规模的强化学习后训练。官方公布的基准成绩包括:科学问答 GPQA Diamond 得分 90.9,Codeforces 竞赛编程评级 3471,MathArena Apex 得分 65.6。在考察终端任务执行的 Terminal-Bench 2.1 上得分为 90.6,网络安全测试 CyberGym 上得分 88.1——而 V4 Pro 此前公布的对应成绩分别为 87.9 和 83.3。

KV Cache 再瘦身:HBM 需求降到 1/4
另一项关键改进在缓存。V4.1 Flash 大幅减少了 KV Cache 的大小,与上一代模型相比,对 HBM(高带宽内存)的需求减少到 1/4,对 SSD 的需求减少到 1/8。
这个数字对 Agent 类场景的意义尤其突出。缓存命中的费用在长任务账单里往往占比不低,把 KV Cache 压缩下来,等于直接降低了调用成本。从官方披露的演进曲线看,相对初代模型,KV Cache 已经缩小了 437 倍。
API 变更与 V4 Pro 的下线时间表
V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,开发者将模型名称更改为 deepseek-flash 即可调用。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线;出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会被暂时路由到 V4.1 Flash。
更值得注意的是 V4 Pro 的退场安排。DeepSeek 表示,经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此计划有序下线 V4 Pro:北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。
国家超算互联网同步开放
在算力侧,用户可登录国家超算互联网官网(www.scnet.cn)PC 端,从首页进入「模型服务」页面,即可快速打开 V4.1 Flash 的 API 调用界面,无需繁琐的环境配置。依托平台的国产算力资源池与 Notebook 开发环境,企业、科研机构及开发者也可以在 AI 社区下载模型权重文件,开展二次开发、本地部署与技术研究。
据介绍,国家超算互联网作为全国一体化算力网的核心载体,已接入 30 余家骨干算力中心,汇聚近 70 种规格算力资源;其 AI 社区现已汇集 1800 余款国内外热门开源大模型,并陆续接入 DeepSeek、GLM、Qwen、Kimi 等主流国产大模型 API,覆盖文本、图像、视频生成、语音合成、多模态等能力。
一个用更低单价接替自家旗舰、同时把上下文存储开销继续往下压的模型,对高频调用 Agent 的开发者来说,吸引力可能比榜单名次本身更实际。







