新架构带来什么
9 月 23 日,小米 MiMo 大模型负责人罗福莉在社交平台发文,宣布 MiMo-V3 即将采用全新架构,其核心组件 HySparse 2 于当日发布。新版架构的目标很明确:更少的预填充计算、更小的 KV 缓存,以及更出色的长上下文检索能力。

长上下文下的关键指标
在 1M(100 万)Token 的长度下,新架构将预填充计算量(FLOPs)降低了 5.02 倍,KV 缓存缩小了 4.5 倍,同时获得了更高的 MRCRv2 与 RULER-v2 评测分数,而 AgentPPL 与 LongPPL 则更低。
为什么长上下文推理更难
罗福莉指出,智能体(Agentic)推理是一种截然不同的工作负载。在每一轮交互中,一个简短的动作就可能返回需要进行预填充的长文本观察结果,而上下文还在不断增长。这使得预填充成本、KV 缓存大小与检索准确率同时处于关键路径上,任何一项成为瓶颈都会影响整体体验。
HySparse 2 的两条技术路线
新架构提出了两项核心改进。KV 桥接(KV Bridging)沿用 YOCO 的思路,让交叉解码器(cross-decoder)中的全注意力层利用自解码器(self-decoder)的隐藏状态来构建自身的 K/V。KV 重用(KV Reuse)则在每个混合块内部,让稀疏层复用前一层全注意力层的 KV 缓存与选择索引。
此外还有两项优化:用 Token 级别的选择替代原有的 block(块)级别选择,并用近期 Token 的强制窗口替代独立的 SWA 分支,从而让本地与全局 Token 共享同一个 KV 缓存。由于所有交叉解码器的 KV 缓存现在都来自自解码器,预填充在自解码器完成时即可停止,进一步压缩了计算开销。
同步开源的 V2.6 系列
值得一提的是,就在前一天凌晨,小米刚刚发布并开源了全新的 Xiaomi MiMo-V2.6 系列,包含 Pro 与 Flash 两个原生全模态模型。小米称这是其探索 RSI(递归自我改进)路径的关键一步,通过规模化扩展强化学习算力,让模型在持续的探索与反馈中拓展智能边界。相关论文已发布于 arXiv(编号 2609.26368)。







