20B模型压进5.3GB,Mac mini每秒吐218词

一个总参数规模 200 亿的推理模型,权重文件只有 5.31 GB,在一台 M4 芯片的 Mac mini 上每秒能吐出 218 个 token。这是初创公司 DeepGrove 刚刚开源的 Maple-Preview 交出的成绩单。

按官方说法,同等规模下 Maple-Preview 的推理能力处于领先水平,甚至能与更大的模型掰手腕,能够解出国际数学奥林匹克(IMO)难度的题目,速度则比 Gemma 4、Qwen3.5、gpt-oss 这类以高效著称的模型快 5 到 16 倍。项目在 Hacker News 上发布时用的标题更直接:在 iPhone 上跑到每秒 120 个 token。

三值权重:把每个参数压成三个数

Maple-Preview 的核心不在参数堆料,而在精度。它采用的是三值权重(ternary weight),即每个权重只在 −1、0、+1 三个取值中选一个,而不是常规的 16 位或 8 位浮点数。这种极端压缩直接决定了模型的体积和访存开销——200 亿参数最终落成一个 5.31 GB 的检查点,普通消费级设备的内存就能装下。

DeepGrove 并非第一次做这件事。这家 2025 年夏季进入 Y Combinator 的公司此前已经开源过 Bonsai——一个约 5 亿参数的三值权重小模型。团队对自己的定位描述得很清楚:研究高效模型如何学习,从架构、训练基础设施、优化方法到硬件设计通盘重做,把低精度当成头等公民而非事后补丁。Maple-Preview 是这条路线上的第一个正式落点。

20B 的架子,1B 的开销

模型标注为 20B-A1B,意思是总参数 200 亿、每次推理只激活约 10 亿。具体结构是 24 层、256 个专家的混合专家(MoE)配置,每次前向传播只激活其中 8 个专家;注意力部分采用 3:1 比例的滑动窗口注意力(SWA-512)与全局注意力混搭。上下文窗口为 131072 个 token。

这套组合的意图很直白:用稀疏激活压住计算量,用三值权重压住内存带宽,两头同时省,才可能在没有独立显卡的设备上跑出三位数的生成速度。

评测方面,官方使用稠密输出头在 LCBv6、AIME 2026、HMMT 2026 和 GPQA-D 四项基准上做了能力对比,结论是在内存—性能和速度—性能两条曲线上都推进了帕累托前沿。权重以 MIT 许可发布,除标准格式外还提供了适配苹果芯片的 MLX 版本,官方同时上线了在线试用入口和本地部署指南。

更值得注意的是「边跑边学」

比跑分更有意思的是 DeepGrove 提到的一组早期实验:Maple-Preview 在 MacBook Pro 上本地运行时,能够一边工作一边学习。模型自主判断哪些事实和用户偏好值得记住,随后在空闲时对这些内容进行「做梦」式的回放,把知识固化进自身权重。

这个思路针对的是当下 AI 记忆方案的通病。目前主流做法是把用户偏好写成一堆文本文件,每次对话再塞回上下文,条目一多就会撑爆窗口,而且文字描述往往丢掉那些微妙的个性化细节。DeepGrove 的判断是,未来的端侧模型应该靠调整自己的权重来记住主人,而不是靠散落在几千个笔记文件里的事实条目。之所以敢这么设想,前提正是模型足够小、足够快、足够省电——大模型在云端做同样的事,成本完全不是一个量级。

现阶段的边界

DeepGrove 对这个预览版的局限也交代得比较坦率。官方明确说明,Maple-Preview 主要针对原始推理能力做了打磨,针对智能体任务的后训练很少,通用强化学习也只做了小规模,因此在智能体类基准上可能表现不佳,团队计划在正式版发布前继续延长训练。

工程上还有一处需要注意:随模型一同提供的 Transformers 实现依赖 Triton 和 FlashAttention,面向的是兼容 CUDA 的环境;而那个 218 tokens/秒的苹果芯片成绩,用的是另一套独立的端侧运行时。想在 Mac 上复现官方速度的开发者,需要走 MLX 路径而不是直接用 Transformers。

来源:DeepGrove / Hugging Face 模型页