<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>端侧推理 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e7%ab%af%e4%be%a7%e6%8e%a8%e7%90%86/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Wed, 05 Aug 2026 02:56:44 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>20B模型压进5.3GB，Mac mini每秒吐218词</title>
		<link>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/</link>
					<comments>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 02:56:24 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[Mac]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[模型压缩]]></category>
		<category><![CDATA[端侧推理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/</guid>

					<description><![CDATA[一个总参数规模 200 亿的推理模型，权重文件只有 5.31 GB，在一台 M4 芯片的 Mac mini 上 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一个总参数规模 200 亿的推理模型，权重文件只有 5.31 GB，在一台 M4 芯片的 Mac mini 上每秒能吐出 218 个 token。这是初创公司 DeepGrove 刚刚开源的 Maple-Preview 交出的成绩单。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a72d57651f4b&quot;}" data-wp-interactive="core/image" data-wp-key="6a72d57651f4b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="648" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header.webp" alt="20B模型压进5.3GB，Mac mini每秒吐218词" class="wp-image-3614" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-300x162.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-1024x553.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9bd90255b745aa05d04f90a7cce2e888_header-768x415.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：DeepGrove / Hugging Face</figcaption></figure>





<p class="wp-block-paragraph">按官方说法，同等规模下 Maple-Preview 的推理能力处于领先水平，甚至能与更大的模型掰手腕，能够解出国际数学奥林匹克（IMO）难度的题目，速度则比 Gemma 4、Qwen3.5、gpt-oss 这类以高效著称的模型快 5 到 16 倍。项目在 Hacker News 上发布时用的标题更直接：在 iPhone 上跑到每秒 120 个 token。</p>



<h2 class="wp-block-heading">三值权重：把每个参数压成三个数</h2>



<p class="wp-block-paragraph">Maple-Preview 的核心不在参数堆料，而在精度。它采用的是三值权重（ternary weight），即每个权重只在 −1、0、+1 三个取值中选一个，而不是常规的 16 位或 8 位浮点数。这种极端压缩直接决定了模型的体积和访存开销——200 亿参数最终落成一个 5.31 GB 的检查点，普通消费级设备的内存就能装下。</p>



<p class="wp-block-paragraph">DeepGrove 并非第一次做这件事。这家 2025 年夏季进入 Y Combinator 的公司此前已经开源过 Bonsai——一个约 5 亿参数的三值权重小模型。团队对自己的定位描述得很清楚：研究高效模型如何学习，从架构、训练基础设施、优化方法到硬件设计通盘重做，把低精度当成头等公民而非事后补丁。Maple-Preview 是这条路线上的第一个正式落点。</p>



<h2 class="wp-block-heading">20B 的架子，1B 的开销</h2>



<p class="wp-block-paragraph">模型标注为 20B-A1B，意思是总参数 200 亿、每次推理只激活约 10 亿。具体结构是 24 层、256 个专家的混合专家（MoE）配置，每次前向传播只激活其中 8 个专家；注意力部分采用 3:1 比例的滑动窗口注意力（SWA-512）与全局注意力混搭。上下文窗口为 131072 个 token。</p>



<p class="wp-block-paragraph">这套组合的意图很直白：用稀疏激活压住计算量，用三值权重压住内存带宽，两头同时省，才可能在没有独立显卡的设备上跑出三位数的生成速度。</p>



<p class="wp-block-paragraph">评测方面，官方使用稠密输出头在 LCBv6、AIME 2026、HMMT 2026 和 GPQA-D 四项基准上做了能力对比，结论是在内存—性能和速度—性能两条曲线上都推进了帕累托前沿。权重以 MIT 许可发布，除标准格式外还提供了适配苹果芯片的 MLX 版本，官方同时上线了在线试用入口和本地部署指南。</p>



<h2 class="wp-block-heading">更值得注意的是「边跑边学」</h2>



<p class="wp-block-paragraph">比跑分更有意思的是 DeepGrove 提到的一组早期实验：Maple-Preview 在 MacBook Pro 上本地运行时，能够一边工作一边学习。模型自主判断哪些事实和用户偏好值得记住，随后在空闲时对这些内容进行「做梦」式的回放，把知识固化进自身权重。</p>



<p class="wp-block-paragraph">这个思路针对的是当下 AI 记忆方案的通病。目前主流做法是把用户偏好写成一堆文本文件，每次对话再塞回上下文，条目一多就会撑爆窗口，而且文字描述往往丢掉那些微妙的个性化细节。DeepGrove 的判断是，未来的端侧模型应该靠调整自己的权重来记住主人，而不是靠散落在几千个笔记文件里的事实条目。之所以敢这么设想，前提正是模型足够小、足够快、足够省电——大模型在云端做同样的事，成本完全不是一个量级。</p>



<h2 class="wp-block-heading">现阶段的边界</h2>



<p class="wp-block-paragraph">DeepGrove 对这个预览版的局限也交代得比较坦率。官方明确说明，Maple-Preview 主要针对原始推理能力做了打磨，针对智能体任务的后训练很少，通用强化学习也只做了小规模，因此在智能体类基准上可能表现不佳，团队计划在正式版发布前继续延长训练。</p>



<p class="wp-block-paragraph">工程上还有一处需要注意：随模型一同提供的 Transformers 实现依赖 Triton 和 FlashAttention，面向的是兼容 CUDA 的环境；而那个 218 tokens/秒的苹果芯片成绩，用的是另一套独立的端侧运行时。想在 Mac 上复现官方速度的开发者，需要走 MLX 路径而不是直接用 Transformers。</p>



<p class="has-small-font-size wp-block-paragraph">来源：DeepGrove / Hugging Face 模型页</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/maple-preview-20b-model-mac-mini-218-tokens/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
