<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>开源推理引擎 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%bc%80%e6%ba%90%e6%8e%a8%e7%90%86%e5%bc%95%e6%93%8e/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 01 Aug 2026 12:16:17 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>2.8万亿参数跑进笔记本：Kimi K3靠硬盘流式运行</title>
		<link>https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/</link>
					<comments>https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 01 Aug 2026 12:16:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Kimi K3]]></category>
		<category><![CDATA[MacBook Pro]]></category>
		<category><![CDATA[NVMe固态硬盘]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[开源推理引擎]]></category>
		<category><![CDATA[本地部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/</guid>

					<description><![CDATA[一个名为 WASTE 的开源推理引擎，把参数量高达 2.78 万亿的 Kimi K3 完整跑在了一台 64GB [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">一个名为 WASTE 的开源推理引擎，把参数量高达 2.78 万亿的 Kimi K3 完整跑在了一台 64GB 内存的 MacBook Pro 上。开发者强调，这不是蒸馏版、剪枝版或任何缩水变体，而是完整的开放权重模型。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a6fec2303e2b&quot;}" data-wp-interactive="core/image" data-wp-key="6a6fec2303e2b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="428" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header.webp" alt="2.8万亿参数跑进笔记本：Kimi K3靠硬盘流式运行" class="wp-image-3149" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-300x107.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-1024x365.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/waste_kimik3_header-768x274.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Wikimedia Commons / D-Kuru，CC BY-SA 4.0</figcaption></figure>





<h2 class="wp-block-heading">一台笔记本，跑万亿级模型</h2>



<p class="wp-block-paragraph">WASTE 全称 Weight-Aware Streaming Tensor Engine（权重感知流式张量引擎），用 C 语言编写，运行时不依赖任何第三方库，没有 BLAS，没有 ONNX，推理路径里也没有 Python。</p>



<p class="wp-block-paragraph">它给出的成绩单是：Kimi K3 转换后形成一个 982 GiB 的容器文件，引擎启动的内存下限为 29.05 GB，在 64GB 内存的机器上实测速度为每秒 0.45 到 0.62 个词元。项目文档里贴出的一次实际运行记录显示，回答&#8221;意大利的首都是哪里&#8221;这个问题，输出 16 个词元耗时 25.78 秒。</p>



<p class="wp-block-paragraph">这个速度确实慢。但开发者认为，慢不是重点：目前没有找到另一份公开的、在消费级机器上通过磁盘流式运行万亿级模型的演示，而业内记录最完整的 6710 亿参数方案，前提是一台配备 1TB 内存的服务器。</p>



<h2 class="wp-block-heading">原理：把闲置的权重放回硬盘</h2>



<p class="wp-block-paragraph">这套方案能成立，靠的是混合专家架构的稀疏特性。Kimi K3 每处理一个词元，只会从 896 个路由专家中激活 16 个，实际参与运算的权重约占总量的 4%。绝大部分权重在任一时刻都处于闲置状态，而闲置的权重不需要待在内存里，只需要&#8221;能及时取到&#8221;。</p>



<p class="wp-block-paragraph">WASTE 的做法是把模型主干常驻内存，专家权重留在硬盘上，并按特定布局排列——每条专家记录按 4KiB 对齐，门控、上投影、下投影三个矩阵相邻存放，因此路由到一个专家只需要一次读取操作，而不是三次。剩余内存全部用作有界的专家缓存。</p>



<p class="wp-block-paragraph">真正拉开差距的优化有两项。一是把专家读取与算术运算重叠执行，收益约 1.6 倍。二是&#8221;抢跑&#8221;：下一层的专家编号本来要等隐藏状态算出来才知道，但路由器本身是常驻内存的，于是引擎在每层结束时，直接用当前层的隐藏状态去跑下一层的路由器，提前把它点名的专家取回来。这个提前一个残差块的猜测，排名第一的命中率为 92%，前六名合计 81%，把缓存命中率从 14% 拉到 38%，而总读取字节数完全不变。</p>



<p class="wp-block-paragraph">专家权重采用残差矢量量化存储，三级 256 条目码本作用于 8 维向量，平均每个权重 3.00 比特；模型主干则保持 4 比特和 8 比特精度。开发者试过把主干也压到 3 比特，结果输出直接崩溃。</p>



<h2 class="wp-block-heading">硬盘速度决定一切</h2>



<p class="wp-block-paragraph">文档反复强调，存储速度不是细节问题。处理一个词元需要读取 17GB 的专家数据，走内部固态硬盘的实测带宽是每秒 12.78GB，模型能流畅串起来；换成 USB 外置硬盘只有每秒 0.94GB，同一个词元要等 13 秒。结论很直接：外置硬盘只用来下载，转换后的容器必须放在机器内置的 NVMe 上。</p>



<p class="wp-block-paragraph">内存预算也存在反直觉的现象。在 64GB 的机器上，46GB 预算跑出 0.53 到 0.55 词元每秒，是曲线最高点；而预算调到 52GB 时结果在 0.04 到 0.46 之间剧烈跳动，完全不可复现；调到 58GB 更是稳定跌到 0.02 至 0.03。原因不是缓存失效，而是引擎虽然守住了自己的预算，机器整体却已经放不下，操作系统开始换页。</p>



<p class="wp-block-paragraph">对于不想拿出一整块 TB 级硬盘的人，同一套引擎和格式可以运行 Kimi-Linear-48B，容器只有 19GB，内存门槛 1.87GB，速度能到每秒 10.7 个词元。</p>



<h2 class="wp-block-heading">意义在哪</h2>



<p class="wp-block-paragraph">开发者对项目名字的解释是：每一个由云端服务生成的词元都被付费了两次，一次是账单，一次是数据中心的电费——而那个模型本可以（勉强、别扭但确实可以）跑在已经摆在桌上的硬件里。</p>



<p class="wp-block-paragraph">这套方案指向的场景很明确：一个前沿规模的模型，回答问题时不需要联网，没有按词元计费的账单，也没有任何数据离开本机。对于&#8221;这些数据不能发给外部接口&#8221;的场合，差别就是能做和不能做。</p>



<p class="wp-block-paragraph">作为验证对象的 Kimi K3 于 7 月 27 日由月之暗面公开权重，总参数量 2.8 万亿，支持 100 万词元上下文与原生视觉理解，是目前参数规模最大的开放权重模型。WASTE 项目方称，引擎和格式本身并不特别针对 K3，选它只是因为它是当下最难啃的一块骨头——能流式跑通 2.78 万亿参数，跑 480 亿参数自然轻松。</p>



<p class="wp-block-paragraph">来源：GitHub 开源项目 sqliteai/waste 项目文档、Hacker News；Kimi K3 参数信息来自月之暗面官方发布</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/2-8%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e8%b7%91%e8%bf%9b%e7%ac%94%e8%ae%b0%e6%9c%ac%ef%bc%9akimi-k3%e9%9d%a0%e7%a1%ac%e7%9b%98%e6%b5%81%e5%bc%8f%e8%bf%90%e8%a1%8c/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
