<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>KimiK3 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/kimik3/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sun, 02 Aug 2026 07:54:36 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍</title>
		<link>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</link>
					<comments>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 02 Aug 2026 07:54:13 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[AMD MI355X]]></category>
		<category><![CDATA[KimiK3]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<category><![CDATA[模型部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</guid>

					<description><![CDATA[Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国 AI 推理服务商 Wafer 公布了一组在 AMD MI355X 上部署月之暗面（Moonshot AI）开源旗舰大模型 Kimi K3 的实测数据。在综合性能上，单台 MI355X 节点的单流解码速度与每美元吞吐能力都明显超过英伟达 B200 节点，每美元吞吐甚至超过 B300。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a6fed53ce9c9&quot;}" data-wp-interactive="core/image" data-wp-key="6a6fed53ce9c9" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp" alt="Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍" class="wp-image-3274" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">模型太大，主流显卡装不下</h2>



<p class="wp-block-paragraph">Kimi K3 于 7 月 16 日正式发布、7 月 27 日开放完整模型权重，是迄今全球参数规模最大的开源模型：总参数 2.8 万亿，采用混合专家（MoE）架构，每次推理实际激活约 1040 亿参数。专家总数为 896 个（另有 2 个共享专家），每次选择其中 16 个参与计算，上下文窗口为 100 万 token，原生支持视觉输入。模型基于月之暗面自研的 KDA（Kimi Delta Attention）混合线性注意力机制与注意力残差（AttnRes）技术构建。</p>



<p class="wp-block-paragraph">模型权重约 1.5TB，未分配 KV 缓存就已经超过 1.5TB 显存要求。即便是拥有 8 块 B200 的节点（每块 192GB）也无法装下完整的 K3 与百万级 token 的 KV 缓存。剩下的选择是：要么升级到显存更大的 B300（每块 288GB），要么把两个 B200 节点串起来用张量并行（TP16）跑。</p>



<p class="wp-block-paragraph">另一条路则是 AMD MI355X——单卡同样配备 288GB 显存，与 B300 一致，而每 GPU 的均价只有 B300 的约 1/2.4、B200 的约 1/1.7。硬件规格相近，价格便宜得多，听上去很美。瓶颈在软件：AMD 生态的算子优化普遍慢一拍，推理框架对新硬件的零日支持也常常慢人一步，这正是 Wafer 团队想要验证的地方。</p>



<h2 class="wp-block-heading">实测数据：便宜，而且更快</h2>



<p class="wp-block-paragraph">Wafer 在 8 块 MI355X 的节点（TP8）、两台 8 块 B200 的节点（TP16）、单台 8 块 B300 的节点（TP8+DCP8）三套配置上跑了同一组基准：1024 token 输入、400 token 输出。</p>



<p class="wp-block-paragraph">单流解码速度方面，MI355X 为 118 tok/s，B200 节点为 90 tok/s（这是 16 块 GPU 跨节点的总量，平摊到单机约为 249 tok/s 总量中更难直接拿来对比的单流表现），B300 节点为 172 tok/s。MI355X 的单流解码速度是 B200 节点的 1.3 倍以上，仅落后 B300 约 45%。</p>



<p class="wp-block-paragraph">峰值聚合吞吐方面，MI355X 节点为 952 tok/s，B200 节点为 498 tok/s（双节点 16 块 GPU 加起来的总量），B300 节点为 1568 tok/s。换算到每块 GPU：MI355X 为 119 tok/s，B200 约 31 tok/s，B300 为 196 tok/s——MI355X 是 B200 的 3.8 倍。</p>



<p class="wp-block-paragraph">按 B200 4.25 美元、B300 6 美元、MI355X 2.5 美元每 GPU 小时的价格计算，每美元每秒吞吐的对比如下：MI355X 为 48 tok/s，B300 为 33 tok/s，B200 仅 7 tok/s。MI355X 的每美元吞吐分别是 B300 的 1.45 倍、B200 的约 6.9 倍。</p>



<p class="wp-block-paragraph">需要为 B200 节点说句公道话：它的单流数据被跨节点 all-reduce 拖了后腿（用的是 RoCE v2 网络，约 195 Gb/s）——这是三套配置里唯一跨节点的方案，K3 的权重加 1M token 的 KV 缓存确实塞不进单台 8 块 192GB 显卡的服务器。但反过来也说明，K3 这种体量的模型正好让主打大显存的 MI355X 找到了一个对 B200 有实际意义的优势点。</p>



<h2 class="wp-block-heading">让 MI355X 跑起来的两个补丁</h2>



<p class="wp-block-paragraph">Kimi K3 开箱即可在 AMD 上跑起来，但要拿到上面的峰值数字，还需要两个补丁。</p>



<p class="wp-block-paragraph">第一个补丁在投机解码上。K3 没有内置任何草稿张量，既没有 MTP，也没有 EAGLE，唯一的投机路径是外部块扩散：RadixArk 出品的 Kimi-K3-DSpark。在 CUDA 上直接就能跑；在 ROCm 上，第一个真实请求就把调度器打挂了，错误是 `NameError: name &#8216;top_k_renorm_prob&#8217; is not defined`。原因是 sglang 的接受采样验证器有一条走 `torch.topk` 的稀疏路径，需要先调用 `top_k_renorm_prob` 函数；ROCm 构建里只挂了 Triton top-p 算子的别名，没把这个 top-k renorm 函数定义出来，于是请求一落到稀疏路径就立刻崩。</p>



<p class="wp-block-paragraph">修法只需要一段 PyTorch 函数：拿到概率向量，保留 top-k 项、把其他位置置零、再做一次缩放。sort、masked_fill、divide 三步搞定，加进 sglang 的 ROCm 采样分支，效果与 CUDA 路径上来自 `sgl_kernel` 的原生实现完全一致。这个小改动让单流性能提升约 2.2 倍，中等负载下单流提升约 1.7 倍，峰值聚合吞吐提升 18%。更重要的是，峰值吞吐对应的并发从 24 提到了 64。</p>



<p class="wp-block-paragraph">第二个补丁在 prefill 阶段。Wafer 团队提醒，业内谈模型性能时往往只盯着解码 tok/s，但用户真正感受到的是首 token 时延（TTFT），而 MI355X 在这里偏弱。同样的 172k token 冷启动 prefill，MI355X 需要约 51 秒，B300 只需约 23 秒。</p>



<p class="wp-block-paragraph">差距几乎全部来自一颗算子。K3 在 ROCm 上回退到了速度一般的 Triton 通用注意力实现，因为 AITER 的 MLA prefill 高速内核加载失败。表面看是缺内核，实际是 shape 不匹配：K3 在 TP8 下每个 rank 的注意力头数是 12，而 AITER 的 MLA 路径只支持 4、8 或 16 的倍数。修法是给头数从 12 零填充到 16，跑完高速内核后再从输出里取出实际的 12 个头。结果是，同样 172k 的冷启动 prefill，AITER MLA prefill 稳态速度约 13k tok/s，Triton 兜底只有 4k-7k tok/s，prefill 整体提速约 2 至 3 倍。</p>



<h2 class="wp-block-heading">这次没有写自定义内核</h2>



<p class="wp-block-paragraph">Wafer 的结论是：在 MI355X 上拿到最佳每美元吞吐基本是开箱即用，除了两个预期的框架级 bug，没有比 GLM5.2 时代更糟，甚至完全不需要写自定义内核。</p>



<p class="wp-block-paragraph">他们由此判断，SOTA（业界最优性能）在 AMD 上已经指日可待，CUDA 的护城河正在被蚕食。</p>



<p class="wp-block-paragraph">补充月之暗面官方公布的成绩：Kimi K3 在大模型编码评估系统 Frontend Code Arena 榜单上以 1679 分登顶，超过 Claude Fable 5 和 GPT-5.6 Sol 等闭源模型，是开源模型首次在该榜单夺冠；BrowseComp 测试得分 91.2%，高于 GPT-5.6 Sol 的 90.4% 和 Claude Fable 5 的 88.0%，单任务成本 2.03 美元，约为 GPT-5.6 Sol 的一半。API 官方定价为：缓存命中 2 元/百万 token、未命中输入 20 元/百万 token、输出 100 元/百万 token，Mooncake 分离式推理架构使编程场景的缓存命中率超过 90%。</p>



<p class="wp-block-paragraph">来源：Wafer Blog《Is memory the moat?》原文（2026 年 7 月）；月之暗面官方博客《Kimi K3: Open Frontier Intelligence》及官方模型卡。</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
