<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>AI推理 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/ai%E6%8E%A8%E7%90%86/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 08 Aug 2026 05:36:12 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>一道题四分钱，DeepSeek 拿下最难推理榜 61.4%</title>
		<link>https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</link>
					<comments>https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 05:35:55 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI成本]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[ARC-AGI]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[基准测试]]></category>
		<category><![CDATA[大模型评测]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/</guid>

					<description><![CDATA[抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">抽象推理基准 ARC-AGI 的独立评测机构 ARC Prize 基金会于 2026 年 7 月 31 日公布了对 DeepSeek V4 Flash 0731 的验证结果。在最高推理档位下，这款模型在 ARC-AGI-1 半私有测试集上取得 89.0% 的成绩，单题成本约 0.02 美元；在难度更高的 ARC-AGI-2 半私有测试集上取得 61.4%，单题成本约 0.04 美元。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a77ebe32adc6&quot;}" data-wp-interactive="core/image" data-wp-key="6a77ebe32adc6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp" alt="一道题四分钱，DeepSeek 拿下最难推理榜 61.4%" class="wp-image-4057" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/c96f4d10ca0b3f99c9e886a9e10f4096_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：ARC Prize 基金会</figcaption></figure>





<p class="wp-block-paragraph">真正引发开发者讨论的不是分数本身，而是分数与成本的组合。</p>



<h2 class="wp-block-heading">三档推理，三种性价比</h2>



<p class="wp-block-paragraph">DeepSeek 向 ARC Prize 提交了三个推理强度变体，分别是 Max（最高）、High（较高）和 Low（较低）。用户可以自行决定单次回答投入多少算力，这一选择会直接反映在每道题的花费上。三档的验证成绩如下：</p>



<ul class="wp-block-list"><li>最高档 Max：ARC-AGI-1 得分 89.0%，ARC-AGI-2 得分 61.4%</li><li>较高档 High：ARC-AGI-1 得分 87.0%，ARC-AGI-2 得分 56.0%</li><li>较低档 Low：ARC-AGI-1 得分 84.0%，ARC-AGI-2 得分 46.0%</li></ul>



<p class="wp-block-paragraph">在 ARC-AGI-1 上，最高档与最低档之间只差 5 个百分点；但到了 ARC-AGI-2，两档差距拉开到 15.4 个百分点。这说明第二代基准对模型“想多久”这件事远比第一代敏感——同一个模型少思考一会儿，成绩就会明显滑落。</p>



<p class="wp-block-paragraph">ARC Prize 尚未公布该模型在 ARC-AGI-3 上的成绩。</p>



<h2 class="wp-block-heading">ARC-AGI 到底在考什么</h2>



<p class="wp-block-paragraph">ARC-AGI（抽象与推理语料库）由研究者弗朗索瓦·肖莱（François Chollet）设计，考察方向与常见的知识问答、代码生成类基准完全不同。每道题给出几组彩色网格的“输入—输出”示例，模型需要自行推断出其中的变换规则，再把规则套用到一个全新的输入上。</p>



<p class="wp-block-paragraph">这类题目无法靠背诵互联网语料蒙混过关，考的是面对陌生问题时的泛化能力。ARC-AGI-2 在第一代基础上刻意提高了门槛：加入需要多条规则叠加才能解出的任务，同时剔除了大模型已经学会套路化应对的题型。因此 61.4% 这个数字的含金量，明显高于同一模型在第一代上的 89.0%。</p>



<p class="wp-block-paragraph">评测采用半私有测试集，题目不对外公开，以避免答案被写进训练数据。本次公布的逐题明细覆盖 ARC-AGI-1 公开集的 400 道题与 ARC-AGI-2 公开集的 120 道题，逐条标注了三个档位各自的通过与失败情况。</p>



<h2 class="wp-block-heading">成本这一栏，为什么比分数更受关注</h2>



<p class="wp-block-paragraph">ARC Prize 的验证流程把资源消耗视为衡量指标的一部分，所以结果页会把每题成本与得分并列展示。放在整个榜单的成本—分数坐标里，V4 Flash 的位置相当靠左上：分数进入第一梯队，横轴上的花费却低了一到两个数量级。</p>



<p class="wp-block-paragraph">有开发者在技术社区讨论中指出，V4 Flash 最高档在这张图上的位置已经压过同为开放权重路线的 Kimi K3，与部分闭源前沿模型的得分区间接近，成本却只是后者的零头。需要说明的是，这类对比来自社区解读，并非 ARC Prize 的官方结论。</p>



<p class="wp-block-paragraph">同样需要提醒的是，0.02 美元和 0.04 美元只对应本次评测中的单道基准题目，不能直接换算成实际业务开销。真实应用里的智能体往往要反复调用工具、维持超长上下文、产出大段文本，累计花费会远高于一道基准题。</p>



<h2 class="wp-block-heading">开放权重阵营的位置在变化</h2>



<p class="wp-block-paragraph">过去两年，抽象推理长期被视为闭源前沿模型的专属优势区。测试时计算（让模型在回答前多想一会儿）的思路虽然把成绩推了上去，但高档位的单题成本一度停留在数美元量级，规模化使用并不现实。</p>



<p class="wp-block-paragraph">DeepSeek 由梁文锋创办，总部位于杭州。此次 V4 Flash 0731 以开放权重形态拿到经第三方验证的成绩，意味着开发者既可以调用其接口，也可以自行部署后按需调节推理强度，在延迟、预算和准确率之间做取舍——这种灵活度，正是把推理能力塞进智能体流水线时最实际的考量。</p>



<p class="has-small-font-size wp-block-paragraph">来源：ARC Prize 基金会 ARC-AGI 验证结果页</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/deepseek-v4-flash-arc-agi-verified/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>10小时复刻CUDA，英伟达护城河松了</title>
		<link>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/</link>
					<comments>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 13:48:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[开源生态]]></category>
		<category><![CDATA[编码智能体]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/</guid>

					<description><![CDATA[你可能一直以为英伟达最难被追上的是芯片，其实真正的壁垒是 CUDA 这层软件。现在有人用编码智能体，花了大约1 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你可能一直以为英伟达最难被追上的是芯片，其实真正的壁垒是 CUDA 这层软件。现在有人用编码智能体，花了大约10小时就把它复刻了一遍。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a77ebe32ba00&quot;}" data-wp-interactive="core/image" data-wp-key="6a77ebe32ba00" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="868" height="488" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cuda_header.webp" alt="10小时复刻CUDA，英伟达护城河松了" class="wp-image-3540" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cuda_header.webp 868w, https://mylogs.cn/wp-content/uploads/2026/08/cuda_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cuda_header-768x432.webp 768w" sizes="(max-width: 868px) 100vw, 868px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Next Web</figcaption></figure>





<p class="wp-block-paragraph">前谷歌大脑研究员杰里米·尼克松创办的初创公司 Infinity，用人工智能编码智能体为芯片公司 D-Matrix 重建了一套 CUDA 级别的软件栈，耗时约10小时。他对《商业内幕》说，这说明英伟达最重要的护城河之一正在被跨过去。</p>



<p class="wp-block-paragraph">CUDA 全称统一计算设备架构，由英伟达高管伊恩·巴克主导、打磨了近二十年，里面打包了现成代码库和调试工具，还能让成千上万块芯片协同训练一个模型。它更硬的是第二重壁垒：各家公司在上面堆了数百万行代码和工作流，换芯片就得重写。亚马逊的内部文件曾把 CUDA 列为自研 Trainium、Inferentia 芯片落地的主要障碍。深度求索创始人梁文锋也提过，编码智能体加上自研的 TileLang 语言，让搭建这类软件容易了很多。</p>



<p class="wp-block-paragraph">压力还来自另一头——行业重心正从训练模型转向跑模型。韩国芯片创企 Rebellions 的马歇尔·崔说得直接：在推理这边，「CUDA 已经不再是一个因素」，那是开源的战场。英伟达开发者生态副总裁安基特·帕特尔则回应，公司自己也在用编码智能体加速 CUDA 开发和验证，而且越往落地走，全栈优化的价值越大。</p>



<p class="wp-block-paragraph">我的判断是，护城河不会消失，只会挪个位置。曾把上一家芯片软件公司卖给英伟达的徐冰（Bing Xu）说得实在：智能体能在短时间里生成一大堆代码，但验证才是最大的瓶颈。Modular 的克里斯·拉特纳更不客气，说这波炒作「非常过头」——写代码只是造软件的一小部分，难的是把它调到能上生产环境。</p>



<p class="wp-block-paragraph">下一轮竞争，你赌生成速度，还是赌验证能力？</p>



<p class="has-small-font-size wp-block-paragraph">来源：Business Insider 报道，综合 The Next Web 整理</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>跑 Kimi 慢了一点，成本反降三成</title>
		<link>https://mylogs.cn/%e8%b7%91-kimi-%e6%85%a2%e4%ba%86%e4%b8%80%e7%82%b9%ef%bc%8c%e6%88%90%e6%9c%ac%e5%8f%8d%e9%99%8d%e4%b8%89%e6%88%90/</link>
					<comments>https://mylogs.cn/%e8%b7%91-kimi-%e6%85%a2%e4%ba%86%e4%b8%80%e7%82%b9%ef%bc%8c%e6%88%90%e6%9c%ac%e5%8f%8d%e9%99%8d%e4%b8%89%e6%88%90/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 23:16:38 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[Cloudflare]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[智谱GLM]]></category>
		<category><![CDATA[月之暗面]]></category>
		<category><![CDATA[模型量化]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%b7%91-kimi-%e6%85%a2%e4%ba%86%e4%b8%80%e7%82%b9%ef%bc%8c%e6%88%90%e6%9c%ac%e5%8f%8d%e9%99%8d%e4%b8%89%e6%88%90/</guid>

					<description><![CDATA[你在海外应用里用到的 AI，背后越来越可能是中国团队做的模型。Cloudflare 8 月 3 日发的一篇工程 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你在海外应用里用到的 AI，背后越来越可能是中国团队做的模型。Cloudflare 8 月 3 日发的一篇工程博客里，被挑出来重点优化的两个模型，正是月之暗面的 Kimi K 系列和智谱的 GLM——文章开头就写明，这两家的模型「用起来非常舒服，但因为显存吃紧，非常难高效地跑起来」。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a77ebe32c2f6&quot;}" data-wp-interactive="core/image" data-wp-key="6a77ebe32c2f6" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="628" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e4172982401b6805a2ee880967282083_header.webp" alt="跑 Kimi 慢了一点，成本反降三成" class="wp-image-3448" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e4172982401b6805a2ee880967282083_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e4172982401b6805a2ee880967282083_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e4172982401b6805a2ee880967282083_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e4172982401b6805a2ee880967282083_header-768x402.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Cloudflare 官方博客</figcaption></figure>





<p class="wp-block-paragraph">三位工程师讲了三招。第一招，把模型用来记住上下文的「键值缓存」从 16 位精度压到 8 位，Kimi K2.6 能同时装下的上下文量从约 68.6 万词元翻到约 137 万。反常识的地方在这儿：单个请求反而更慢了（每秒 137 个词元降到 125），可同时能处理的请求数从 32 个上限顶到 64 个，峰值吞吐比原来高出 41%，每词元成本降约三成。第二招，把 GLM 5.2 的权重从 8 位浮点压成 4 位整数，模型文件从 705GB 缩到 421GB，单张显卡占用从约 88GB 降到 52GB，解码速度不降反升 55%。</p>



<p class="wp-block-paragraph">说白了，这是拿「单个用户慢一点」换「同时能服务的人多一倍」——云厂商算的是总账，不是单笔账。而两项常用测评的分数几乎没掉（94.24 对 94.09、89.11 对 89.04），说明这笔账划得来。第三招则是给共享缓存加了一层校验，防止上百个请求读串页，代价不到 1% 的吞吐。</p>



<p class="wp-block-paragraph">有意思的是，中国开源模型如今成了海外云厂商眼里「最难伺候、也最值得下功夫」的一类。如果要接一个大模型进自己的项目，你会先看效果还是先看单价？</p>



<p class="wp-block-paragraph">来源：Cloudflare 官方博客《Smaller, faster, safer: running Kimi and GLM at scale》，作者 Alex Reneau、Kevin Flansburg、Chi McIsaac，2026 年 8 月 3 日</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e8%b7%91-kimi-%e6%85%a2%e4%ba%86%e4%b8%80%e7%82%b9%ef%bc%8c%e6%88%90%e6%9c%ac%e5%8f%8d%e9%99%8d%e4%b8%89%e6%88%90/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍</title>
		<link>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</link>
					<comments>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 02 Aug 2026 07:54:13 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[AMD MI355X]]></category>
		<category><![CDATA[KimiK3]]></category>
		<category><![CDATA[开源大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<category><![CDATA[模型部署]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/</guid>

					<description><![CDATA[Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国 AI 推理服务商 Wafer 公布了一组在 AMD MI355X 上部署月之暗面（Moonshot AI）开源旗舰大模型 Kimi K3 的实测数据。在综合性能上，单台 MI355X 节点的单流解码速度与每美元吞吐能力都明显超过英伟达 B200 节点，每美元吞吐甚至超过 B300。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a77ebe32caa1&quot;}" data-wp-interactive="core/image" data-wp-key="6a77ebe32caa1" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp" alt="Kimi K3 跑在 AMD 显卡上：每美元速度是英伟达 6.9 倍" class="wp-image-3274" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/8cd986a53f02d52fec3948ed0a9788ad_header-768x525.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">模型太大，主流显卡装不下</h2>



<p class="wp-block-paragraph">Kimi K3 于 7 月 16 日正式发布、7 月 27 日开放完整模型权重，是迄今全球参数规模最大的开源模型：总参数 2.8 万亿，采用混合专家（MoE）架构，每次推理实际激活约 1040 亿参数。专家总数为 896 个（另有 2 个共享专家），每次选择其中 16 个参与计算，上下文窗口为 100 万 token，原生支持视觉输入。模型基于月之暗面自研的 KDA（Kimi Delta Attention）混合线性注意力机制与注意力残差（AttnRes）技术构建。</p>



<p class="wp-block-paragraph">模型权重约 1.5TB，未分配 KV 缓存就已经超过 1.5TB 显存要求。即便是拥有 8 块 B200 的节点（每块 192GB）也无法装下完整的 K3 与百万级 token 的 KV 缓存。剩下的选择是：要么升级到显存更大的 B300（每块 288GB），要么把两个 B200 节点串起来用张量并行（TP16）跑。</p>



<p class="wp-block-paragraph">另一条路则是 AMD MI355X——单卡同样配备 288GB 显存，与 B300 一致，而每 GPU 的均价只有 B300 的约 1/2.4、B200 的约 1/1.7。硬件规格相近，价格便宜得多，听上去很美。瓶颈在软件：AMD 生态的算子优化普遍慢一拍，推理框架对新硬件的零日支持也常常慢人一步，这正是 Wafer 团队想要验证的地方。</p>



<h2 class="wp-block-heading">实测数据：便宜，而且更快</h2>



<p class="wp-block-paragraph">Wafer 在 8 块 MI355X 的节点（TP8）、两台 8 块 B200 的节点（TP16）、单台 8 块 B300 的节点（TP8+DCP8）三套配置上跑了同一组基准：1024 token 输入、400 token 输出。</p>



<p class="wp-block-paragraph">单流解码速度方面，MI355X 为 118 tok/s，B200 节点为 90 tok/s（这是 16 块 GPU 跨节点的总量，平摊到单机约为 249 tok/s 总量中更难直接拿来对比的单流表现），B300 节点为 172 tok/s。MI355X 的单流解码速度是 B200 节点的 1.3 倍以上，仅落后 B300 约 45%。</p>



<p class="wp-block-paragraph">峰值聚合吞吐方面，MI355X 节点为 952 tok/s，B200 节点为 498 tok/s（双节点 16 块 GPU 加起来的总量），B300 节点为 1568 tok/s。换算到每块 GPU：MI355X 为 119 tok/s，B200 约 31 tok/s，B300 为 196 tok/s——MI355X 是 B200 的 3.8 倍。</p>



<p class="wp-block-paragraph">按 B200 4.25 美元、B300 6 美元、MI355X 2.5 美元每 GPU 小时的价格计算，每美元每秒吞吐的对比如下：MI355X 为 48 tok/s，B300 为 33 tok/s，B200 仅 7 tok/s。MI355X 的每美元吞吐分别是 B300 的 1.45 倍、B200 的约 6.9 倍。</p>



<p class="wp-block-paragraph">需要为 B200 节点说句公道话：它的单流数据被跨节点 all-reduce 拖了后腿（用的是 RoCE v2 网络，约 195 Gb/s）——这是三套配置里唯一跨节点的方案，K3 的权重加 1M token 的 KV 缓存确实塞不进单台 8 块 192GB 显卡的服务器。但反过来也说明，K3 这种体量的模型正好让主打大显存的 MI355X 找到了一个对 B200 有实际意义的优势点。</p>



<h2 class="wp-block-heading">让 MI355X 跑起来的两个补丁</h2>



<p class="wp-block-paragraph">Kimi K3 开箱即可在 AMD 上跑起来，但要拿到上面的峰值数字，还需要两个补丁。</p>



<p class="wp-block-paragraph">第一个补丁在投机解码上。K3 没有内置任何草稿张量，既没有 MTP，也没有 EAGLE，唯一的投机路径是外部块扩散：RadixArk 出品的 Kimi-K3-DSpark。在 CUDA 上直接就能跑；在 ROCm 上，第一个真实请求就把调度器打挂了，错误是 `NameError: name &#8216;top_k_renorm_prob&#8217; is not defined`。原因是 sglang 的接受采样验证器有一条走 `torch.topk` 的稀疏路径，需要先调用 `top_k_renorm_prob` 函数；ROCm 构建里只挂了 Triton top-p 算子的别名，没把这个 top-k renorm 函数定义出来，于是请求一落到稀疏路径就立刻崩。</p>



<p class="wp-block-paragraph">修法只需要一段 PyTorch 函数：拿到概率向量，保留 top-k 项、把其他位置置零、再做一次缩放。sort、masked_fill、divide 三步搞定，加进 sglang 的 ROCm 采样分支，效果与 CUDA 路径上来自 `sgl_kernel` 的原生实现完全一致。这个小改动让单流性能提升约 2.2 倍，中等负载下单流提升约 1.7 倍，峰值聚合吞吐提升 18%。更重要的是，峰值吞吐对应的并发从 24 提到了 64。</p>



<p class="wp-block-paragraph">第二个补丁在 prefill 阶段。Wafer 团队提醒，业内谈模型性能时往往只盯着解码 tok/s，但用户真正感受到的是首 token 时延（TTFT），而 MI355X 在这里偏弱。同样的 172k token 冷启动 prefill，MI355X 需要约 51 秒，B300 只需约 23 秒。</p>



<p class="wp-block-paragraph">差距几乎全部来自一颗算子。K3 在 ROCm 上回退到了速度一般的 Triton 通用注意力实现，因为 AITER 的 MLA prefill 高速内核加载失败。表面看是缺内核，实际是 shape 不匹配：K3 在 TP8 下每个 rank 的注意力头数是 12，而 AITER 的 MLA 路径只支持 4、8 或 16 的倍数。修法是给头数从 12 零填充到 16，跑完高速内核后再从输出里取出实际的 12 个头。结果是，同样 172k 的冷启动 prefill，AITER MLA prefill 稳态速度约 13k tok/s，Triton 兜底只有 4k-7k tok/s，prefill 整体提速约 2 至 3 倍。</p>



<h2 class="wp-block-heading">这次没有写自定义内核</h2>



<p class="wp-block-paragraph">Wafer 的结论是：在 MI355X 上拿到最佳每美元吞吐基本是开箱即用，除了两个预期的框架级 bug，没有比 GLM5.2 时代更糟，甚至完全不需要写自定义内核。</p>



<p class="wp-block-paragraph">他们由此判断，SOTA（业界最优性能）在 AMD 上已经指日可待，CUDA 的护城河正在被蚕食。</p>



<p class="wp-block-paragraph">补充月之暗面官方公布的成绩：Kimi K3 在大模型编码评估系统 Frontend Code Arena 榜单上以 1679 分登顶，超过 Claude Fable 5 和 GPT-5.6 Sol 等闭源模型，是开源模型首次在该榜单夺冠；BrowseComp 测试得分 91.2%，高于 GPT-5.6 Sol 的 90.4% 和 Claude Fable 5 的 88.0%，单任务成本 2.03 美元，约为 GPT-5.6 Sol 的一半。API 官方定价为：缓存命中 2 元/百万 token、未命中输入 20 元/百万 token、输出 100 元/百万 token，Mooncake 分离式推理架构使编程场景的缓存命中率超过 90%。</p>



<p class="wp-block-paragraph">来源：Wafer Blog《Is memory the moat?》原文（2026 年 7 月）；月之暗面官方博客《Kimi K3: Open Frontier Intelligence》及官方模型卡。</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/kimi-k3-%e8%b7%91%e5%9c%a8-amd-%e6%98%be%e5%8d%a1%e4%b8%8a%ef%bc%9a%e6%af%8f%e7%be%8e%e5%85%83%e9%80%9f%e5%ba%a6%e6%98%af%e8%8b%b1%e4%bc%9f%e8%be%be-6-9-%e5%80%8d/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>答对却说不清：AI的“推理”可能是场蒙对</title>
		<link>https://mylogs.cn/%e7%ad%94%e5%af%b9%e5%8d%b4%e8%af%b4%e4%b8%8d%e6%b8%85%ef%bc%9aai%e7%9a%84%e6%8e%a8%e7%90%86%e5%8f%af%e8%83%bd%e6%98%af%e5%9c%ba%e8%92%99%e5%af%b9/</link>
					<comments>https://mylogs.cn/%e7%ad%94%e5%af%b9%e5%8d%b4%e8%af%b4%e4%b8%8d%e6%b8%85%ef%bc%9aai%e7%9a%84%e6%8e%a8%e7%90%86%e5%8f%af%e8%83%bd%e6%98%af%e5%9c%ba%e8%92%99%e5%af%b9/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 31 Jul 2026 23:08:31 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[Quanta]]></category>
		<category><![CDATA[人工智能研究]]></category>
		<category><![CDATA[可解释性]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[思维链]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e7%ad%94%e5%af%b9%e5%8d%b4%e8%af%b4%e4%b8%8d%e6%b8%85%ef%bc%9aai%e7%9a%84%e6%8e%a8%e7%90%86%e5%8f%af%e8%83%bd%e6%98%af%e5%9c%ba%e8%92%99%e5%af%b9/</guid>

					<description><![CDATA[如今的大型推理模型能解开奥数金牌级别的难题，也能改进悬而未决的数学猜想，但一个越来越尖锐的问题摆在研究者面前： [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">如今的大型推理模型能解开奥数金牌级别的难题，也能改进悬而未决的数学猜想，但一个越来越尖锐的问题摆在研究者面前：这些模型给出的正确答案，究竟是“想明白了”，还是“碰巧蒙对了”？科技媒体 Quanta Magazine 在7月31日的一篇报道中，梳理了这场关于AI是否真会“推理”的争论。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a77ebe32d804&quot;}" data-wp-interactive="core/image" data-wp-key="6a77ebe32d804" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/33899e03ff71e9e7cdfd00dafe043231_header.webp" alt="答对却说不清：AI的“推理”可能是场蒙对" class="wp-image-3073" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/33899e03ff71e9e7cdfd00dafe043231_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/33899e03ff71e9e7cdfd00dafe043231_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/33899e03ff71e9e7cdfd00dafe043231_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/33899e03ff71e9e7cdfd00dafe043231_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Quanta Magazine</figcaption></figure>





<h2 class="wp-block-heading">“思维链”可能只是一层表演</h2>



<p class="wp-block-paragraph">争论的焦点，是大型推理模型在作答时输出的那一长串“思维链”。表面上，它像是模型一步步的思考过程；但多项研究发现，这段文字既未必忠实反映模型内部真正在做什么，对最终答案也未必有实质的因果作用。</p>



<p class="wp-block-paragraph">圣塔菲研究所的AI研究者 Melanie Mitchell 给出三点结论：这类模型确实有效；它们的思维链并不忠实；其中大量文字甚至可以删掉而不影响结果。亚利桑那州立大学的 Subbarao Kambhampati（前美国人工智能学会主席）措辞更直接，把这些中间文本称为“含混的嘟囔”，并呼吁停止把它们拟人化地当成“思考”。</p>



<h2 class="wp-block-heading">一串点号也能替代“思考过程”</h2>



<p class="wp-block-paragraph">支撑这些质疑的，是一批设计精巧的实验。纽约大学的研究者在2024年发现，把可读的思维链替换成一串毫无意义的“填充符号”（比如连续的点号），模型在部分任务上依然能得到正确答案。东北大学与加州大学伯克利分校2025年的研究进一步指出，前沿开源推理模型中，30%到60%的“思考步骤”对数学基准题的答案几乎没有因果影响，砍掉一半，性能也几乎不受损。</p>



<p class="wp-block-paragraph">苹果公司此前那篇名为《思考的幻象》的论文更为轰动，称推理模型在难度稍高的条件下会出现“准确率完全崩塌”。Kambhampati 由此提出“近似检索”假说：模型并非真的学会了通用算法，而是靠海量推理文本的嵌入去“近似地检索”出答案，这解释了为何“胡扯”与“准确”能够并存。</p>



<h2 class="wp-block-heading">另一派：结果对，就是硬道理</h2>



<p class="wp-block-paragraph">并非所有人都认同这套“泼冷水”的说法。OpenAI 的技术研究员 Sébastien Bubeck 反驳称，那些批评论文往往基于已经过时的模型，现代模型（如 GPT-5.5 及之后版本）并不存在所谓的崩塌问题。在他看来，能稳定得出正确结果本身就是硬道理——2026年5月，OpenAI 的通用推理模型就一举给出了一道著名未解数学问题的答案。</p>



<p class="wp-block-paragraph">值得注意的是，Google DeepMind 与数学家陶哲轩在2026年的合作中，也借助AI重新发现并改进了跨越数学分析、组合、几何、数论的67个问题。能力之强，双方并无争议。</p>



<h2 class="wp-block-heading">可以用，但未必可以“信”</h2>



<p class="wp-block-paragraph">那么该如何看待这台“会答题却说不清”的机器？报道作者把它比作一台引擎：有澎湃的马力，却看不到驱动的“马腿”。在代码、数学证明这类结果可被独立验证的领域，即便过程是黑箱，也不妨放手使用；但在难以验证对错的领域，人们仍然需要模型“出于正确的理由”给出答案，才谈得上真正的信任。这场争论短期内不会有定论，但它提醒外界：一个答案是否正确，和模型是否真的在“推理”，可能是两回事。</p>



<p class="wp-block-paragraph">来源：Quanta Magazine</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e7%ad%94%e5%af%b9%e5%8d%b4%e8%af%b4%e4%b8%8d%e6%b8%85%ef%bc%9aai%e7%9a%84%e6%8e%a8%e7%90%86%e5%8f%af%e8%83%bd%e6%98%af%e5%9c%ba%e8%92%99%e5%af%b9/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
