<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>GPU &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/gpu/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 13:04:05 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>让Codex自己跑实验：他把GPU内核性能提升了232倍</title>
		<link>https://mylogs.cn/codex-auto-research-232x-kernel/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 13:03:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[Codex]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[内核优化]]></category>
		<category><![CDATA[矩阵分解]]></category>
		<category><![CDATA[自动研究]]></category>
		<guid isPermaLink="false">https://mylogs.cn/codex-auto-research-232x-kernel/</guid>

					<description><![CDATA[让 Codex 自己跑实验：他把 GPU 内核性能提升了 232 倍 在 GPU Mode 与 Core Au [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">让 Codex 自己跑实验：他把 GPU 内核性能提升了 232 倍</h2>



<p class="wp-block-paragraph">在 GPU Mode 与 Core Automation 联合举办的一场「自动研究」主题编程竞赛里，一名开发者借助 OpenAI 的 Codex 编程智能体，把一道 CUDA 矩阵分解内核的运行效率提升到基准方案的 232 倍，在 183 名参赛者中位列第 12。整篇复盘没有停留在「调参玄学」，而是把「让 AI 替你做研究、自己跑实验」的工作方式拆解得相当具体。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54562a&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54562a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header.webp" alt="让Codex自己跑实验：他把GPU内核性能提升了232倍" class="wp-image-4974" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">赛题：给张量核心喂饱矩阵乘法</h2>



<p class="wp-block-paragraph">竞赛的要求是实现批量方阵的紧凑 Householder QR 分解，输出格式需与 PyTorch 的 <code>torch.geqrf</code> 一致。QR 分解把矩阵拆成正交矩阵 Q 与上三角矩阵 R，是许多线性代数与优化器的底层算子。难点在于，标准的 Householder QR 是「一列一列串行」地清零下三角，串行部分只能跑在 SM 的慢速向量单元上，而昂贵的张量核心只能干等。</p>



<p class="wp-block-paragraph">该作者的突破口是经典的「分块 Householder + WY 表示」：先在一个窄面板内完成串行工作，再把面板的多个反射子压缩成一次秩-b 更新，用三次连续的矩阵乘法（GEMM）一次性覆盖后方的主块。这样串行工作量被锁在窄面板里，其余部分全部变成张量核心最擅长的 GEMM 形状。测试覆盖的矩阵规模从 512×512 一直到 4096，批量大小跨度很大，最大的矩阵批量太少填不满张量核心，最小的 32 阶又得把多份矩阵塞进同一次内核启动。</p>



<h2 class="wp-block-heading">自动研究：把未知未知变成已知未知</h2>



<p class="wp-block-paragraph">更值得借鉴的是人机协作的方法论。作者坦承自己只是「有一年的 GPU 内核优化基础、并非专业人士」，在排行榜上属于逆风开局——排在他前面的人里有英伟达的首席工程师。他的体会是：对问题理解得越透，给大模型的提示词就越精准，本质是「把未知未知转化成已知未知」。他先用 Claude 补 QR 分解与 Householder 反射的直觉，确认主干架构必须走分块 Householder 配合尾部 WY 更新；GPT-5.5 在这一架构上也给出了同样的判断。</p>



<p class="wp-block-paragraph">在 14 天里，他提交了超过 1500 次方案。竞赛提供的命令行工具让智能体能直接测试、跑分并提交排行榜，形状级别的反馈加上整体几何平均耗时，构成了一个让智能体不断「爬山」的紧凑循环。他还利用低精度（FP16、FP8、NVFP4）在内部加速，同时保证返回的因子仍通过 FP32 级别的 QR 校验。工具链上，他使用 ChatGPT Pro（每月 200 美元）与 Claude Pro（每月 20 美元）两套订阅，并用 Modal 提供的每月 30 美元免费额度做性能剖析，Codex 的 <code>/compaction</code> 等功能则用来维持长程上下文。</p>



<h2 class="wp-block-heading">对开发者的启示</h2>



<p class="wp-block-paragraph">这则案例的价值，不在于「232 倍」这个炫目的数字，而在于它展示了一种新的工程范式：当反馈循环足够紧凑、可自动评测时，编程智能体可以代替人完成大量试错，而人类的作用退化为「提对问题」与「判断方向」。对于日常做性能优化的工程师，文章也直言不讳地指出可改进之处——例如更早引入更系统的低精度策略、把更多形状纳入回归测试。自动研究不会取代领域知识，但确实把「懂一点」和「完全不懂」之间的差距，压缩得比过去小得多。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hacker News（原文出自 sankalp 个人博客，作者 sankalp）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>高盛：AI 算力瓶颈已不在芯片，而在光互连</title>
		<link>https://mylogs.cn/goldman-ai-optical-networking-bottleneck/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 20:15:32 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[光通信]]></category>
		<category><![CDATA[基础设施]]></category>
		<category><![CDATA[数据中心]]></category>
		<category><![CDATA[算力]]></category>
		<category><![CDATA[高盛]]></category>
		<guid isPermaLink="false">https://mylogs.cn/goldman-ai-optical-networking-bottleneck/</guid>

					<description><![CDATA[当 GPU 不再是瓶颈 过去三年，人工智能基础设施的投资几乎全部围绕图形处理器（GPU）展开。谁掌握了算力芯片 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">当 GPU 不再是瓶颈</h2>



<p class="wp-block-paragraph">过去三年，人工智能基础设施的投资几乎全部围绕图形处理器（GPU）展开。谁掌握了算力芯片，谁就掌握了这一轮技术浪潮的主动权。但在高盛资产管理看来，这个故事正在进入下半场。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca546d1f&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca546d1f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1168" height="784" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/9fe7694e81eb3194fbf7a4d43e603f55_header.webp" alt="高盛：AI 算力瓶颈已不在芯片，而在光互连" class="wp-image-4497" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/9fe7694e81eb3194fbf7a4d43e603f55_header.webp 1168w, https://mylogs.cn/wp-content/uploads/2026/08/9fe7694e81eb3194fbf7a4d43e603f55_header-300x201.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/9fe7694e81eb3194fbf7a4d43e603f55_header-1024x687.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/9fe7694e81eb3194fbf7a4d43e603f55_header-768x516.webp 768w" sizes="(max-width: 1168px) 100vw, 1168px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AOL / 24-7 Wall St.</figcaption></figure>





<p class="wp-block-paragraph">高盛公共科技投资联席主管成秀（Sung Cho）近期提出一个判断：人工智能的投资主线，正从 GPU 周期，转向那些把人工智能「连接在一起」的公司——尤其是光通信与光纤设备制造商。他点名的两家代表性企业是 Lumentum（纳斯达克代码：LITE）与 Coherent（纽交所代码：COHR）。</p>



<p class="wp-block-paragraph">这一判断的要点在于：算力集群的约束条件，已经发生了转移。</p>



<h2 class="wp-block-heading">从训练到推理，架构彻底变样</h2>



<p class="wp-block-paragraph">成秀的逻辑起点，是工作负载结构的变化。他表示，当前市场最重要的趋势之一，是从以人工智能「训练」驱动大部分算力，转向以人工智能「推理」驱动大部分算力。而在这两套架构之下，是一组完全不同的芯片与光通信设备，领导地位也会随着这次转型而演变。</p>



<p class="wp-block-paragraph">训练阶段往往集中在少数超大规模的数据中心，追求极致的单体算力；推理阶段则不同——它更贴近最终用户，需要在离用户更近的地方部署大量数据中心。成秀指出，进入推理时代后，需要建设的数据中心数量大幅增加，彼此之间也必须被大量连接起来。</p>



<h2 class="wp-block-heading">铜退光进：互连成为新天花板</h2>



<p class="wp-block-paragraph">在数据中心内部，布线本身成了天花板。成秀的解释很直观：处理器的运算速度，已经不再是瓶颈；真正的瓶颈，变成了芯片与芯片之间、服务器与服务器之间的通信能力。而现在大量的连接仍然依赖铜缆，未来将被光通信替代。</p>



<p class="wp-block-paragraph">光纤的价值在于，它能在更高带宽、更长距离与更低功耗下传输数据，而铜连接在带宽和功耗上的天花板正变得越来越明显。换句话说，当一座座人工智能工厂拔地而起，决定其效率的不再只是「发动机」够不够强，还有「高速公路」够不够宽。</p>



<p class="wp-block-paragraph">从供给侧看，光通信的扩产难度极大。成秀认为，光学器件的产能很难快速上线，而需求却随推理转型加速增长，这使得光通信相关资产的行情持续时间，可能长于以往的半导体周期。</p>



<h2 class="wp-block-heading">两家公司的数据印证</h2>



<p class="wp-block-paragraph">市场似乎已经用走势投了票。Lumentum 二零二六财年第三财季（于五月五日提交）的财报验证了这一逻辑：营收达到八亿零八百四十万美元，同比增长百分之九十点一；非美国通用会计准则下每股收益二点三七美元，非美国通用会计准则 operating margin 环比提升七百个基点至百分之三十二点二。首席执行官迈克尔·赫尔斯顿提到，光电路交换机的积压订单超过四亿美元，共封装光学器件也拿到了一笔数亿美元、预计在二零二七年上半年交付的增量订单。该股年初至今上涨逾百分之一百二十，过去一年涨幅接近百分之六百。</p>



<p class="wp-block-paragraph">Coherent 同样受益。这家已进入标普五百指数的公司，二零二六财年第三财季营收十八亿一千万美元，同比增长百分之二十点五；其中数据中心与通信业务贡献十三亿六千万美元，同比增长百分之四十点六，已占其总营收的百分之七十五。非美国通用会计准则下每股收益一点四一美元，营业利润率百分之二十点三。首席执行官吉姆·安德森表示，公司有望在二零二六年底将内部磷化铟产能翻一番，到二零二七年再翻一番以上。英伟达二十亿美元的投资，成为双方围绕激光与光网络设备的合作锚点；共封装光学、光电路交换机、多轨方案等新引擎，预计到二零三零年将带来超过两百亿美元的增量可服务市场。该股年初至今上涨逾百分之七十六。</p>



<h2 class="wp-block-heading">这股趋势意味着什么</h2>



<p class="wp-block-paragraph">需要明确，这只是高盛的一家之见。高盛全球股票研究主管詹姆斯·科韦洛便持不同看法：他认为芯片厂商在生态其他环节尚未兑现回报时便大赚，这种格局「前所未有且不可持续」，更看好超大规模云厂商后续表现。</p>



<p class="wp-block-paragraph">但抛开具体的股票涨跌，成秀点出的技术方向值得关注：人工智能的竞争，正从「谁的训练集群更大」，转向「谁能把成千上万颗芯片更高效地连起来」。随着英伟达从 Blackwell 向 Vera Rubin 乃至 Rubin Ultra 系统演进，单机柜内的网络价值占比预计将持续攀升，光模块、光引擎与光电路交换机的需求空间随之打开。</p>



<p class="wp-block-paragraph">对正在大规模建设智算中心的市场，这一判断同样有参照意义：算力不只等于芯片，光互连与供电散热正共同决定人工智能基础设施的真实上限。当 GPU 不再是唯一的瓶颈，光，或许会成为下一段故事的主角。</p>



<p class="has-small-font-size wp-block-paragraph">来源：AOL / 24-7 Wall St.（高盛资产管理观点）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AI 研究重心移向大厂，大学教授如何另辟蹊径</title>
		<link>https://mylogs.cn/ai-professors-academic-research-shift/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 11:32:46 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[学术界]]></category>
		<category><![CDATA[学术研究]]></category>
		<category><![CDATA[开放科学]]></category>
		<category><![CDATA[科研经费]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-professors-academic-research-shift/</guid>

					<description><![CDATA[前沿模型进了大厂实验室 过去四年，人工智能研究全面围绕大语言模型展开，而最前沿的突破，已经从大学实验室转移到了 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">前沿模型进了大厂实验室</h2>



<p class="wp-block-paragraph">过去四年，人工智能研究全面围绕大语言模型展开，而最前沿的突破，已经从大学实验室转移到了私人公司。大学根本负担不起训练和运行尖端模型所需的显卡，即便负担得起，Anthropic 与 OpenAI 也不会对外公开 Claude 与 ChatGPT 的内部细节。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca548a5e&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca548a5e" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cdddb57ab9a41768c134780becbcaa8d_header.webp" alt="AI 研究重心移向大厂，大学教授如何另辟蹊径" class="wp-image-4450" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cdddb57ab9a41768c134780becbcaa8d_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/cdddb57ab9a41768c134780becbcaa8d_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cdddb57ab9a41768c134780becbcaa8d_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/cdddb57ab9a41768c134780becbcaa8d_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MIT Technology Review</figcaption></figure>





<p class="wp-block-paragraph">加州山景城一场聚焦 AI 学者的闭门聚会，把这种错位摆到了台面上。这场活动由施密特科学基金会旗下的 AI2050 项目发起，旨在资助从事人工智能研究的学者。与会者中，加州大学伯克利分校计算机科学教授妮卡·哈格塔拉布打了个比方：当下的 AI 学者，像是活在一个私人企业独占基因编辑工具 CRISPR 的世界里的生物学家。前沿实验室之外的人，可以研究 ChatGPT 与 Claude 表现出的行为，却无法深入探究这些工具的设计与训练，更别提亲自引导设计方向。</p>



<h2 class="wp-block-heading">钱与算力双重短缺</h2>



<p class="wp-block-paragraph">AI2050 确实为学者提供了一笔可用于采购显卡的经费，不少与会者认为这是参与该项目的一大实惠。但资金压力依旧沉重，尤其考虑到美国联邦科研经费近期遭到削减。即便是不自己跑模型的学者，为了扎实地研究 OpenAI、Anthropic 与谷歌的模型，反复调用接口的成本也高得令人却步。</p>



<h2 class="wp-block-heading">绕开大厂赛道</h2>



<p class="wp-block-paragraph">许多受资助学者把精力投向那些 Anthropic 与 OpenAI 不太可能去碰的问题。约翰斯·霍普金斯大学计算机科学教授安贾莉·菲尔德的态度很有代表性：「我尽量不去钻研那些我觉得科技公司迟早会解决的问题。」企业终究要盈利，那些几乎无利可图、甚至答案可能让公司难堪的研究方向，往往得不到投入。菲尔德曾做过一项研究：语言模型对「更常由女性使用的表达方式」所给出的回应，明显不如对男性化表达来得周全——这类题目很难想象会出自 Anthropic 或 OpenAI 之手。</p>



<h2 class="wp-block-heading">不碰大模型的另一群人</h2>



<p class="wp-block-paragraph">还有一大批 AI 学者根本不与大模型打交道。他们多是科学家，构建专门用于数据分析、预测、乃至模拟整个物理系统的模型，并不必然与前沿实验室正面竞争。不过挑战照样不少：谷歌 DeepMind 旗下、凭蛋白质结构预测拿下诺贝尔奖的 AlphaFold 团队，上个月刚刚解散。另一些研究者则苦恼于公众对「非大模型 AI」的普遍误解——比如有人专门搭建应对气候变化的专用 AI，却常因大众把「AI」等同于「吞电的大模型」而难以争取支持。</p>



<h2 class="wp-block-heading">人才外流与新的可能</h2>



<p class="wp-block-paragraph">格局正在变化：多位知名学者已请假加入前沿实验室，不少 AI2050 受资助者同时在学界与企业任职。近半年又冒出新的隐忧——OpenAI 的模型已在数学领域解出若干真实研究难题，有人担心纯数学领域或许不再需要人类。一位与会学者就表达了对同行数学家心理状态的担忧。</p>



<p class="wp-block-paragraph">但也不必全然悲观。经验科学要比数学难自动化得多，因为数据采集本身就是慢功夫。卡内基梅隆大学计算机科学家蒂姆·代特默斯致力于让模型跑得更快更省，他的看法是：AI 科学家不会取代人类，反而能让人类科学家效率大增，去追求那些原本抽不出手的好点子。</p>



<p class="wp-block-paragraph">资源的约束反而催生韧性。正是训练不起尖端模型这一限制，逼着学者去寻找把模型做小、做高效的办法，甚至探索全新架构。倘若下一项重大突破不是出自巨头，而来自某个精打细算的大学实验室，恐怕没人会太意外。</p>



<p class="has-small-font-size wp-block-paragraph">来源：MIT Technology Review（2026 年 8 月 10 日，原载于周刊通讯 The Algorithm）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>MoE 训练卡在通信上，Cursor 开源解法提速 41%</title>
		<link>https://mylogs.cn/cursor-mixture-of-kittens-moe-megakernel/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 05 Aug 2026 05:01:59 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Cursor]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[大模型训练]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/cursor-mixture-of-kittens-moe-megakernel/</guid>

					<description><![CDATA[训练一个混合专家模型（MoE），最贵的往往不是算力本身，而是显卡之间来回搬运数据的那段时间。8 月 4 日，A [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">训练一个混合专家模型（MoE），最贵的往往不是算力本身，而是显卡之间来回搬运数据的那段时间。8 月 4 日，AI 编程工具公司 Cursor 旗下的研究团队开源了一套名为 Mixture-of-Kittens（简称 MoK）的训练超级内核，把这段一直被当成“损耗”的通信开销，硬生生压了下去。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54a0a2&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54a0a2" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header.webp" alt="MoE 训练卡在通信上，Cursor 开源解法提速 41%" class="wp-image-3629" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/156b11c4948922bee32dd074255a8dfe_header-768x403.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Cursor</figcaption></figure>





<h2 class="wp-block-heading">瓶颈不在算力，在搬运</h2>



<p class="wp-block-paragraph">Cursor 训练的是自家的智能体编程模型 Composer。团队在博客中写道，随着训练和推理规模不断放大，混合专家层始终是最主要的瓶颈——视工作负载和训练配置而定，这一层可以吃掉端到端训练时间的一半以上。</p>



<p class="wp-block-paragraph">原因在于 MoE 的工作方式。这类模型不会让每个 token 都走完整个网络，而是由一个路由器为它挑选少数几个“专家”子网络。省算力的代价是，专家权重被切分存放在不同显卡上，token 必须先被分发（dispatch）到持有对应专家的卡上算完，再被收回（combine）原处加权求和。通信耗时可能和计算本身一样长，两者若串行执行，效率极低。</p>



<p class="wp-block-paragraph">过去一年 Cursor 也写过自己的 MXFP8、NVFP4 训练算子和面向推理的“warp decode”方案，但那些工作只优化了计算部分，默认通信由别的库另行处理。到了生产环境，通信反而成了限制因素，于是团队决定从第一性原理出发，把整个 MoE 层连同通信一起重写。</p>



<h2 class="wp-block-heading">一个内核吞下所有环节</h2>



<p class="wp-block-paragraph">MoK 的做法是把 MoE 的全部通信与计算融进单一内核，并且保证完全确定性——同样的输入必定得到逐位一致的输出。它专为英伟达 GB300 NVL72 机架设计：72 张显卡处在同一个 NVLink 域内，为细粒度的计算通信重叠创造了条件；但同一机架里集成的 Grace 中央处理器相对偏慢，显卡很容易空转等它，因此内核必须尽量抹掉主机侧的工作与同步。</p>



<p class="wp-block-paragraph">团队的几项关键选择颇具反直觉色彩。业界惯例是用“推”（push）的方式散发 token，认为协议开销小、更能跑满链路；Cursor 的实测却发现，分发环节改用“拉”（pull）在专家负载不均时能把 NVLink 带宽利用率再提升最多 29%。更关键的是信令开销：推式分发要等最多 71 个对端的完成信号并刷新整个机架的内存，而拉式分发无需跨卡同步，微基准里两者延迟相差约 5.8 倍——103 微秒对 18 微秒。最终 MoK 选定了前向拉式分发、推式收回的组合。</p>



<p class="wp-block-paragraph">此外，内核用环形 token 缓冲区复用固定内存，免去主机每步重新计算和分配缓冲区；并把流式多处理器拆开，一部分做矩阵乘法，一部分继续搬数据。在 Blackwell 架构上，凑够 256 个 token 就足以触发一条完整的张量核心矩阵乘指令，于是下一批还在路上时，这一批已经开算。</p>



<h2 class="wp-block-heading">快了多少</h2>



<p class="wp-block-paragraph">在单个 MoE 层的对比测试中，MoK 的 MXFP8 前向吞吐最高达到最强公开基线的 2.37 倍。参与对比的是 NCCL 加 PyTorch、DeepEP 加 PyTorch、DeepEP 加 Transformer Engine，以及英伟达 HybridEP 加 Megatron 四套组合。</p>



<p class="wp-block-paragraph">更有说服力的是生产数据。在横跨多个 NVL72 机架、共 512 张显卡的真实训练栈上，端到端每秒处理的 token 数从此前基于 DeepEP 方案的 760.9 提升到 1070.2，相当于 1.41 倍。Cursor 表示，MoK 目前已经支撑着数万张显卡规模的 Composer 训练。</p>



<h2 class="wp-block-heading">谁会用得上</h2>



<p class="wp-block-paragraph">MoK 针对的是 DeepSeek-V3 式的 MoE 结构——一个共享专家加上数以百计的路由专家。Cursor 在文中直接点名，这一结构被 GLM、Qwen、Kimi（直到 K2.7）等开放权重模型广泛采用。换句话说，任何一家在 NVL72 机架上训练同类架构的团队，理论上都能直接受益。</p>



<p class="wp-block-paragraph">代码已按 Apache 2.0 协议发布在 GitHub 的 cursor/mixture-of-kittens 仓库。署名作者为 Stuart H. Sul、Nash Brown、Henry Wildermuth、William Lin 和 Federico Cassano。</p>



<p class="wp-block-paragraph">值得玩味的是发布者的身份：一家靠卖编程助手赚钱、不做芯片也不卖基础设施的应用层公司，公开了能从同一批硬件里多榨出四成吞吐的底层算子。这既说明模型训练成本对它已是实打实的支出项，也说明大规模训练的竞争，正越来越多地落在那些看不见的内核细节上。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Cursor 官方博客</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>显卡一天一个价：英伟达年内第三次涨价，幅度达30%</title>
		<link>https://mylogs.cn/%e6%98%be%e5%8d%a1%e4%b8%80%e5%a4%a9%e4%b8%80%e4%b8%aa%e4%bb%b7%ef%bc%9a%e8%8b%b1%e4%bc%9f%e8%be%be%e5%b9%b4%e5%86%85%e7%ac%ac%e4%b8%89%e6%ac%a1%e6%b6%a8%e4%bb%b7%ef%bc%8c%e5%b9%85%e5%ba%a6%e8%be%be30/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 30 Jul 2026 20:06:11 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[RTX 50系]]></category>
		<category><![CDATA[存储芯片]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[硬件涨价]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%98%be%e5%8d%a1%e4%b8%80%e5%a4%a9%e4%b8%80%e4%b8%aa%e4%bb%b7%ef%bc%9a%e8%8b%b1%e4%bc%9f%e8%be%be%e5%b9%b4%e5%86%85%e7%ac%ac%e4%b8%89%e6%ac%a1%e6%b6%a8%e4%bb%b7%ef%bc%8c%e5%b9%85%e5%ba%a6%e8%be%be30/</guid>

					<description><![CDATA[装机成本还在往上走。据 Eurogamer 报道，英伟达再次上调 GPU 售价，幅度在 20% 至 30% 之 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">装机成本还在往上走。据 Eurogamer 报道，英伟达再次上调 GPU 售价，幅度在 20% 至 30% 之间——这已是该公司今年第三次涨价。消息源自台湾《经济日报》，涨价的直接推手，依然是生成式 AI 投资热潮带来的硬件需求膨胀。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54b439&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54b439" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/8ab2a79c485d89af23657b261d2aafa3_header.webp" alt="显卡一天一个价：英伟达年内第三次涨价，幅度达30%" class="wp-image-2782" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/8ab2a79c485d89af23657b261d2aafa3_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/8ab2a79c485d89af23657b261d2aafa3_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/8ab2a79c485d89af23657b261d2aafa3_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/8ab2a79c485d89af23657b261d2aafa3_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Eurogamer</figcaption></figure>





<h2 class="wp-block-heading">这次不再只针对旗舰卡</h2>



<p class="wp-block-paragraph">值得注意的是，今年 5 月那轮涨价只波及 RTX 5090 等高端型号，其余产品线并未受影响。而这一次，调价覆盖了英伟达更广泛的在售产品。</p>



<p class="wp-block-paragraph">据硬件媒体 BenchLife 的报道，英伟达已再次向下游显卡制造商发出 GPU 套装（GPU 芯片加显存）涨价通知，核心原因是显存价格持续上涨。此轮调整同时涉及 GDDR7 与上一代 GDDR6，意味着除了采用 Blackwell 架构的多数 50 系显卡外，RTX 5050 乃至更早期的产品也难以幸免——包括近期以 2022 年原始建议零售价重回市场的 RTX 3060 12GB。</p>



<p class="wp-block-paragraph">更早的时间线是：今年 1 月，英伟达与 AMD 都曾因显存成本上调价格，幅度依规格不同大约在 10% 至 15%。</p>



<p class="wp-block-paragraph">涨价压力并非只来自 GPU 一侧。据报道，三星预计也将把 DRAM 价格上调约 20%。从芯片成本看，目前单颗 3GB GDDR7 芯片价格已涨至 60 至 70 美元，而标准 2GB 版本约为 20 美元——容量只多出 50%，成本却是三倍。</p>



<h2 class="wp-block-heading">传导到零售端：一天一个价</h2>



<p class="wp-block-paragraph">《经济日报》提到，涨价预期已经传导至零售渠道，部分电商平台因担心价格继续上行而不愿出货。</p>



<p class="wp-block-paragraph">中国内地市场的反应尤为直接。据央视财经报道，深圳华强北多家商户表示，受新一轮涨价通知影响，各大显卡品牌工厂已全面执行&#8221;封仓&#8221;政策，暂停对外批量出货，现货供给快速收紧。有商户介绍，通知下达后的两天内，涨幅已达 30% 左右：RTX 5070 去年零售价约 4500 至 5000 元，如今涨到 6000 至 6500 元；RTX 5080 去年均价约 8000 元，目前零售价接近 12000 元，&#8221;基本一天一个价，一天平均涨 500 到 1000 元&#8221;。</p>



<p class="wp-block-paragraph">以某国产品牌的 16GB GDDR7 版 RTX 5070 Ti 为例，一天之内价格就从 9299 元跳到 1.07 万元；而在今年 1 月涨价前，这款卡的定价约为 8000 元，去年 11 月更是 7200 元左右就能买到。</p>



<p class="wp-block-paragraph">被推高的不只是显卡。有商户表示，此前批发价 300 至 400 元的固态硬盘，现在已涨到 800 多元。原本打算花 12000 元装机的消费者，一周后发现同样配置要 14000 多元。行情剧变之下，商户已取消每日固定报价单，改为随行就市实时调价；不少人转向二手设备和旧机扩容维修，有维修门店的笔记本日均维修量达到 20 至 30 台，同比增长约 20%。</p>



<h2 class="wp-block-heading">根源仍在存储产能</h2>



<p class="wp-block-paragraph">供需失衡的源头指向存储。AI 服务器算力需求形成强大虹吸效应，三星、SK 海力士、美光等原厂将大量先进产能转向利润更高的 HBM 高带宽内存，消费级 DRAM 与 NAND 闪存产能被持续挤压。据集邦咨询数据，2026 年第一季度 DRAM 合约价环比涨幅超过 90%，NAND 闪存涨幅维持在 55% 至 90%。</p>



<p class="wp-block-paragraph">产业链下游同样叫苦。微星董事长徐祥此前表示，目前存储供货能见度很短，大约只有一个月，原厂每月才告知能交多少货，价格也不确定，导致报价和成本都难以精准把握。他预计今年消费类产品出货量将下滑 10% 至 20%，但单价反而提升。</p>



<p class="wp-block-paragraph">不过转折信号已经出现。TrendForce 最新数据显示，第三季度 DRAM 合约价环比跌幅预估已从 5% 扩大至 8% 至 13%，存储涨价周期的红利正在消退。只是从原厂报价传导到零售货架仍需时间，短期内高价行情恐怕难以明显回落。</p>



<p class="wp-block-paragraph">生成式 AI 带来的元器件涨价潮，影响面早已超出 PC。过去一年，Xbox Series X/S 与 PlayStation 5 均出现过价格上调。对普通玩家和办公用户而言，升级设备的门槛正变得越来越高。</p>



<p class="wp-block-paragraph">来源：Eurogamer（https://www.eurogamer.net/nvidia-gpu-price-rise-30-percent）、台湾《经济日报》、BenchLife、央视财经</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD正面挑战英伟达CUDA生态：AI芯片之战迎来关键转折点</title>
		<link>https://mylogs.cn/amd%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%becuda%e7%94%9f%e6%80%81%ef%bc%9aai%e8%8a%af%e7%89%87%e4%b9%8b%e6%88%98%e8%bf%8e%e6%9d%a5%e5%85%b3%e9%94%ae%e8%bd%ac%e6%8a%98%e7%82%b9/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 00:06:09 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[SemiAnalysis]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%becuda%e7%94%9f%e6%80%81%ef%bc%9aai%e8%8a%af%e7%89%87%e4%b9%8b%e6%88%98%e8%bf%8e%e6%9d%a5%e5%85%b3%e9%94%ae%e8%bd%ac%e6%8a%98%e7%82%b9/</guid>

					<description><![CDATA[过去几年，AI加速器市场几乎被英伟达一家独大。无论是训练大模型还是部署推理服务，CUDA生态系统像一道高墙，让 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去几年，AI加速器市场几乎被英伟达一家独大。无论是训练大模型还是部署推理服务，CUDA生态系统像一道高墙，让竞争对手难以逾越。但现在，这道墙正在出现裂缝。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54c72f&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54c72f" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header.webp" alt="AMD正面挑战英伟达CUDA生态：AI芯片之战迎来关键转折点" class="wp-image-1448" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-768x768.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">从&#8221;零机会&#8221;到&#8221;大有可为&#8221;</h2>



<p class="wp-block-paragraph">SemiAnalysis在一篇深度分析中指出，他们对AMD在AI加速器领域的判断经历了三次更新。最初，SemiAnalysis认为AMD在软件层面与英伟达的差距过于悬殊，给出了&#8221;0%机会&#8221;的悲观评价——当时AMD软件问题丛生，团队甚至连续数月成为AMD Bug报告最多的提交者。</p>



<p class="wp-block-paragraph">但六个月后，情况发生变化。SemiAnalysis观察到AMD有了真正推动变革的领导力，而非委员会式的决策模式。AMD CEO苏姿丰（Lisa Su）亲自与分析师沟通并采纳了多项建议，AMD软件团队的紧迫感明显增强。SemiAnalysis将评级从0%上调至&#8221;有一定机会&#8221;。</p>



<p class="wp-block-paragraph">到了2026年中，信号变得更加强烈。基于对AMD软件栈的深入体验，SemiAnalysis再次更新判断——只要AMD能解决两大关键风险，就有&#8221;很大机会&#8221;在AI加速器市场取得成功。</p>



<h2 class="wp-block-heading">Anthropic、微软、OpenAI纷纷转向AMD</h2>



<p class="wp-block-paragraph">重磅信号来自AMD的客户名单。Anthropic已公开宣布将部署2GW的AMD芯片，Anthropic计算主管Tom Brown甚至在周末用Claude的&#8221;/goal&#8221;功能在AMD硬件上完成了内部Claude推理栈的适配。</p>



<p class="wp-block-paragraph">更引人注目的是微软的转变。2023年，微软因HBM内存不可靠和软件质量差而放弃了AMD MI300X，并跳过了MI325X和MI355X两代产品。但2026年，微软180度转向，宣布将部署MI455X Helios系统。据SemiAnalysis分析，OpenAI将是Azure上MI455X机架的主要终端客户。</p>



<p class="wp-block-paragraph">AMD还在与Cerebras达成合作，采用类似英伟达-Groq交易策略，实现PD分离（Prefill-Decode Disaggregation）以提供超快速交互式推理。</p>



<h2 class="wp-block-heading">两大风险：产能爬坡与开发集群稳定性</h2>



<p class="wp-block-paragraph">尽管前景乐观，AMD仍面临两个严峻挑战。</p>



<p class="wp-block-paragraph">第一，Helios机架系统的产能爬坡遇到困难。由于AMD未采用无电缆托盘设计，加上SerDes设计较弱，每个机架高达85%的背板需要重定时（Retiming），需要超过550个博通以太网重定时器。背板可靠性问题正在拖累量产节奏。</p>



<p class="wp-block-paragraph">第二，内部GPU集群严重不足。AMD工程师最普遍的抱怨是缺乏稳定的GPU集群用于内部软件开发和自动化测试CI。这个问题正在阻碍AMD的进步速度——因为每个AI编码Agent本身也需要GPU才能运行和测试。</p>



<h2 class="wp-block-heading">竞争升级：从&#8221;GPU对决&#8221;到&#8221;平台对决&#8221;</h2>



<p class="wp-block-paragraph">英伟达自然不会坐视不理。其正从GPU供应商转型为全栈AI基础设施提供商，通过收购网络技术公司和扩展软件堆栈实现硬件、软件与互联的垂直整合。英伟达还通过推出AI CPU正式进军数据中心CPU市场，瞄准约2000亿美元潜在市场，直接挑战AMD的传统优势领域。</p>



<p class="wp-block-paragraph">但市场格局已经出现结构性变化。Gartner分析师指出，AI推理工作负载占比持续提升——2023年还是训练占2/3、推理占1/3，到2026年推理市场已增长至训练市场的2.16倍。推理占比越高，CUDA的生态锁定效应越弱，这对AMD更为有利。</p>



<p class="wp-block-paragraph">高盛已将AMD目标价从240美元上调至450美元，伯恩斯坦上调至525美元。整个AI芯片赛道的投资逻辑，正在从&#8221;追逐英伟达训练芯片的垄断红利&#8221;转向&#8221;布局多元算力兼容的新方向&#8221;。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<p class="wp-block-paragraph"><em>*文章来源：本文基于SemiAnalysis 2026年7月分析报告&#8221;Can AMD break the CUDA Moat? AMD Advancing AI 2026&#8243;改写，并综合Gate博客、雪球、同花顺等渠道信息补充。*</em></p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 正面挑战英伟达：CUDA 护城河正在失去意义？</title>
		<link>https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9acuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e6%ad%a3%e5%9c%a8%e5%a4%b1%e5%8e%bb%e6%84%8f%e4%b9%89%ef%bc%9f/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 25 Jul 2026 20:26:30 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9acuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e6%ad%a3%e5%9c%a8%e5%a4%b1%e5%8e%bb%e6%84%8f%e4%b9%89%ef%bc%9f/</guid>

					<description><![CDATA[英伟达凭借 CUDA 生态在 AI 芯片市场独占鳌头多年，这条&#8221;护城河&#8221;真的要凉了？在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">英伟达凭借 CUDA 生态在 AI 芯片市场独占鳌头多年，这条&#8221;护城河&#8221;真的要凉了？在 2026 年 7 月的 AMD Advancing AI 预简报会上，AMD 数据中心 GPU 业务集团副总裁兼总经理 Andrew Dieckman 给出了一个直白的判断：CUDA 这个词，已经不再是客户对话中的关键词了。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54d9db&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54d9db" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header.webp" alt="AMD 正面挑战英伟达：CUDA 护城河正在失去意义？" class="wp-image-1123" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-768x768.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">核心论点：编程抽象层正在上升</h2>



<p class="wp-block-paragraph">Dieckman 解释称，当前 AI 企业普遍在更高抽象层级进行编程，开发者通过各类推理服务框架完成模型部署，而非直接与 CUDA 等底层框架交互。在这一层级，开发者根本接触不到 CUDA，工具链会自动完成到硬件底层操作的转换。</p>



<p class="wp-block-paragraph">这意味着一个根本性的变化：当开发者不需要关心底层是什么芯片时，CUDA 的独占优势就被大幅削弱了。</p>



<p class="wp-block-paragraph">更值得注意的是，Dieckman 提到一个 2026 年才出现的新现象——AI 代理和模型本身已经开始帮助客户自动优化到 AMD 平台。换言之，当 AI 自己就能完成跨平台适配时，CUDA 的不可替代性将进一步被侵蚀。</p>



<h2 class="wp-block-heading">Anthropic 的震撼案例：AI 自举打破人力壁垒</h2>



<p class="wp-block-paragraph">AMD 并非空口放话。在 Advancing AI 大会上，Anthropic 联合创始人 Tom Brown 披露了一个极具冲击力的技术细节。</p>



<p class="wp-block-paragraph">Brown 表示，Anthropic 计划部署 2GW 的 AMD Helios 算力设施，明确青睐 MI355 芯片。但真正改写行业认知的，是适配过程本身。</p>



<p class="wp-block-paragraph">团队原本预期在新硬件上启动模型会是&#8221;一个大项目&#8221;。但实际体验截然不同：一名工程师让 Claude 执行适配任务后让流程在周末自行运转，周一便拿到了 Anthropic 领先模型在该硬件上&#8221;周末期间持续攀升&#8221;的实际性能曲线。</p>



<p class="wp-block-paragraph">市场观察者随即评论称：&#8221;我们已过了 CUDA 护城河时代。&#8221;</p>



<p class="wp-block-paragraph">当 AI 自身能够替代工程师完成硬件迁移中最昂贵的人力环节时，英伟达 CUDA 生态最根本的护城河——高昂的迁移成本——正在被 AI 从根基上侵蚀。</p>



<h2 class="wp-block-heading">来自腾讯新闻的分析：一场更深刻的产业变革</h2>



<p class="wp-block-paragraph">腾讯新闻的深度分析进一步揭示，AMD 的动作并非孤立事件。随着 AI 推理需求快速增长，市场正在从单一 GPU 计算模式走向更加多元化的芯片架构。英伟达 CEO 黄仁勋早已果断地用 200 亿美元获得了 Groq 的 LPU 技术和团队。</p>



<p class="wp-block-paragraph">真正可能改变英伟达长期优势的变量，并不是另一颗更强的 GPU，而是 AI 本身。在 AAI 2026 大会上，AMD 宣布与 OpenAI、Meta 和 Anthropic 等前沿 AI 公司建立大规模合作关系。其中与 Anthropic 的合作尤其具有标志性意义——Claude 将参与 AMD 硬件生态建设，包括优化 Instinct GPU 上的 AI 工作负载、推动 ROCm 软件平台发展。</p>



<p class="wp-block-paragraph">过去，CUDA 生态的优势来自硬件、软件和开发者之间长期形成的正反馈循环。但随着 AI 能力跃升，模型公司自身已成为基础设施创新的重要参与者，它们希望通过与不同硬件厂商合作，降低对单一计算平台的依赖。</p>



<h2 class="wp-block-heading">冷静看待：护城河不会一夜消失</h2>



<p class="wp-block-paragraph">当然，AMD 的判断带有明显的商业立场。即便 CUDA 对部分企业确实变得无关紧要，其他公司可能仍倾向于沿用已被验证的基础设施。AI 数据中心的投资规模动辄数亿美元，稳妥往往比省钱更重要。</p>



<p class="wp-block-paragraph">CUDA 是否真正失去护城河效应，取决于更高抽象层编程和 AI 代理自动优化能否成为行业主流，而非停留在少数前沿团队的实践中。但无论如何，2026 年 7 月这次 Advancing AI 大会传递的信号是明确的：AI 芯片市场的竞争规则，正在被 AI 自身重新书写。</p>



<p class="wp-block-paragraph">&#8212;</p>



<p class="wp-block-paragraph"><em>图片来源：AMD Newsroom 官方新闻稿</em></p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>微软自研AI模型全面上线：Bing、PowerPoint成本直降84%，告别对OpenAI的依赖</title>
		<link>https://mylogs.cn/%e5%be%ae%e8%bd%af%e8%87%aa%e7%a0%94ai%e6%a8%a1%e5%9e%8b%e5%85%a8%e9%9d%a2%e4%b8%8a%e7%ba%bf-bing-powerpoint%e6%88%90%e6%9c%ac%e7%9b%b4%e9%99%8d84-%e5%91%8a%e5%88%ab%e5%af%b9openai%e7%9a%84%e4%be%9d/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 25 Jul 2026 07:28:41 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI]]></category>
		<category><![CDATA[GPT-5.6]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[MAI]]></category>
		<category><![CDATA[OpenAI]]></category>
		<category><![CDATA[微软]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%be%ae%e8%bd%af%e8%87%aa%e7%a0%94ai%e6%a8%a1%e5%9e%8b%e5%85%a8%e9%9d%a2%e4%b8%8a%e7%ba%bf-bing-powerpoint%e6%88%90%e6%9c%ac%e7%9b%b4%e9%99%8d84-%e5%91%8a%e5%88%ab%e5%af%b9openai%e7%9a%84%e4%be%9d/</guid>

					<description><![CDATA[2026年7月23日，微软AI超级智能团队正式将两款自研模型——MAI-Image-2.5-Pro（高保真图像 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">2026年7月23日，微软AI超级智能团队正式将两款自研模型——<strong>MAI-Image-2.5-Pro</strong>（高保真图像生成）和**MAI-Voice-2-Flash**（企业级语音处理）——投入公开预览。这标志着微软在&#8221;自研模型驱动自家产品&#8221;的道路上迈出关键一步。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54ec00&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54ec00" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="800" height="448" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/1946a3d3bdb1f2466216180e9ce2604a_header.webp" alt="微软自研AI模型全面上线：Bing、PowerPoint成本直降84%，告别对OpenAI的依赖" class="wp-image-1005" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/1946a3d3bdb1f2466216180e9ce2604a_header.webp 800w, https://mylogs.cn/wp-content/uploads/2026/07/1946a3d3bdb1f2466216180e9ce2604a_header-300x168.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/1946a3d3bdb1f2466216180e9ce2604a_header-768x430.webp 768w" sizes="auto, (max-width: 800px) 100vw, 800px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：VentureBeat（AI生成配图）</figcaption></figure>




<h2 class="wp-block-heading">两个模型，两种定位</h2>


<p class="wp-block-paragraph">MAI-Image-2.5-Pro定位高端图像生成场景，定价为每百万文本输入token 5美元、每百万图像输入token 8美元、每百万图像输出token 106美元。它在Arena社区排行榜的图像编辑项目上已排名第二，广告巨头WPP全球首席创意官Rob Reilly评价该模型是&#8221;生成式媒体工具的一大飞跃&#8221;。</p>


<p class="wp-block-paragraph">MAI-Voice-2-Flash则走另一个方向：运行速度比MAI-Voice-2快一倍，成本低32%，定价每百万字符15美元。它瞄准的是呼叫中心、语音客服、实时语音应用这类对延迟和成本极为敏感的大规模场景。</p>


<h2 class="wp-block-heading">生产数据：GPU成本最高降89%</h2>


<p class="wp-block-paragraph">微软这次公布的部署数据，比模型本身更具冲击力。</p>


<p class="wp-block-paragraph">Bing Image Creator已全面切换至MAI-Image-2.5，这是该消费者级图像工具首次完全由自研模型驱动。在PowerPoint中，MAI-Image-2.5比OpenAI的GPT-Image-2节省高达84%的GPU成本。在OneDrive的关键图像编辑场景中，保存率提升26%，P95延迟降低约25%，中等负载下效率提升2.5倍。</p>


<p class="wp-block-paragraph">语音方面的数据同样亮眼。MAI-Voice-2-Flash已接入Dynamics 365 Contact Center——该平台服务于T-Mobile、EasyJet等客户——微软声称GPU成本最多降低89%。</p>


<h2 class="wp-block-heading">医疗场景：Dragon Copilot覆盖58种语言</h2>


<p class="wp-block-paragraph">在医疗领域，微软的Dragon Copilot已接入MAI-Transcribe-1.5模型。该系统目前服务17万名医疗提供者，上一季度处理了2800万次患者诊疗记录，支持58种语言的多语言工作流。微软称，在大多数语言中，转录和语言识别错误率均降低了50%——在转录错误可能直接影响临床记录的场景中，这一改进意义重大。</p>


<h2 class="wp-block-heading">战略转向：从&#8221;依赖OpenAI&#8221;到&#8221;微软产品由微软模型驱动&#8221;</h2>


<p class="wp-block-paragraph">&#8220;这些升级都指向同一个目标：微软产品，由微软模型驱动。&#8221;微软在其公告博客中写道。从Bing、PowerPoint、OneDrive到Excel、GitHub Copilot和Azure，7款核心产品已确认接入自研模型。</p>


<p class="wp-block-paragraph">对于企业客户而言，这释放了一个明确的信号：微软的自研模型已不再是实验室项目，而是服务于数百万用户的生产级基础设施。这场AI军备竞赛的竞争维度，正在从&#8221;谁的模型最强大&#8221;转向&#8221;谁的模型最经济、最适配&#8221;。</p>


<p class="wp-block-paragraph"><em>图片来源：VentureBeat（AI生成配图）</em></p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>英伟达掏出全场通吃新底牌：每一颗芯片都要装进AI数据中心</title>
		<link>https://mylogs.cn/%e8%8b%b1%e4%bc%9f%e8%be%be%e6%8e%8f%e5%87%ba%e5%85%a8%e5%9c%ba%e9%80%9a%e5%90%83%e6%96%b0%e5%ba%95%e7%89%8c%ef%bc%9a%e6%af%8f%e4%b8%80%e9%a2%97%e8%8a%af%e7%89%87%e9%83%bd%e8%a6%81%e8%a3%85%e8%bf%9bai/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 23 Jul 2026 04:00:03 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[CPU]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[VeraRubin]]></category>
		<category><![CDATA[数据中心]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e8%8b%b1%e4%bc%9f%e8%be%be%e6%8e%8f%e5%87%ba%e5%85%a8%e5%9c%ba%e9%80%9a%e5%90%83%e6%96%b0%e5%ba%95%e7%89%8c%ef%bc%9a%e6%af%8f%e4%b8%80%e9%a2%97%e8%8a%af%e7%89%87%e9%83%bd%e8%a6%81%e8%a3%85%e8%bf%9bai/</guid>

					<description><![CDATA[2026 年 7 月，英伟达在加州圣克拉拉总部为少数记者举办了一场闭门技术 workshop，主角是下一代 A [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">2026 年 7 月，英伟达在加州圣克拉拉总部为少数记者举办了一场闭门技术 workshop，主角是下一代 AI 基础设施平台——Vera Rubin。这次 workshop 选在竞争对手 AMD 年度产品大会（7 月 23 日于旧金山开幕）前一周举行，时机选择颇有意味。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a928ca54ffe1&quot;}" data-wp-interactive="core/image" data-wp-key="6a928ca54ffe1" class="wp-block-image size-full wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/c82c90fbcec89421a8c440ef3a040974_header.png" alt="英伟达AI数据中心液冷服务器机架" class="wp-image-8262"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>



<p class="wp-block-paragraph">Vera Rubin 的关键定位是：<strong>把 GPU 和 CPU 打包成一套完整的 AI 工厂</strong>。英伟达不再只想当 GPU 供应商，而是要把 AI 数据中心里从算力到调度的每一颗芯片都收入自己版图。</p>



<h2 class="wp-block-heading">一、配置与性能：算力翻倍、能耗降一档</h2>



<p class="wp-block-paragraph">Vera Rubin 是英伟达 Grace Blackwell 混合超算平台的继任者，单机架（NVL 72）配置为 <strong>36 颗 Vera CPU + 72 颗 Rubin GPU</strong>。英伟达高管在 workshop 上公布的几个核心数字是：</p>



<ul class="wp-block-list"><ul class="wp-block-list"></ul>



<p class="wp-block-paragraph"><li><strong>每瓦特 token 处理量是 Grace Blackwell 的 10 倍</strong></li></p>



<p class="wp-block-paragraph"><li><strong>内存带宽接近 Blackwell 的 3 倍</strong></li></p>



<p class="wp-block-paragraph"><li>100% 全液冷，可减少芯片散热能耗</li></p>



<p class="wp-block-paragraph"><li>取消机架间线缆，英伟达称之为&#8221;无缆计算&#8221;和&#8221;热插拔&#8221;</li></p>



<p class="wp-block-paragraph"></ul></p>



<p class="wp-block-paragraph">实际效果是：机架部署时间从此前的数小时压缩到几分钟，对大规模数据中心部署来说意义重大——目前 AI 算力瓶颈已经从买不到 GPU 转移到装不上、调试慢。</p>



<h2 class="wp-block-heading">二、为什么英伟达要做 CPU</h2>



<p class="wp-block-paragraph">长期以来 CPU 是英伟达的弱项，市场被 AMD 和 Intel 占据。但 AI 正在改变格局：随着智能体（agentic AI）系统变多，CPU 承担了数据流调度、网络通信、软件协同等关键角色，需求量大幅上升。</p>



<p class="wp-block-paragraph">英伟达给出的答案是 <strong>Vera CPU</strong>——一颗采用单芯片（monolithic）设计、放弃 chiplet 架构的 ARM 处理器。Nvidia CPU 产品营销负责人 Hannah Coutand 解释：把多个 chiplet 拼装在一起，会给内存带宽和数据搬运带来沉重税负；单芯片设计让数据在一颗集成电路上移动得更快。</p>



<p class="wp-block-paragraph">Nvidia 加速计算副总裁、CUDA 架构之父 Ian Buck 更直接：在硅谷，要么创新，要么死。我们不只是要做 GPU，还要把 CPU 一起卷。</p>



<p class="wp-block-paragraph">值得注意的是，Vera CPU 不仅内嵌在 Vera Rubin 机架中，也作为独立产品对外销售——据报道英伟达已告知中国客户，最快今年 8 月就能拿到。</p>



<h2 class="wp-block-heading">三、首批客户与竞争格局</h2>



<p class="wp-block-paragraph">英伟达已经确认的 Vera Rubin 早期客户包括 <strong>Microsoft、OpenAI、Oracle</strong>。其中 OpenAI 已经率先部署了一台 Vera Rubin 机架，正在生产环境试用。</p>



<p class="wp-block-paragraph">竞争对手方面，AMD 将在本周的年度会议上推出对标的 <strong>Helios AI 机架</strong>，意图从英伟达嘴里抢走大客户。AMD 近年在数据中心 CPU 市场份额上增长明显，x86 架构加上 chiplet 设计仍是其招牌。</p>



<h2 class="wp-block-heading">四、给市场释放的信号</h2>



<p class="wp-block-paragraph">英伟达这次强力推 Vera Rubin，背景之一是上一代 <strong>Blackwell 芯片曾因机架过热问题</strong>被迫改设计、推迟发货，市场对英伟达能否按节奏交付新平台存在疑虑。黄仁勋反复强调 Vera Rubin 正在全面量产，下半年发货——这次 workshop 也是在反复对市场喊话：节奏没乱，产能稳得住。</p>



<p class="wp-block-paragraph">更深层的信号是：当竞争对手在 AI 加速器市场追赶时，英伟达选择把战场从 GPU 单独比拼升级到整套 AI 基础设施比拼。卖铲子不够，还要把铲子、矿场、调度员都包给客户。</p>



<p class="wp-block-paragraph">据英伟达高管透露，公司正在与多家日本企业合作开发机器人 AI；黄仁勋本人上周在 Computex 台北展上带回的台湾小吃也堆在执行简报中心办公室——英伟达的全球 AI 算力生态，正以肉眼可见的速度扩张。</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
