<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>CUDA &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/cuda/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 13:04:05 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>让Codex自己跑实验：他把GPU内核性能提升了232倍</title>
		<link>https://mylogs.cn/codex-auto-research-232x-kernel/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 13:03:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[Codex]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[内核优化]]></category>
		<category><![CDATA[矩阵分解]]></category>
		<category><![CDATA[自动研究]]></category>
		<guid isPermaLink="false">https://mylogs.cn/codex-auto-research-232x-kernel/</guid>

					<description><![CDATA[让 Codex 自己跑实验：他把 GPU 内核性能提升了 232 倍 在 GPU Mode 与 Core Au [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">让 Codex 自己跑实验：他把 GPU 内核性能提升了 232 倍</h2>



<p class="wp-block-paragraph">在 GPU Mode 与 Core Automation 联合举办的一场「自动研究」主题编程竞赛里，一名开发者借助 OpenAI 的 Codex 编程智能体，把一道 CUDA 矩阵分解内核的运行效率提升到基准方案的 232 倍，在 183 名参赛者中位列第 12。整篇复盘没有停留在「调参玄学」，而是把「让 AI 替你做研究、自己跑实验」的工作方式拆解得相当具体。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1ba83&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1ba83" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="821" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header.webp" alt="让Codex自己跑实验：他把GPU内核性能提升了232倍" class="wp-image-4974" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-300x205.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-1024x701.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/84f1b2fbe9ea8b6f851031c05cab1c1a_header-768x525.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">赛题：给张量核心喂饱矩阵乘法</h2>



<p class="wp-block-paragraph">竞赛的要求是实现批量方阵的紧凑 Householder QR 分解，输出格式需与 PyTorch 的 <code>torch.geqrf</code> 一致。QR 分解把矩阵拆成正交矩阵 Q 与上三角矩阵 R，是许多线性代数与优化器的底层算子。难点在于，标准的 Householder QR 是「一列一列串行」地清零下三角，串行部分只能跑在 SM 的慢速向量单元上，而昂贵的张量核心只能干等。</p>



<p class="wp-block-paragraph">该作者的突破口是经典的「分块 Householder + WY 表示」：先在一个窄面板内完成串行工作，再把面板的多个反射子压缩成一次秩-b 更新，用三次连续的矩阵乘法（GEMM）一次性覆盖后方的主块。这样串行工作量被锁在窄面板里，其余部分全部变成张量核心最擅长的 GEMM 形状。测试覆盖的矩阵规模从 512×512 一直到 4096，批量大小跨度很大，最大的矩阵批量太少填不满张量核心，最小的 32 阶又得把多份矩阵塞进同一次内核启动。</p>



<h2 class="wp-block-heading">自动研究：把未知未知变成已知未知</h2>



<p class="wp-block-paragraph">更值得借鉴的是人机协作的方法论。作者坦承自己只是「有一年的 GPU 内核优化基础、并非专业人士」，在排行榜上属于逆风开局——排在他前面的人里有英伟达的首席工程师。他的体会是：对问题理解得越透，给大模型的提示词就越精准，本质是「把未知未知转化成已知未知」。他先用 Claude 补 QR 分解与 Householder 反射的直觉，确认主干架构必须走分块 Householder 配合尾部 WY 更新；GPT-5.5 在这一架构上也给出了同样的判断。</p>



<p class="wp-block-paragraph">在 14 天里，他提交了超过 1500 次方案。竞赛提供的命令行工具让智能体能直接测试、跑分并提交排行榜，形状级别的反馈加上整体几何平均耗时，构成了一个让智能体不断「爬山」的紧凑循环。他还利用低精度（FP16、FP8、NVFP4）在内部加速，同时保证返回的因子仍通过 FP32 级别的 QR 校验。工具链上，他使用 ChatGPT Pro（每月 200 美元）与 Claude Pro（每月 20 美元）两套订阅，并用 Modal 提供的每月 30 美元免费额度做性能剖析，Codex 的 <code>/compaction</code> 等功能则用来维持长程上下文。</p>



<h2 class="wp-block-heading">对开发者的启示</h2>



<p class="wp-block-paragraph">这则案例的价值，不在于「232 倍」这个炫目的数字，而在于它展示了一种新的工程范式：当反馈循环足够紧凑、可自动评测时，编程智能体可以代替人完成大量试错，而人类的作用退化为「提对问题」与「判断方向」。对于日常做性能优化的工程师，文章也直言不讳地指出可改进之处——例如更早引入更系统的低精度策略、把更多形状纳入回归测试。自动研究不会取代领域知识，但确实把「懂一点」和「完全不懂」之间的差距，压缩得比过去小得多。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Hacker News（原文出自 sankalp 个人博客，作者 sankalp）</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>10小时复刻CUDA，英伟达护城河松了</title>
		<link>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/</link>
					<comments>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 13:48:04 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI推理]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[开源生态]]></category>
		<category><![CDATA[编码智能体]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/</guid>

					<description><![CDATA[你可能一直以为英伟达最难被追上的是芯片，其实真正的壁垒是 CUDA 这层软件。现在有人用编码智能体，花了大约1 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你可能一直以为英伟达最难被追上的是芯片，其实真正的壁垒是 CUDA 这层软件。现在有人用编码智能体，花了大约10小时就把它复刻了一遍。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1c559&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1c559" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="868" height="488" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/cuda_header.webp" alt="10小时复刻CUDA，英伟达护城河松了" class="wp-image-3540" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/cuda_header.webp 868w, https://mylogs.cn/wp-content/uploads/2026/08/cuda_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/cuda_header-768x432.webp 768w" sizes="(max-width: 868px) 100vw, 868px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Next Web</figcaption></figure>





<p class="wp-block-paragraph">前谷歌大脑研究员杰里米·尼克松创办的初创公司 Infinity，用人工智能编码智能体为芯片公司 D-Matrix 重建了一套 CUDA 级别的软件栈，耗时约10小时。他对《商业内幕》说，这说明英伟达最重要的护城河之一正在被跨过去。</p>



<p class="wp-block-paragraph">CUDA 全称统一计算设备架构，由英伟达高管伊恩·巴克主导、打磨了近二十年，里面打包了现成代码库和调试工具，还能让成千上万块芯片协同训练一个模型。它更硬的是第二重壁垒：各家公司在上面堆了数百万行代码和工作流，换芯片就得重写。亚马逊的内部文件曾把 CUDA 列为自研 Trainium、Inferentia 芯片落地的主要障碍。深度求索创始人梁文锋也提过，编码智能体加上自研的 TileLang 语言，让搭建这类软件容易了很多。</p>



<p class="wp-block-paragraph">压力还来自另一头——行业重心正从训练模型转向跑模型。韩国芯片创企 Rebellions 的马歇尔·崔说得直接：在推理这边，「CUDA 已经不再是一个因素」，那是开源的战场。英伟达开发者生态副总裁安基特·帕特尔则回应，公司自己也在用编码智能体加速 CUDA 开发和验证，而且越往落地走，全栈优化的价值越大。</p>



<p class="wp-block-paragraph">我的判断是，护城河不会消失，只会挪个位置。曾把上一家芯片软件公司卖给英伟达的徐冰（Bing Xu）说得实在：智能体能在短时间里生成一大堆代码，但验证才是最大的瓶颈。Modular 的克里斯·拉特纳更不客气，说这波炒作「非常过头」——写代码只是造软件的一小部分，难的是把它调到能上生产环境。</p>



<p class="wp-block-paragraph">下一轮竞争，你赌生成速度，还是赌验证能力？</p>



<p class="has-small-font-size wp-block-paragraph">来源：Business Insider 报道，综合 The Next Web 整理</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/ai-coding-agents-challenge-nvidia-cuda-moat/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>AMD正面挑战英伟达CUDA生态：AI芯片之战迎来关键转折点</title>
		<link>https://mylogs.cn/amd%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%becuda%e7%94%9f%e6%80%81%ef%bc%9aai%e8%8a%af%e7%89%87%e4%b9%8b%e6%88%98%e8%bf%8e%e6%9d%a5%e5%85%b3%e9%94%ae%e8%bd%ac%e6%8a%98%e7%82%b9/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 27 Jul 2026 00:06:09 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[SemiAnalysis]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%becuda%e7%94%9f%e6%80%81%ef%bc%9aai%e8%8a%af%e7%89%87%e4%b9%8b%e6%88%98%e8%bf%8e%e6%9d%a5%e5%85%b3%e9%94%ae%e8%bd%ac%e6%8a%98%e7%82%b9/</guid>

					<description><![CDATA[过去几年，AI加速器市场几乎被英伟达一家独大。无论是训练大模型还是部署推理服务，CUDA生态系统像一道高墙，让 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">过去几年，AI加速器市场几乎被英伟达一家独大。无论是训练大模型还是部署推理服务，CUDA生态系统像一道高墙，让竞争对手难以逾越。但现在，这道墙正在出现裂缝。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1d15a&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1d15a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header.webp" alt="AMD正面挑战英伟达CUDA生态：AI芯片之战迎来关键转折点" class="wp-image-1448" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/07/f6959b3f7cb8356244eae3d90a52b296_header-768x768.webp 768w" sizes="(max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">从&#8221;零机会&#8221;到&#8221;大有可为&#8221;</h2>



<p class="wp-block-paragraph">SemiAnalysis在一篇深度分析中指出，他们对AMD在AI加速器领域的判断经历了三次更新。最初，SemiAnalysis认为AMD在软件层面与英伟达的差距过于悬殊，给出了&#8221;0%机会&#8221;的悲观评价——当时AMD软件问题丛生，团队甚至连续数月成为AMD Bug报告最多的提交者。</p>



<p class="wp-block-paragraph">但六个月后，情况发生变化。SemiAnalysis观察到AMD有了真正推动变革的领导力，而非委员会式的决策模式。AMD CEO苏姿丰（Lisa Su）亲自与分析师沟通并采纳了多项建议，AMD软件团队的紧迫感明显增强。SemiAnalysis将评级从0%上调至&#8221;有一定机会&#8221;。</p>



<p class="wp-block-paragraph">到了2026年中，信号变得更加强烈。基于对AMD软件栈的深入体验，SemiAnalysis再次更新判断——只要AMD能解决两大关键风险，就有&#8221;很大机会&#8221;在AI加速器市场取得成功。</p>



<h2 class="wp-block-heading">Anthropic、微软、OpenAI纷纷转向AMD</h2>



<p class="wp-block-paragraph">重磅信号来自AMD的客户名单。Anthropic已公开宣布将部署2GW的AMD芯片，Anthropic计算主管Tom Brown甚至在周末用Claude的&#8221;/goal&#8221;功能在AMD硬件上完成了内部Claude推理栈的适配。</p>



<p class="wp-block-paragraph">更引人注目的是微软的转变。2023年，微软因HBM内存不可靠和软件质量差而放弃了AMD MI300X，并跳过了MI325X和MI355X两代产品。但2026年，微软180度转向，宣布将部署MI455X Helios系统。据SemiAnalysis分析，OpenAI将是Azure上MI455X机架的主要终端客户。</p>



<p class="wp-block-paragraph">AMD还在与Cerebras达成合作，采用类似英伟达-Groq交易策略，实现PD分离（Prefill-Decode Disaggregation）以提供超快速交互式推理。</p>



<h2 class="wp-block-heading">两大风险：产能爬坡与开发集群稳定性</h2>



<p class="wp-block-paragraph">尽管前景乐观，AMD仍面临两个严峻挑战。</p>



<p class="wp-block-paragraph">第一，Helios机架系统的产能爬坡遇到困难。由于AMD未采用无电缆托盘设计，加上SerDes设计较弱，每个机架高达85%的背板需要重定时（Retiming），需要超过550个博通以太网重定时器。背板可靠性问题正在拖累量产节奏。</p>



<p class="wp-block-paragraph">第二，内部GPU集群严重不足。AMD工程师最普遍的抱怨是缺乏稳定的GPU集群用于内部软件开发和自动化测试CI。这个问题正在阻碍AMD的进步速度——因为每个AI编码Agent本身也需要GPU才能运行和测试。</p>



<h2 class="wp-block-heading">竞争升级：从&#8221;GPU对决&#8221;到&#8221;平台对决&#8221;</h2>



<p class="wp-block-paragraph">英伟达自然不会坐视不理。其正从GPU供应商转型为全栈AI基础设施提供商，通过收购网络技术公司和扩展软件堆栈实现硬件、软件与互联的垂直整合。英伟达还通过推出AI CPU正式进军数据中心CPU市场，瞄准约2000亿美元潜在市场，直接挑战AMD的传统优势领域。</p>



<p class="wp-block-paragraph">但市场格局已经出现结构性变化。Gartner分析师指出，AI推理工作负载占比持续提升——2023年还是训练占2/3、推理占1/3，到2026年推理市场已增长至训练市场的2.16倍。推理占比越高，CUDA的生态锁定效应越弱，这对AMD更为有利。</p>



<p class="wp-block-paragraph">高盛已将AMD目标价从240美元上调至450美元，伯恩斯坦上调至525美元。整个AI芯片赛道的投资逻辑，正在从&#8221;追逐英伟达训练芯片的垄断红利&#8221;转向&#8221;布局多元算力兼容的新方向&#8221;。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<p class="wp-block-paragraph"><em>*文章来源：本文基于SemiAnalysis 2026年7月分析报告&#8221;Can AMD break the CUDA Moat? AMD Advancing AI 2026&#8243;改写，并综合Gate博客、雪球、同花顺等渠道信息补充。*</em></p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD正面挑战英伟达CUDA生态：Anthropic联手AI能否撬动算力护城河</title>
		<link>https://mylogs.cn/amd-vs-nvidia-cuda-moat-ai-chip-2026/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sun, 26 Jul 2026 15:45:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[Helios]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-vs-nvidia-cuda-moat-ai-chip-2026/</guid>

					<description><![CDATA[AMD正面挑战英伟达CUDA生态：Anthropic联手AI能否撬动算力护城河 性能比肩英伟达、AI充当迁移工 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h1 class="wp-block-heading">AMD正面挑战英伟达CUDA生态：Anthropic联手AI能否撬动算力护城河</h1>



<h2 class="wp-block-heading">性能比肩英伟达、AI充当迁移工具：AMD正在撬动CUDA护城河</h2>



<p class="wp-block-paragraph">长期以来，&#8221;CUDA护城河&#8221;一直是英伟达最坚固的壁垒——不是GPU性能本身，而是围绕CUDA积累的庞大软件生态、开发者习惯和十余年的优化经验。AMD在2026年的一系列动作表明，这条护城河正在被从多个方向同时侵蚀。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1df8b&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1df8b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="640" height="330" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/260fa1bbd006c857f14382d8fc5bc47c_header.webp" alt="AMD正面挑战英伟达CUDA生态" class="wp-image-1355" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/260fa1bbd006c857f14382d8fc5bc47c_header.webp 640w, https://mylogs.cn/wp-content/uploads/2026/07/260fa1bbd006c857f14382d8fc5bc47c_header-300x155.webp 300w" sizes="auto, (max-width: 640px) 100vw, 640px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：腾讯新闻/AMD</figcaption></figure>





<p class="wp-block-paragraph">### 性能层面：Helios与英伟达&#8221;已不相上下&#8221;</p>



<p class="wp-block-paragraph">AMD在今年推出的Helios机架级系统是其挑战英伟达最硬件的筹码。Counterpoint Research分析师Neil Shah的评价格外直接： <strong>&#8220;Helios在GPU和CPU层面与英伟达已不相上下。&#8221;</strong></p>



<p class="wp-block-paragraph">AMD官方数据显示，全球十大AI巨头中有8家正在使用AMD Instinct系列GPU运行业务，客户包括OpenAI、Cohere，以及马斯克旗下SpaceX的人工智能部门。2026年2月，Meta宣布将分批上线总规模最高6吉瓦的AMD算力集群，首期1吉瓦依托Helios机架落地。OpenAI和甲骨文也敲定了今年大规模部署Helios的计划。</p>



<p class="wp-block-paragraph">从财务数据来看，2026年第一季度，数据中心业务已占AMD营收的大部分，同比增长57%。AMD CEO苏姿丰此前表示，对在2027年实现数百亿美元数据中心AI年收入有信心。</p>



<p class="wp-block-paragraph">### 生态层面：Anthropic与AMD的深度协同</p>



<p class="wp-block-paragraph">真正可能改变英伟达长期优势的变量，并不是另一颗更强的GPU，而是AI本身。</p>



<p class="wp-block-paragraph">在2026年6月的AAI大会上，AMD宣布与OpenAI、Meta和Anthropic等前沿AI公司建立大规模合作关系。其中与Anthropic的合作尤其具有标志性意义——这并非一次简单的GPU采购，而是一次深度协同创新。Claude将参与AMD硬件生态建设，包括优化Instinct GPU上的AI工作负载、推动ROCm软件平台发展；同时，AMD也将在工程研发和产品开发流程中广泛采用Claude。</p>



<p class="wp-block-paragraph">Anthropic联合创始人Tom Brown在大会上分享了一个震撼案例：当AMD提供服务器进行测试时，团队原本预计适配会是一个&#8221;大工程&#8221;。结果一名工程师让Claude参与环境搭建和优化迭代，经过一个周末，团队就获得了主力模型在AMD硬件上的实际性能曲线。</p>



<p class="wp-block-paragraph"><strong>核心逻辑正在改变：</strong> 如果AI可以写代码，AI本身就可能成为跨硬件生态的软件迁移工具。过去，开发者不愿意离开CUDA是因为迁移成本太高；现在，AI可以帮助自动完成这种迁移。</p>



<p class="wp-block-paragraph">### 战略层面：苏姿丰押注中国市场</p>



<p class="wp-block-paragraph">苏姿丰的战略眼光不止于硬件性能的追赶，她还做出了一项关键决策——押注中国。</p>



<p class="wp-block-paragraph">中国市场的吸引力在于：这里有大量还没有被CUDA锁住的新客户，有成熟的移动互联网消费习惯，对价格敏感且技术中立。2026年，两个条件第一次同时成立：英伟达高端GPU供给变得不确定，AMD则将4000人的中国研发团队推到了前台。</p>



<p class="wp-block-paragraph">AMD在中国的打法也与CUDA完全不同：CUDA是封闭的，英伟达说了算；ROCm是开源的，AMD用&#8221;和你一起建生态&#8221;的姿态切入。AMD在中国建设了四个AI卓越中心，工程师可以直接坐进阿里、字节、月之暗面的办公室解决具体问题。</p>



<p class="wp-block-paragraph">### 差距犹存，但趋势已经改变</p>



<p class="wp-block-paragraph">Counterpoint的Shah也坦承，CUDA生态经过长年沉淀，壁垒深厚，英伟达在软件层面依旧大幅领先AMD。ROCm软件适配成熟度弱于CUDA，第三方工具链支持覆盖面不足。SemiAnalysis的深度分析也指出，AMD的许多优化仍然停留在&#8221;单节点&#8221;层面，而市场已经进入分布式推理和更宽专家并行配置的时代。</p>



<p class="wp-block-paragraph">但趋势已经明显改变：AI计算正在从单一GPU模式走向多元化芯片架构。云端Token推理价格随着竞争加剧持续下行，AMD正在从&#8221;单卡供货商&#8221;升级为&#8221;全栈方案提供商&#8221;。对于开发者而言，CUDA不再是唯一的选择——这个事实本身，就已经是英伟达护城河出现裂缝的最好证明。</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 正面挑战英伟达：CUDA 护城河正在失去意义？</title>
		<link>https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9acuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e6%ad%a3%e5%9c%a8%e5%a4%b1%e5%8e%bb%e6%84%8f%e4%b9%89%ef%bc%9f/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 25 Jul 2026 20:26:30 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[GPU]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e6%8c%91%e6%88%98%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9acuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e6%ad%a3%e5%9c%a8%e5%a4%b1%e5%8e%bb%e6%84%8f%e4%b9%89%ef%bc%9f/</guid>

					<description><![CDATA[英伟达凭借 CUDA 生态在 AI 芯片市场独占鳌头多年，这条&#8221;护城河&#8221;真的要凉了？在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">英伟达凭借 CUDA 生态在 AI 芯片市场独占鳌头多年，这条&#8221;护城河&#8221;真的要凉了？在 2026 年 7 月的 AMD Advancing AI 预简报会上，AMD 数据中心 GPU 业务集团副总裁兼总经理 Andrew Dieckman 给出了一个直白的判断：CUDA 这个词，已经不再是客户对话中的关键词了。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1ed63&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1ed63" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1024" height="1024" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header.webp" alt="AMD 正面挑战英伟达：CUDA 护城河正在失去意义？" class="wp-image-1123" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-300x300.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-150x150.webp 150w, https://mylogs.cn/wp-content/uploads/2026/07/6bfef867237c3ca49942e8efbcd5c847_header-768x768.webp 768w" sizes="auto, (max-width: 1024px) 100vw, 1024px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">AI生成配图</figcaption></figure>





<h2 class="wp-block-heading">核心论点：编程抽象层正在上升</h2>



<p class="wp-block-paragraph">Dieckman 解释称，当前 AI 企业普遍在更高抽象层级进行编程，开发者通过各类推理服务框架完成模型部署，而非直接与 CUDA 等底层框架交互。在这一层级，开发者根本接触不到 CUDA，工具链会自动完成到硬件底层操作的转换。</p>



<p class="wp-block-paragraph">这意味着一个根本性的变化：当开发者不需要关心底层是什么芯片时，CUDA 的独占优势就被大幅削弱了。</p>



<p class="wp-block-paragraph">更值得注意的是，Dieckman 提到一个 2026 年才出现的新现象——AI 代理和模型本身已经开始帮助客户自动优化到 AMD 平台。换言之，当 AI 自己就能完成跨平台适配时，CUDA 的不可替代性将进一步被侵蚀。</p>



<h2 class="wp-block-heading">Anthropic 的震撼案例：AI 自举打破人力壁垒</h2>



<p class="wp-block-paragraph">AMD 并非空口放话。在 Advancing AI 大会上，Anthropic 联合创始人 Tom Brown 披露了一个极具冲击力的技术细节。</p>



<p class="wp-block-paragraph">Brown 表示，Anthropic 计划部署 2GW 的 AMD Helios 算力设施，明确青睐 MI355 芯片。但真正改写行业认知的，是适配过程本身。</p>



<p class="wp-block-paragraph">团队原本预期在新硬件上启动模型会是&#8221;一个大项目&#8221;。但实际体验截然不同：一名工程师让 Claude 执行适配任务后让流程在周末自行运转，周一便拿到了 Anthropic 领先模型在该硬件上&#8221;周末期间持续攀升&#8221;的实际性能曲线。</p>



<p class="wp-block-paragraph">市场观察者随即评论称：&#8221;我们已过了 CUDA 护城河时代。&#8221;</p>



<p class="wp-block-paragraph">当 AI 自身能够替代工程师完成硬件迁移中最昂贵的人力环节时，英伟达 CUDA 生态最根本的护城河——高昂的迁移成本——正在被 AI 从根基上侵蚀。</p>



<h2 class="wp-block-heading">来自腾讯新闻的分析：一场更深刻的产业变革</h2>



<p class="wp-block-paragraph">腾讯新闻的深度分析进一步揭示，AMD 的动作并非孤立事件。随着 AI 推理需求快速增长，市场正在从单一 GPU 计算模式走向更加多元化的芯片架构。英伟达 CEO 黄仁勋早已果断地用 200 亿美元获得了 Groq 的 LPU 技术和团队。</p>



<p class="wp-block-paragraph">真正可能改变英伟达长期优势的变量，并不是另一颗更强的 GPU，而是 AI 本身。在 AAI 2026 大会上，AMD 宣布与 OpenAI、Meta 和 Anthropic 等前沿 AI 公司建立大规模合作关系。其中与 Anthropic 的合作尤其具有标志性意义——Claude 将参与 AMD 硬件生态建设，包括优化 Instinct GPU 上的 AI 工作负载、推动 ROCm 软件平台发展。</p>



<p class="wp-block-paragraph">过去，CUDA 生态的优势来自硬件、软件和开发者之间长期形成的正反馈循环。但随着 AI 能力跃升，模型公司自身已成为基础设施创新的重要参与者，它们希望通过与不同硬件厂商合作，降低对单一计算平台的依赖。</p>



<h2 class="wp-block-heading">冷静看待：护城河不会一夜消失</h2>



<p class="wp-block-paragraph">当然，AMD 的判断带有明显的商业立场。即便 CUDA 对部分企业确实变得无关紧要，其他公司可能仍倾向于沿用已被验证的基础设施。AI 数据中心的投资规模动辄数亿美元，稳妥往往比省钱更重要。</p>



<p class="wp-block-paragraph">CUDA 是否真正失去护城河效应，取决于更高抽象层编程和 AI 代理自动优化能否成为行业主流，而非停留在少数前沿团队的实践中。但无论如何，2026 年 7 月这次 Advancing AI 大会传递的信号是明确的：AI 芯片市场的竞争规则，正在被 AI 自身重新书写。</p>



<p class="wp-block-paragraph">&#8212;</p>



<p class="wp-block-paragraph"><em>图片来源：AMD Newsroom 官方新闻稿</em></p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>AMD 正面硬刚英伟达：Anthropic 2GW 部署落地，CUDA 护城河被动摇</title>
		<link>https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e7%a1%ac%e5%88%9a%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9aanthropic-2gw-%e9%83%a8%e7%bd%b2%e8%90%bd%e5%9c%b0%ef%bc%8ccuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e8%a2%ab%e5%8a%a8%e6%91%87/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 25 Jul 2026 18:26:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI芯片]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[CUDA]]></category>
		<category><![CDATA[ROCm]]></category>
		<category><![CDATA[算力]]></category>
		<category><![CDATA[英伟达]]></category>
		<guid isPermaLink="false">https://mylogs.cn/amd-%e6%ad%a3%e9%9d%a2%e7%a1%ac%e5%88%9a%e8%8b%b1%e4%bc%9f%e8%be%be%ef%bc%9aanthropic-2gw-%e9%83%a8%e7%bd%b2%e8%90%bd%e5%9c%b0%ef%bc%8ccuda-%e6%8a%a4%e5%9f%8e%e6%b2%b3%e8%a2%ab%e5%8a%a8%e6%91%87/</guid>

					<description><![CDATA[7 月 22 日至 23 日，AMD 在旧金山举办的 Advancing AI 2026 大会上释放了一连串重 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">7 月 22 日至 23 日，AMD 在旧金山举办的 Advancing AI 2026 大会上释放了一连串重磅消息。这不仅仅是一次产品发布会，更像是 AMD 向英伟达发起的一次全面宣战。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8090be1fdd1&quot;}" data-wp-interactive="core/image" data-wp-key="6a8090be1fdd1" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="675" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/amd_advancing_ai_2026_header.webp" alt="AMD 正面硬刚英伟达：Anthropic 2GW 部署落地，CUDA 护城河被动摇" class="wp-image-1095" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/amd_advancing_ai_2026_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/amd_advancing_ai_2026_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/amd_advancing_ai_2026_header-1024x576.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/amd_advancing_ai_2026_header-768x432.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：AMD Newsroom</figcaption></figure>





<h2 class="wp-block-heading">Anthropic 成为关键变量</h2>



<p class="wp-block-paragraph">大会最受关注的消息来自 AI 巨头 Anthropic。该公司计算主管 Tom Brown 在会上亲自宣布，Anthropic 计划部署高达 <strong>2GW 的 AMD Instinct MI455X GPU</strong>（采用 AMD Helios 机架方案），首期 1GW 将于 2027 年上半年上线。</p>



<p class="wp-block-paragraph">这不是象征性的&#8221;备胎&#8221;采购。2GW 的部署规模意味着 AMD 芯片正式进入了 Anthropic 算力体系的核心层级。双方还启动了多年工程合作——AMD 承诺向 Anthropic 进行最高 <strong>50 亿美元的战略股权投资</strong>，同时全面采用 Claude 模型来加速自身芯片软件栈的开发。</p>



<p class="wp-block-paragraph">更令行业震动的是 Brown 披露的一个技术细节。他提到，团队仅用一台 AMD 提供的机架和一名工程师，通过让 Claude 模型<strong>在一个周末内自主完成</strong>了 MI355 芯片与 ROCm 平台的完整适配。周一上班时，团队拿到的是性能持续攀升的实际运行曲线——</p>



<p class="wp-block-paragraph">&#8220;我们原本预期这是个大型工程，&#8221;Brown 坦言，&#8221;但 Claude 的表现完全超出了预期。&#8221;</p>



<p class="wp-block-paragraph">这一突破的意义在于，它直接挑战了英伟达最坚固的护城河。传统上，将大模型迁移至新硬件平台需要工程师团队投入数月甚至数年的手动适配、底层算子优化和稳定性验证。高昂的迁移成本构成了 CUDA 生态壁垒的核心。如果 AI 自身就能完成这项工作，那么硬件采购决策将回归性能、价格等本质因素。</p>



<h2 class="wp-block-heading">MI455X：2nm 工艺 + 432GB HBM4</h2>



<p class="wp-block-paragraph">在硬件层面，AMD 发布了基于 CDNA5 架构的新一代 Instinct MI455X GPU。这是业界首个量产的 2nm（TSMC N2 工艺）数据中心芯片，领先于英伟达 Rubin 采用的 N3 工艺。</p>



<p class="wp-block-paragraph">关键参数包括：</p>



<ul class="wp-block-list"><li><strong>HBM4 内存</strong>：12 个堆栈共 432GB，远超英伟达 Rubin 的 8 堆栈 288GB</li><li><strong>内存带宽</strong>：23.3 TB/s</li><li><strong>封装</strong>：5.5 倍光罩尺寸的 CoWoS-L 封装，总逻辑芯片面积 3,470mm²</li><li><strong>指令集</strong>：MI455X 实际上是 NVIDIA Hopper SM90 ISA 的克隆，降低了迁移门槛</li></ul>



<p class="wp-block-paragraph">MI455X 驱动的 Helios 机架方案同样引人注目。单个机架连接 72 颗 GPU，FP4 算力高达 <strong>2.9 Exaflops</strong>，FP8 算力 1.4 Exaflops。通过 12 个 Broadcom Tomahawk 6 交换机实现单层全互联，每颗 GPU 拥有 1.8 TB/s 的 Scale-up 带宽。</p>



<h2 class="wp-block-heading">开放正在成为武器</h2>



<p class="wp-block-paragraph">AMD 在软体生态方面的策略与英伟达截然不同。英伟达 CUDA 是封闭生态，一切由英伟达定义。AMD 则走开放路线——ROCm 平台完全开源，开发者可以自由查看、修改和贡献代码。</p>



<p class="wp-block-paragraph">AMD 在大会上推出了 ROCm.ai 平台，核心能力包括 GEAK（自动编写和调优 AI 内核）和 Hyperloom 编排器。已验证在 MI355X 上实现约 21.8% 的全栈性能提升。</p>



<p class="wp-block-paragraph">Anthropic 的大规模部署本身就是对 ROCm 生态的最佳背书。AMD 的数据也在说话：2026 年第一季度营收 103 亿美元，同比增长 38%；数据中心业务营收 58 亿美元，同比增长 57%。</p>



<h2 class="wp-block-heading">但挑战依然严峻</h2>



<p class="wp-block-paragraph">SemiAnalysis 在深入分析后指出，AMD 面前仍有两道硬坎。</p>



<p class="wp-block-paragraph">第一，<strong>Helios 机架的量产爬坡</strong>。由于 AMD 采用了 flyover 电缆而非英伟达 Rubin 的无电缆设计，每台机架需要 1,728 根电缆，导致组装困难。更棘手的是，AMD 的 SerDes 设计较弱，高达 85% 的背板需要重定时，每个机架需要超过 550 个 Broadcom 以太网重定时器。</p>



<p class="wp-block-paragraph">第二，<strong>内部开发集群不稳定</strong>。AMD 内部工程师普遍抱怨缺乏稳定的 GPU 集群用于软件开发和自动化测试，甚至因为领导层临时抽调集群导致自动化门禁测试进度倒退。这个问题正在拖累软件优化的速度。</p>



<p class="wp-block-paragraph">此外，Meta 向 AMD 定制了一款&#8221;缩水版&#8221;MI450X——计算单元减半、HBM 内存削减近三分之二。分析人士认为这是一个糟糕的选择，因为该配置在 LLM 训练和推理上无法与英伟达 Rubin 竞争。</p>



<h2 class="wp-block-heading">市场格局正在松动</h2>



<p class="wp-block-paragraph">尽管英伟达目前在 AI 加速器市场仍占据 80%-90% 的份额，但趋势已经清晰。越来越多的客户不再满足于单一供应商。微软此前因 HBM 质量和软件问题放弃了 MI300X，但最新消息显示，微软已宣布将部署 MI455X Helios，OpenAI 很可能是这批机架的最终用户。</p>



<p class="wp-block-paragraph">SemiAnalysis 的作者 Dylan Patel 总结道：&#8221;AI Agent 正在削弱软件生态的壁垒。编写和测试软件已不再是去年那样的护城河了。这对 AMD 来说普遍是积极的。&#8221;</p>



<p class="wp-block-paragraph">英伟达 95% 的份额不会一夜之间消失。但下一个十年，AI 芯片市场将从独角戏变成双雄会——AMD 终于不再只是&#8221;备胎&#8221;。</p>



<p class="wp-block-paragraph">&#8212;</p>



<p class="wp-block-paragraph"><em>图片来源：AMD Newsroom / SemiAnalysis</em></p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
