AMD正面挑战英伟达CUDA生态:AI芯片之战迎来关键转折点

过去几年,AI加速器市场几乎被英伟达一家独大。无论是训练大模型还是部署推理服务,CUDA生态系统像一道高墙,让竞争对手难以逾越。但现在,这道墙正在出现裂缝。

从”零机会”到”大有可为”

SemiAnalysis在一篇深度分析中指出,他们对AMD在AI加速器领域的判断经历了三次更新。最初,SemiAnalysis认为AMD在软件层面与英伟达的差距过于悬殊,给出了”0%机会”的悲观评价——当时AMD软件问题丛生,团队甚至连续数月成为AMD Bug报告最多的提交者。

但六个月后,情况发生变化。SemiAnalysis观察到AMD有了真正推动变革的领导力,而非委员会式的决策模式。AMD CEO苏姿丰(Lisa Su)亲自与分析师沟通并采纳了多项建议,AMD软件团队的紧迫感明显增强。SemiAnalysis将评级从0%上调至”有一定机会”。

到了2026年中,信号变得更加强烈。基于对AMD软件栈的深入体验,SemiAnalysis再次更新判断——只要AMD能解决两大关键风险,就有”很大机会”在AI加速器市场取得成功。

Anthropic、微软、OpenAI纷纷转向AMD

重磅信号来自AMD的客户名单。Anthropic已公开宣布将部署2GW的AMD芯片,Anthropic计算主管Tom Brown甚至在周末用Claude的”/goal”功能在AMD硬件上完成了内部Claude推理栈的适配。

更引人注目的是微软的转变。2023年,微软因HBM内存不可靠和软件质量差而放弃了AMD MI300X,并跳过了MI325X和MI355X两代产品。但2026年,微软180度转向,宣布将部署MI455X Helios系统。据SemiAnalysis分析,OpenAI将是Azure上MI455X机架的主要终端客户。

AMD还在与Cerebras达成合作,采用类似英伟达-Groq交易策略,实现PD分离(Prefill-Decode Disaggregation)以提供超快速交互式推理。

两大风险:产能爬坡与开发集群稳定性

尽管前景乐观,AMD仍面临两个严峻挑战。

第一,Helios机架系统的产能爬坡遇到困难。由于AMD未采用无电缆托盘设计,加上SerDes设计较弱,每个机架高达85%的背板需要重定时(Retiming),需要超过550个博通以太网重定时器。背板可靠性问题正在拖累量产节奏。

第二,内部GPU集群严重不足。AMD工程师最普遍的抱怨是缺乏稳定的GPU集群用于内部软件开发和自动化测试CI。这个问题正在阻碍AMD的进步速度——因为每个AI编码Agent本身也需要GPU才能运行和测试。

竞争升级:从”GPU对决”到”平台对决”

英伟达自然不会坐视不理。其正从GPU供应商转型为全栈AI基础设施提供商,通过收购网络技术公司和扩展软件堆栈实现硬件、软件与互联的垂直整合。英伟达还通过推出AI CPU正式进军数据中心CPU市场,瞄准约2000亿美元潜在市场,直接挑战AMD的传统优势领域。

但市场格局已经出现结构性变化。Gartner分析师指出,AI推理工作负载占比持续提升——2023年还是训练占2/3、推理占1/3,到2026年推理市场已增长至训练市场的2.16倍。推理占比越高,CUDA的生态锁定效应越弱,这对AMD更为有利。

高盛已将AMD目标价从240美元上调至450美元,伯恩斯坦上调至525美元。整个AI芯片赛道的投资逻辑,正在从”追逐英伟达训练芯片的垄断红利”转向”布局多元算力兼容的新方向”。


*文章来源:本文基于SemiAnalysis 2026年7月分析报告”Can AMD break the CUDA Moat? AMD Advancing AI 2026″改写,并综合Gate博客、雪球、同花顺等渠道信息补充。*