MLPerf 6.1:AMD 512 卡刷新推理纪录

MLCommons 近日发布 MLPerf Inference v6.1 基准测试套件。作为衡量不同硬件在 AI 推理任务中吞吐与延迟表现的权威评测,最新 6.1 版本将重点放在推理吞吐、扩展效率,以及不同 GPU 配置下的实际表现。AMD、英伟达、英特尔等厂商在结果公布后同步提交了各自的成绩单。

AMD 派出的 512 卡答卷

AMD 以约 575 万个 token/秒的速度,在 512 个 GPU 的规模下创造了新的 MLPerf 提交纪录,这也是 AMD 迄今为止规模最大的参赛配置,意在证明其性能、规模、软件成熟度与可复现性。

在 DeepSeek R1 这一大模型负载测试中,AMD 派出 512 个 Instinct MI355X GPU 参赛。离线(强调批量处理能力,通常用于衡量系统在非实时场景下的最大吞吐)成绩为 2,901,950 tokens/s,服务器(强调在线服务场景中的吞吐与响应能力,更接近实际部署中的请求处理环境)成绩为 2,405,310 tokens/s。

英伟达的 288 卡对照

同一项目中,英伟达提交了 GB300 与 GB200 的 288 GPU 配置。其中 GB300 离线成绩为 2,705,130 tokens/s,服务器成绩为 2,028,030 tokens/s。需要特别说明的是,两家提交的 GPU 数量并不相同——AMD 用 512 块,英伟达用 288 块,配置存在差异,因此以上数据仅供参考,不能直接当作同规模下的性能对比。

Vera Rubin 首次现身

本次测试的一大看点是英伟达新一代架构 Vera Rubin(VR200)首次进入 MLPerf 推理基准,出现了 36 GPU 与 72 GPU 两种配置。在相同的 72 个 GPU 配置下,Vera Rubin(VR200)要比 GB300 快 95%;此外,其 36 GPU 配置版本甚至比 72-GPU 的 GB200 配置更快。

在 GPT-OSS 120B 负载中,AMD 同样以史上最高的 512 GPU 配置在离线与服务器两类场景中领先;而在 72 GPU 与 8 GPU 段,英伟达的 GB300(Grace Blackwell Ultra)配置则占据上风。AMD 的 MI350P 在 8 GPU 配置下也快于上一代 MI300X。英特尔方面则带来了 Arc Pro B70 与至强(Xeon)的提交,英伟达的 RTX PRO 系列也在 8 GPU 与 4 GPU 配置下参与了测试。

评测之外更值得看什么

从 512 卡到 288 卡,从已量产的 GB300 到首次亮相的 VR200,这一轮提交把 AI 推理吞吐的竞争推到了新的量级。对采购方而言,MLPerf 的价值不只在于“谁跑得更快”,更在于揭示不同规模、不同架构下的扩展效率——在真实业务里,往往不是单卡峰值,而是千卡协同能否不掉链子,才决定了一座 AI 工厂的真正产能。