TPU Ironwood 实测回击英伟达:每美元推理领先最高 96%

据 SemiAnalysis 2026 年 9 月发布的实测,谷歌第七代 TPU Ironwood 在同等 FP8 条件下,每美元推理性能最高领先英伟达 B200 达 50%、领先 B300 达 96%;在每秒 100 Token 单用户吞吐下,TPU 每百万 Token 成本仅 0.181 美元,低于 B200 的 0.222 美元与 B300 的 0.276 美元。黄仁勋此前公开质疑 TPU”不敢参加公开跑分”,谷歌以一组实测数据正面回应。

实测是怎么做的

>

测试采用 Qwen3.5 397B FP8 模型,FP8 对 FP8 公平对比,输入 8000 Token、输出 1000 Token。在每秒 100 Token 单用户吞吐基准下,TPU 每百万 Token 成本 0.181 美元;B200 为 0.222 美元,B300 高达 0.276 美元,TPU 分别便宜 19% 与 34%。若将中位响应时间限制在 20 秒,TPU 成本进一步降至 0.098 美元。

成本优势从哪里来

>

TPU 的成本优势并非来自峰值算力:实测中 TPU 物理吞吐仅领先约 5%,但每小时租赁成本远低于 GPU,叠加价格差后放大为约 50% 的每美元性能领先。更令英伟达忌惮的是软件生态出现松动:谷歌推出 TorchTPU,利用 PyTorch 的 PrivateUse1 后端接口,让 TPU 直接成为原生 Torch 运算设备;开发者只需把一行代码 device=torch.device(‘cuda’) 改为 device=tpu.get_device(),无需重写训练循环或修改模型架构即可在 TPU 上运行。

Ironwood 的硬件参数

>

Ironwood 单芯片配备 192GB HBM,是上代 Trillium 的 6 倍,可容纳更大 KV Cache;矩阵单元采用 256×256 脉动阵列,原生支持 FP8 运算。硬件实力提升也让谷歌在销售策略上更主动:自 2025 年起开放 TPU 直接销售,不再只依赖云端租赁。

三家方案怎么比

>

指标 TPU Ironwood 英伟达 B200 英伟达 B300
每百万 Token 推理成本(100 tok/s 吞吐) 0.181 美元 0.222 美元 0.276 美元
较 TPU 贵 基准 +19% +34%
每美元推理性能 基准 落后约 50% 落后约 96%
软件迁移成本 TorchTPU 一行代码切换 CUDA 生态成熟 CUDA 生态成熟

为什么这件事重要

>

这次实测的意义不在”谁峰值更高”,而在”每美元能跑多少有效推理”。对大模型推理供应商,采购决策正从”唯峰值算力”转向”有效算力 × 成本 × 软件迁移”。TorchTPU 降低了生态壁垒,是谷歌把 TPU 从内部资产变成对外云业务的关键一步。

对中国市场读者,国产算力同样面对”软件易用性决定 adoption”的命题——峰值跑分再高,开发者迁不动、用不顺,也难形成规模。Ironwood 用”一行代码切换”降低门槛的打法,值得国产 AI 芯片参照。

本文基于哪些信息

>

本文基于 SemiAnalysis 报告(经多家中文科技媒体转述,2026 年 9 月 11 日至 12 日)及公开 TPU 规格整理。成本与性能数字来自 SemiAnalysis 实测口径,HBM 与架构参数来自谷歌官方资料。