CUDA 首次原生支持 Windows on Arm

英伟达于 9 月 9 日发布 CUDA Toolkit 13.4 工具包,这是 CUDA 历史上第一次为 Windows on Arm64 平台提供原生开发包支持。在此之前,CUDA 对 Arm 架构的支持只覆盖 Linux,Windows on Arm 用户长期无法原生运行 CUDA 应用。

从 Linux 扩展到 Windows,Arm 平台补齐最后一块

CUDA Toolkit 是英伟达面向 GPU 编程的开发工具包,包含编译器、库和工具,开发者用它编写能在英伟达 GPU 上加速运行的程序。过去十多年里,这套工具链在 Arm 平台上的支持始终停留在 Linux 一侧。

CUDA 13.4 改变了这一局面。开发者现在可以直接在 Windows Arm64 系统上编译 CUDA 应用程序,也可以沿用 Windows x86-64 版本的工具包进行交叉编译。这意味着同一份 CUDA 代码在 Windows 的两套指令集架构之间有了更顺畅的迁移路径。

提前解锁 Rubin 架构,计算能力 107

除 Arm 支持外,CUDA 13.4 以预览版形式为英伟达 Rubin 架构提供功能性支持,对应计算能力 107(即计算能力版本 10.7)。CUDA 用这一编号识别 GPU 架构特性,并让编译器生成适配该架构的 GPU 机器代码。在正式版发布前开放预览,是为了让开发者和关键软件库维护者能够提前完成移植、开发与验证。

本次更新覆盖 CUDA 编译器、PTX ISA、CUDA C、CUDA Tile 编程、运行时 API、软件库以及开发者工具。在 CUDA Python 中,cuda.core 升级至 1.1.0,新增纹理与表面编程、NUMA 感知托管内存以及 .pyi 类型存根;cuda.compute 1.1 则支持为多个 GPU 架构预先编译 CCCL 算法。

Multi-Process Service V3 增加了脚本化命令行界面、命名服务器实例、TOML 配置,以及与 cgroup 集成的 GPU 显存限制,面向容器化环境提供更精细的 GPU 分区能力。CUDA Compute Fabric Transport 则面向通信库开发者,通过命名逻辑端点和异步操作,在 NVLink 互连架构中传输数据。

为 RTX Spark 提前清障

业界普遍将这次更新视为英伟达为即将于 10 月上市的 RTX Spark PC 提前铺路。

RTX Spark 是英伟达进军消费级 PC 处理器市场的首款产品,由英伟达与联发科合作开发。该芯片集成 20 核 Grace CPU 与 6144 个 CUDA 核心的 Blackwell GPU,通过 NVLink-C2C 互联,共享最高 128GB 统一内存。其 FP4 精度 AI 算力达 1 PFLOPS,可在本地运行 1200 亿参数大模型,并支持 100 万 token 上下文。芯片采用台积电 3nm 工艺,搭载该芯片的笔记本预计下个月上市,高配版定价约 3000 美元,约合人民币 2.02 万元。

由于 RTX Spark 本身就是一颗基于 Arm 架构的 SoC,如果 CUDA 工具链不支持 Windows Arm64,开发者在相关设备上编写 CUDA 程序就只能退回 Linux 或 WSL 环境。CUDA 13.4 的作用,正是把这条路径打通。

预览版仍有已知问题

需要注意的是,CUDA 13.4 仍属开发者预览版,存在已知问题。快科技在报道中提到,PyTorch 构建工作流可能导致系统不稳定或无响应,官方不建议将该版本用于生产部署或基准测试。也就是说,AI 训练框架在 Windows Arm64 上的兼容性还需要几个版本迭代才能稳定,TensorRT、cuDNN 等组件在 Windows Arm64 上的适配也尚未完全跟上。

对普通用户而言,这次更新不会直接提升现有设备的性能。它的价值在于为 Windows on Arm 平台上的 CUDA 应用兼容性铺路:如果开发者能在 RTX Spark 上市前完成移植和验证,使用该平台的用户届时就有望获得更完善的 GPU 加速软件支持。