NVIDIA正式发布CUDA Toolkit 13.4,最大亮点是首次原生支持Windows on Arm64平台,开发者现在可以直接在Windows Arm64环境中编译CUDA应用程序。此前,面向Arm平台的CUDA开发仅支持Linux系统。
对于现有的x86-64系统,新版本保留了交叉编译能力,开发者无需更换平台即可面向Arm硬件进行开发。
CUDA 13.4还通过计算能力10.7加入了对NVIDIA下一代Rubin架构的预览支持,让开发者和库维护者能够在Rubin硬件大规模上市之前,提前开始应用程序的移植、编译与测试工作。
本次更新涉及多个关键领域:
- 编译器、PTX ISA、CUDA C++与CUDA Tile——多项优化与新特性;
- 运行时API与软件库——性能与兼容性改进;
- 开发者工具——更新后的性能分析与调试实用程序。
组件方面,cuda.core升级至1.1.0版本,新增纹理与表面编程支持、具备NUMA感知能力的统一内存,以及简化开发流程的Python类型存根。cuda.compute 1.1则支持针对多种GPU架构预编译CCCL算法。
Multi-Process Service V3新增了脚本化命令行界面、命名服务器实例、TOML配置支持,并集成cgroup以限制GPU显存使用。CUDA Compute Fabric Transport则加入了命名逻辑端点与异步操作,用于通过NVLink互联的系统之间的数据传输。
此外,CUDA 13.4预计还将支持即将推出的NVIDIA RTX Spark平台。据NVIDIA介绍,这是一款面向消费级PC的处理器,配备20核Grace CPU和拥有6144个CUDA核心的Blackwell GPU,宣称在FP4精度下AI算力最高可达1 PFLOPS,能够在本地运行参数量高达1200亿的模型。
CUDA Toolkit 13.4现已在NVIDIA官方网站开放下载。



