独立开发者Speedstu近期推出了一个名为"CUDA-for-AMD-Windows"的开源项目,使得AMD显卡能够在Windows操作系统上运行CUDA特定的工作负载,无需使用虚拟机或双系统。在测试中,该项目在RX 9060 XT显卡上成功训练了一个拥有220万参数的PPO强化学习网络,且全程使用原版CUDA库。该项目提供了一套高度自动化的PowerShell脚本,将ZLUDA翻译层与AMD的HIP/ROCm SDK for Windows相结合。脚本能够自动识别GPU架构,并下载特定版本的ZLUDA(v6-preview.69),并与Windows上的ROCm数学库进行映射。开发者成功拦截并映射了CUDA驱动API以及三个核心库:cuBLAS、cuSPARSE和cuFFT,直接对应到AMD的相应实现。 近期,AMD通过ROCm更新为Windows用户提供了正式的PyTorch和HIP SDK支持,覆盖RX 7000和RX 9000系列显卡。然而,许多专有应用、旧版代码库和特定的AI工具仍依赖于CUDA,AMD用户只能通过WSL2或等待开发者进行HIP移植来使用这些工具。该项目的出现弥补了这一空缺,相当于为只支持NVIDIA的软件提供了一个转换接口。 基准测试结果显示,在RX 9060 XT上运行220万参数的强化学习工作负载时,通过官方的ZLUDA与AMD HIP SDK 6.4的组合,达到了13278 steps/秒的吞吐量,而通过从旧版ZLUDA中提取的自定义覆盖层,吞吐量为12876 steps/秒,慢了约3%。开发者指出,未来重写以去除LibTorch/ZLUDA后,性能可能会显著提升,但目前仍存在一定的性能损失。这一项目表明,AMD显卡支持CUDA专属软件的障碍并非无法逾越的硬件问题,而是可以通过翻译工具解决的。项目完全开源,预计将获得社区的广泛支持,进一步扩展硬件兼容性及CUDA库的支持。尽管目前关键的AI库如cuDNN、TensorRT和NCCL尚无法解析,但这一突破无疑为AMD显卡的应用前景带来了希望。 龙8体育