將 PyTorch Monarch 框架移植至 AMD 圖形運算架構 (ROCm)
為何重要
這項開源貢獻奠定 AMD 硬體在大型 AI 訓練基礎設施上的軟體可行性,為開發者提供一個兼具高效能(高擴充率)與高可靠性(容錯機制)的 CUDA 替代方案,進一步削弱 NVIDIA CUDA 的生態獨佔性。
- 將 PyTorch Monarch 單一控制器架構從 CUDA 環境拓展至 AMD Instinct GPU 與 ROCm 側,解決大規模分散式訓練的可靠性挑戰。
- 作者前次研究已在 1024 顆 GPU 的 MI325 叢集上,以 96.16% 的擴充效率完成 DeepSeekV3-671B 模型的訓練。
- 移植工作持續至 ROCm 7.0+,匯入 RCCL 縮減通訊請求,並透過
hipify_torch和rocm_compat模組完成 CUDA 到 HIP 的轉譯。 - 已與 TorchTitan 和 TorchFT 整合,支援 RDMA、SLURM、Kubernetes 和 SkyPilot 多雲環境。