ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

將 PyTorch Monarch 框架移植至 AMD 圖形運算架構 (ROCm)

基建 1 個來源 · 11 天前
為何重要

這項開源貢獻奠定 AMD 硬體在大型 AI 訓練基礎設施上的軟體可行性,為開發者提供一個兼具高效能(高擴充率)與高可靠性(容錯機制)的 CUDA 替代方案,進一步削弱 NVIDIA CUDA 的生態獨佔性。

  • 將 PyTorch Monarch 單一控制器架構從 CUDA 環境拓展至 AMD Instinct GPU 與 ROCm 側,解決大規模分散式訓練的可靠性挑戰。
  • 作者前次研究已在 1024 顆 GPU 的 MI325 叢集上,以 96.16% 的擴充效率完成 DeepSeekV3-671B 模型的訓練。
  • 移植工作持續至 ROCm 7.0+,匯入 RCCL 縮減通訊請求,並透過 hipify_torchrocm_compat 模組完成 CUDA 到 HIP 的轉譯。
  • 已與 TorchTitan 和 TorchFT 整合,支援 RDMA、SLURM、Kubernetes 和 SkyPilot 多雲環境。
PyTorch MonarchAMDROCmFault ToleranceTensor Sharding

來源 · 1 篇報導

首發 Hacker News Front Page pytorch.org 23:55