Async GRPO 與 LoRA 跨 Hugging Face Jobs 運作:儲存桶、代理伺服器與繞過 NCCL
為何重要
這項技術路徑消除了訓練與推論強耦合在單機或叢集的依賴,透過儲存桶同步與 LoRA 的輕量化特性,讓分散式強化學習(RL)訓練能更輕鬆地部署在有彈性的雲端 Job 環境中,大幅降低基礎設施的複雜度。
TRL v1.14 透過 PR #7017 引入 AsyncGRPO 的 LoRA 支援,作者展示了在 Hugging Face Jobs 環境下如何利用 Storage Bucket 繞過 NCCL,將訓練與推論系統分散部署於不同機器。
- 透過僅同步秩為 1 的 LoRA 介面卡(約幾 MB)而非全模型,並配置 --max-loras 6 以對應 max_staleness=4,系統成功將 500 步的執行時間從 3 小時 27 分縮減至 53 分鐘。
- 架構包含一個傳統式的 TRL 訓練 Job、兩個 vLLM 推理 Job、一個負責路由與 KV prefix cache 管理的 Proxy,以及一個在所有 Job 中掛載的 Storage Bucket。
- 使用 sail/Sanity-Test-R1D-1.5B 資料集與 deepseek-r1-distill-qwen-1.5b 基礎模型進行驗證,因儲存桶持久化機制,即便 Job 被搶佔也能透過最終介面卡繼續訓練。