ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Async GRPO 與 LoRA 跨 Hugging Face Jobs 運作:儲存桶、代理伺服器與繞過 NCCL

工具 1 個來源 · 9 天前
為何重要

這項技術路徑消除了訓練與推論強耦合在單機或叢集的依賴,透過儲存桶同步與 LoRA 的輕量化特性,讓分散式強化學習(RL)訓練能更輕鬆地部署在有彈性的雲端 Job 環境中,大幅降低基礎設施的複雜度。

TRL v1.14 透過 PR #7017 引入 AsyncGRPO 的 LoRA 支援,作者展示了在 Hugging Face Jobs 環境下如何利用 Storage Bucket 繞過 NCCL,將訓練與推論系統分散部署於不同機器。

  • 透過僅同步秩為 1 的 LoRA 介面卡(約幾 MB)而非全模型,並配置 --max-loras 6 以對應 max_staleness=4,系統成功將 500 步的執行時間從 3 小時 27 分縮減至 53 分鐘。
  • 架構包含一個傳統式的 TRL 訓練 Job、兩個 vLLM 推理 Job、一個負責路由與 KV prefix cache 管理的 Proxy,以及一個在所有 Job 中掛載的 Storage Bucket。
  • 使用 sail/Sanity-Test-R1D-1.5B 資料集與 deepseek-r1-distill-qwen-1.5b 基礎模型進行驗證,因儲存桶持久化機制,即便 Job 被搶佔也能透過最終介面卡繼續訓練。
TRLvLLMAsyncGRPOLoRAHugging Face JobsReinforcement Learning

來源 · 1 篇報導

首發 Hugging Face Blog huggingface.co 08:00