Miles v0.1 發布:前線模型後訓練的全棧生產環境系統
為何重要
Miles 透過模組化與「可驗證」的設計原則,試圖解決前沿模型訓練(尤其是 RL 階段)的安全與生產化痛點,降低了技術實作門檻。 此係統的發布象徵著後訓練技術正從 LLM 擴充套件至 Diffusion 模型與具體雜務型 Agent 場景,同時也提出的確驗證了在 64 顆 NVIDIA GB300 GPU 上進行 744B 模型訓練的可達性。
Miles v0.1 是一套全棧、可生產環境部署的前沿模型後訓練系統,旨在讓研究人員與企業都能取得尖端規模的 RL 能力。
- 系統架構:整合 SGLang 推廣引擎,訓練器支援 NVIDIA Megatron-LM 或 PyTorch FSDP 二擇一後端,並提供三種適應不同部署拓撲的權重同步傳輸協議。
- 功能支援:涵蓋完整引數 RL、LoRA RL、政策微調、監督微調與簽名式開 policy rollouts,且支援擴散模型。
- 效能表現:在終端即編碼任務的案例中,使用 64 顆 NVIDIA GB300 GPU 訓練 GLM-5.2 744B-A40B 模型,首 30 測量步驟的步驟中位時間為 263 秒。
- 開放狀態:專案已開源,提供 GitHub 與官網。