ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Miles v0.1 發布:前線模型後訓練的全棧生產環境系統

工具 1 個來源 · 14 天前
為何重要

Miles 透過模組化與「可驗證」的設計原則,試圖解決前沿模型訓練(尤其是 RL 階段)的安全與生產化痛點,降低了技術實作門檻。 此係統的發布象徵著後訓練技術正從 LLM 擴充套件至 Diffusion 模型與具體雜務型 Agent 場景,同時也提出的確驗證了在 64 顆 NVIDIA GB300 GPU 上進行 744B 模型訓練的可達性。

Miles v0.1 是一套全棧、可生產環境部署的前沿模型後訓練系統,旨在讓研究人員與企業都能取得尖端規模的 RL 能力。

  • 系統架構:整合 SGLang 推廣引擎,訓練器支援 NVIDIA Megatron-LM 或 PyTorch FSDP 二擇一後端,並提供三種適應不同部署拓撲的權重同步傳輸協議。
  • 功能支援:涵蓋完整引數 RL、LoRA RL、政策微調、監督微調與簽名式開 policy rollouts,且支援擴散模型。
  • 效能表現:在終端即編碼任務的案例中,使用 64 顆 NVIDIA GB300 GPU 訓練 GLM-5.2 744B-A40B 模型,首 30 測量步驟的步驟中位時間為 263 秒。
  • 開放狀態:專案已開源,提供 GitHub 與官網。
Milesv0.1Post-TrainingReinforcement LearningSGLangNVIDIA GB300

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00