ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

羅福莉沉寂半年後官宣!小米直播 RL 訓練全過程,36小時燒 108 萬美元

模型 1 個來源 · 6 天前
為何重要

這次事件將 AI 訓練從「黑盒」推向了高度透明的「監督場」,揭示了開發複雜 Agent 的現實成本門檻。除了算力(Compute),小米強調 Grader Compute(評分計算量)與環境 Harness(執行框架)的 Scaling,暗示著未來競爭將從單純的引數擴大轉向對多環境互動與詳細信用分配的資源投入。這對投資人與開發者而言,既是觀察國產模型商業化底氣的樣本,也是瞭解 Agent 訓練「燒錢邏輯」的稀缺案例。

小米 AI 研究員羅福莉在沉寂半年後,公開了 MiMo-V2.6 系列 Flash 與 Pro 模型的強化學習(RL)訓練直播。這次展示不僅呈現了耗資驚人的訓練成本,更將模型指標迭代、模型能力評測、以及獨特的訓練 Scaling 方法論全數攤開。

  • 訓練燒錢速度:自 Pro 模型開始算起,36 小時內已消耗逾 108 萬美元,平均每小時約 3 萬美元。
  • 模型能力指標:在 DeepSWE v1.1 離線評測中,Pro 達到 62.24%,Flash 達到 60.77%(DeepSeek-Flash v1.1 為 74.2%)。
  • 非同步訓練架構:每個訓練 Step 包含 20 億 Token,配置為 1568 Prompt × 每個 Prompt 16 條 Rollout,並採用 Fully Async 完全非同步流水線。
  • 過程透明化:訓練頁面同步公開總成本、步數、獎勵曲線漲勢及硬體故障節點。
小米MiMo強化學習Agent羅福莉RL

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 09:09