ISO:RLVR 原生最佳化堆疊
為何重要
- 提供了推究 RLVR 訓練機制的關鍵視角,將最佳化目標從全量權重調整轉向「譜繼承」與「框架調優」,為降低後訓練成本提供具體解方。
- 對開發者而言,ISO-Optimizer 展示了在推理與編碼任務上,傳統最佳化器大幅減少訓練步數的潛力;對產業而言,這或許是下一輪模型迭代突破「算力瓶頸」的新方法學。
- 核心觀點:研究發現 RLVR 模型可透過「權重譜」來繼承預訓練基礎模型,僅需改變輸入與輸出的「框架」即可獲得新行為,並將此定義為 ISO 最佳化框架。
- 技術架構:ISO 包含離線版
ISO-Merger(僅合併專家框架,無需後續運算)與線上版ISO-Optimizer(固定譜、最佳化框架變化)。 - 效能驗證:在 Qwen3-8B-Base 上,標準 AdamW 需 270 步達到綜合準確率 0.495,
ISO-AdamW則僅需 100 步即可達同分,並在 210 步提升至 0.509。