ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ISO:RLVR 原生最佳化堆疊

研究 1 個來源 · 15 天前
為何重要

- 提供了推究 RLVR 訓練機制的關鍵視角,將最佳化目標從全量權重調整轉向「譜繼承」與「框架調優」,為降低後訓練成本提供具體解方。 - 對開發者而言,ISO-Optimizer 展示了在推理與編碼任務上,傳統最佳化器大幅減少訓練步數的潛力;對產業而言,這或許是下一輪模型迭代突破「算力瓶頸」的新方法學。

  • 核心觀點:研究發現 RLVR 模型可透過「權重譜」來繼承預訓練基礎模型,僅需改變輸入與輸出的「框架」即可獲得新行為,並將此定義為 ISO 最佳化框架。
  • 技術架構:ISO 包含離線版 ISO-Merger(僅合併專家框架,無需後續運算)與線上版 ISO-Optimizer(固定譜、最佳化框架變化)。
  • 效能驗證:在 Qwen3-8B-Base 上,標準 AdamW 需 270 步達到綜合準確率 0.495,ISO-AdamW 則僅需 100 步即可達同分,並在 210 步提升至 0.509。
ISORLVRIsospectral OptimizationQwen3AdamW

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 21:51