Nemotron 奧數奪金配方公開:利用模型後訓練與測試計算策略
為何重要
此案例證明在基礎模型上透過精心設計的後訓練(如 RL),搭配脈絡化的推理設計,可讓中型模型解決高階數學問題,展現出比引數量更關鍵的演算法優勢。此外,完整公開檢查點、評估指標與訓練流程,大幅降低了研究社群複製與應用數學推理能力的門檻。這標誌著競技型 AI 應用正從單一模型發展為「開放式配方」的結構化推理流程。
本研究探討自然語言證明生成在面對高難度奧運數學題時,模型後訓練與推理階段的影響。研究團隊以 Nemotron 3 Ultra 為基礎,透過監督微調與強化學習打造專家模型,並發布一套完全使用自然語言運作的 open-model 測試計算流程。系統透過迭代搜尋生成、驗證與總結候選證明,最終在 IMO 2026 中以 30/42 分達到金牌門檻。
- 針對 Nemotron 3 Ultra 進行 supervised fine-tuning (SFT) 與 reinforcement learning (RL),訓練出兩支專家檢查點。
- 系統運作時需動用 3 個 Nemotron 3 Ultra 檢查點(含通用版本與兩個專家),僅使用自然語言,無需外部證明器或網際網路。
- 在 IMO 2026 考試中獲得 30/42 分,成功達到 gold-medal threshold。
- 作者將訓練資料、程式碼、解題方案與包含 200 道新奧數題的 Nemotron-IMO-Bench 全部開源。