ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

When2Think:學習難度感知長度控制以最佳化高效混合推理模型

研究 1 個來源 · 5 天前
為何重要

這項研究解決了限制大型推理模型商業化的一大痛點:算力成本的效率問題。透過在後訓練階段自動學習何時跳過不必要推理,該框架有助於開發者在不犧牲準確率的情況下顯著降低推理 API 的營運支出(OpEx),提升算力的投資報酬率。

大型推理模型常陷入簡單問題「過度思考」與難題「思考不足」的效率兩難,研究團隊提出 When2Think 後訓練框架,透過「Instance-level Difficulty-Aware Control (IDAC)」機制,讓模型能依據問題難度動態分配運算量並進行獎勵塑形。

  • 在 AIME24 測試中,相較基礎模型,token 使用量減少 27.9% 同時 Pass@3 提升 10.0%。
  • 在 AIME25 中達到 40.0% 的 Pass@3,表現優於壓縮及僅路由的基線模型。
  • 該方法無需學習外部獎勵模型即可實現穩定最佳化,驅動模型在簡單例項時採用直接作答(系統 1),困難例項時延長推理(系統 2)。
When2ThinkHybrid ReasoningDifficulty-AwareAIMEEfficiency

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00