ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

邁向技能原生大模型:利用技能熵最佳化長時推理的評測與訓練框架

研究 1 個來源 · 13 小時前
為何重要

這項研究直指大型語言模型在複雜邏輯推理中「技能切換」的具體痛點,並提供了一個具備可複用性的 RL 訓練方案。對於重視模型推理成本與落地能力的開發者與投資人而言,這證明瞭即使使用小型模型,透過調整訓練訊號(如重構 reward function)也能大幅拉近與閘道模型的效能差距,有助於最佳化中小型團隊的技術競爭力。

現有語言模型在面對長時推理任務時,常缺乏在不同技能間靈活切換的能力,現有評測標準亦多數著重於單一技能。研究團隊提出「技能熵」作為切換難度的量化指標,並建構 Skill^2-Bench 來針對跨技能推理進行測試,同時設計 Skill-Entropy RL 框架來強化訓練過程。

  • 引入 Skill Entropy 來測量大模型在不同技能間切換的困難程度。
  • 建立包含 558 種技能與 9 個領域的 Skill^2-Bench 跨技能長時推理評測集。
  • 評測 8 個前緣與 4 個開源發現,模型在高熵任務上的準確率顯著下滑,存在「技能切換缺口」。
  • 提出包含技能預測的 Skill-Entropy RL,將 OpenR1-Math 等既定資料集轉化為有效的訓練訊號。
  • Qwen3-4B-Instruct 及 Qwen3-1.7B 採用新方法後,Skill^2-Bench 分數分別提升至 68.4% 與 40.1%。
Qwen3RLBenchmark技能熵OpenR1-Math

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00