ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

許可權資訊在「直 policy 自監督」中的價值評估

研究 1 個來源 · 5 天前
為何重要

對於模型訓練工程師而言,這項研究推翻了「必須使用思考啟用的推理軌跡」的耗費性假設,證明透過直接回應軌跡或引數共享也能有效提升學生模型的推論能力。 這有助於產業界重新思考訓練算力的分配,避免在基礎推理能力尚未穩固時,過度投入高成本的長鏈推理(Long CoT)資料訓練。 接下來值得關注的,是如何設計無參考監督(Reference-Free Distillation)的訓練策略,以在有限的算力下榨取模型潛力。

本研究建構了名為 AMPLE-Math 的套件,包含 5,319 個推理視角相同的數學問題,用來量化許可權資訊在自監督學習中的邊際效益。

  • 研究發現 Qwen3-1.7B 的表現提升主要依賴於直接回應的直接監督,許可權參考帶來的額外幫助有限。
  • 在 SmolLM3-3B 上,許可權資訊的收益在訓練的第 50 步僅約增加 2 個百分點,且教學策略(如長軌跡)的切換反而可能導致模型表現下降。
  • 實驗表明,許可權資訊的價值在於促進不同的推論模式間的引數共享,而非單純提供解題詳解。
AMPLE-MathQwen3-1.7BSmolLM3-3BSelf-DistillationOPSDReasoning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00