ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Negative Self-Distillation (NSD):學習透過避開錯誤來進行推理

研究 1 個來源 · 12 天前
為何重要

這項研究揭示了強化學習 中訓練範式的關鍵缺口,提供了一種避免模型「過度自信」並提升其探索性邏輯能力的新穎技術路徑。 對於研發大型語言模型或 Agent 的團隊而言,這種不依賴大量外部標註資料的內部訓練方式,顯著降低了高品質資料的門檻與成本。 如果門控機制趨於穩定,此技術可能成為未來提升模型長期推理穩定性與自我修正能力的標準架構之一。

  • On-Policy Self-Distillation (OPSD) 雖廣泛應用於大型語言模型 (LLM) 自我改良,但在處理複雜推理時,因強迫學生模仿教師的自信軌跡,會意外抑制模型表達不確定性的自我修正行為。
  • 新框架 Negative Self-Distillation (NSD) 將最佳化目標轉為對抗自我生成的負面條件(例如模擬「粗心的推理者」),而非單純依賴外部標註或真理解。
  • 原始去識別化 學習目標曾因混淆有缺陷的語言 token 與基本語言 token 而導致基礎能力崩壞,NSD 則引入動態門控機制來隔離關鍵推理 token。
  • 實證結果顯示,NSD 一貫優於 OPSD 以及其他無標籤的自我啟動 強化學習 基準。
Negative Self-DistillationLLMSelf-DistillationReasoningReinforcement Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00