ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

「弱到強」的線上策略知識擷取(W2S-OPD)

研究 1 個來源 · 2 天前
為何重要

此技術打破「學生必須能被領域教師強模型訓練」的刻板限制,提供了利用低成本、較小型的模型作為教師的可能性,將深刻改變大模型訓練的成本結構與策略選項。

現有的線上策略知識擷取(OPD)通常假設教師至少具備與學生相當的能力,這限制了其在缺乏更大或聚合教師時的應用。研究團隊提出「弱到強」的線上策略知識擷取(W2S-OPD),利用正負模型的邏輯空間對照差異來建構代理教師,將其能力資訊注入學生模型,並讓學生在自身 Rollout 上執行反向 KL 最小化。此法在四項數學與三項程式碼測試中超越傳統 OPD,並讓學生模型能力超越領域教師。

W2S-OPDKnowledge DistillationWeak-to-StrongLLMReverse KL

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00