「弱到強」的線上策略知識擷取(W2S-OPD)
為何重要
此技術打破「學生必須能被領域教師強模型訓練」的刻板限制,提供了利用低成本、較小型的模型作為教師的可能性,將深刻改變大模型訓練的成本結構與策略選項。
現有的線上策略知識擷取(OPD)通常假設教師至少具備與學生相當的能力,這限制了其在缺乏更大或聚合教師時的應用。研究團隊提出「弱到強」的線上策略知識擷取(W2S-OPD),利用正負模型的邏輯空間對照差異來建構代理教師,將其能力資訊注入學生模型,並讓學生在自身 Rollout 上執行反向 KL 最小化。此法在四項數學與三項程式碼測試中超越傳統 OPD,並讓學生模型能力超越領域教師。