當老師誤導:嘔吐訊號感知的線上政策蒸餾
為何重要
此研究著眼於解決 LLM 與 VLM 在訓練階段的訊號汙染問題,為複雜的開源模型或企業內部模型訓練提供了更精細的品質控制手段。對於工程師與研究人員而言,該技術能幫助學生模型(Student)過濾教師模型中無效的語言偏差,提升知識遷移的效率與準確度。然而這屬於演算法層面的微調最佳化,並非新的商業產品或硬體平臺,因此對產業競爭格局的直接波動有限。
線上上政策蒸餾中,教師模型的令牌層面監督常被語言先驗或刻板印象模板等「嘔吐訊號」驅動,而非取決於任務實際證據,導致錯誤的最佳化方向。研究團隊提出 SA-OPD 架構,透過輕量級代理識別並過濾掉低輸入依賴性的令牌,以確保訓練訊號的準確性。實證結果顯示,該框架在大型語言模型與視覺語言模型的廣泛設定下,一致優於 Vanilla OPD 及競爭性的選擇性方法。
- SA-OPD 引入輕量級輸入依賴性代理,判斷令牌層面的蒸餾訊號是否真正依賴輸入內容。
- 該方法篩選出同時具備「低輸入依賴性」與「極端蒸餾分歧」的令牌並予以移除。
- 在 LLM 和 VLM 的設定中進行了廣泛實驗,結果一致性地優於基礎 Vanilla OPD。