從重加權到重寫:解鎖訓練資料歸屬中具影響力樣本的調停效果
為何重要
這項研究突破性地挑戰了當前模型微調的主流思維——若重加權無效,調整模型行為應轉向「訓練資料結構」本身。對產業而言,繞過複雜的模型微調,直接在訓練集層級進行精準的「Response Rewriting」,可能是更高效、穩定且具解釋性的控制模型行為(如安全性對齊)的新路徑。
- 在訓練資料歸屬 領域,雖然影響函式 可準確識別影響模型行為的範例,但傳統的微弱重加權方式常導致幹預效果不穩定,甚至不如隨機選擇。
- 提出了「influence-guided response rewriting」方法,利用影響函式精準定位目標後,保持指令固定,替換受影響範例的回答注入新的行為標註。
- 實驗在四個 open-weight LLMs 上相比較重寫與重加權,發現重寫能產生更強勁、持久且雙向的行為改變,而重加權則效果微弱。
- 測試環境包括 epistemic abstention,結果顯示透過重寫調整改變高度集中在與目標相關的行為層面,證明直接修改訓練回應比調整權重更具調停放權。