視覺歸因知識擴散(VAD):多模態即時學習中的目標重構與證據歸因
為何重要
對開發者而言,VAD 提供瞭解決多模態模型「知識汙染」的思路——即區分哪些模型行為受視覺事實影響,哪些受語言誤導,能提升 Agent 的推理可靠性。從產業面看,這類針對訓練訊號的精細歸因與幹預研究,長期有助於在有限算力下實現更高效率的模型訓練或遷移。
多模態 on-policy distillation 雖能透過私有視角教師傳遞視覺知識,但下一 token 的校正常混雜語言先驗,導致教學品質不純粹。VAD 提出一種新演算法,透過反事實推理估計校正中的視覺證據部分,並以此重構學生模型的監督目標。
- VAD 對每一個學生產生的字首,同時計算視覺證據「存在」與「移除」時教師反應的差異,以建立視覺證據方向的代理(ut)。
- 該方法將原始校正投影至視覺證據方向,區分出幹預對齊與殘差元件,並以重建目標作為主要訓練訊號。
- 實驗結果在 4B 與 9B 引數規模的六個細粒度視覺基準上,VAD 在表現上優於傳統的私有視角擴散與視覺優勢加權法。