透過影響力配對進行的資料集微縮研究
為何重要
- 從過程對齊轉向結果對齊是資料壓縮領域的重要範式轉變,有助於建立更貼近真實終端效能的合成資料集。 - 採用一階泰勒近似替代昂貴的運算複雜步驟,大幅降低了方法在實際部署中的計算成本,提升工程落地的可行性。 - 證明 Inf-Match 架構具有跨任務適配性,不僅在分類上超越基準,在視覺語言檢索等資訊檢索任務上也展現了領先優勢。
- 本研究引進 Influence Matching (Inf-Match),一種結果導向的資料集微縮方法,透過最小化合成資料對引數的影響與原始資料集的差距來完成學習。
- 新演算法採用可微分、線性時間的影響估計器,無需依賴計算昂貴的反黑森積或凸性假設即可量化引數位移。
- 在 Tiny-ImageNet (IPC=10) 上,Inf-Match 達到 31.5% 的準確率,較基準 NCFM 提升 4.7%;在 Flickr30K 視覺語言任務中,亦較 NCFM 在影像/文字檢索上高出 2.5%。