隱形捷徑:視覺編碼器為何會學會你的相機資訊?
為何重要
這項研究跳脫了傳統的可見偏差(如物體背景或紋理)框架,揭示畫素級後設資料(如相機特性)已成為模型預測能力的潛在捷徑,這對於理解模型的黑盒性質與分佈外推能力有重要啟發。開發者現在必須在訓練與驗證流程中納入後設資料幹擾測試,才能確保模型在真實世界的檢測能力不至於因裝置差異而崩潰。
- 研究發現大型視覺模型往往依賴隱形捷徑學習,即畫素層級的後設資料資訊與標籤形成強相關,這種無形偏見過去未被重視。
- 透過 ImageNet 或 LAION 等大規模監督資料進行預訓練,會在低層畫素與高層語義之間建立誤導性的關聯,導致模型對相機裝置等細節高度敏感。
- 實驗證實強化此類後設資料關聯會加劇模型在資料分佈改變時的效能流失,且修復策略能有效提升模型的分佈外推能力。