透過資訊瓶頸進行訓練適應式卷積稀疏編碼,以實現強健的視覺表示
為何重要
「無標籤後訓練」策略是本文亮點,能讓模型在只要進行引數調整即可適應擾壞輸入,這對消費電子(如手機相機)或自動駕駛中的視覺系統提升容錯率具備理論價值。相較於純粹的 CIFAR/ImageNet 基準評測,該解決方案的實際應用潛力對於 CV 產業鏈更顯重要。
本文提出一個框架以動態生成視覺訊號的表現,透過動態調整稀疏度係數並展開最佳化過程來解決傳統固定係數的問題。
- 將卷積稀疏編碼最佳化過程展開,並利用快速迭代收縮-閾值演算法(FISTA)進行求解。
- 提出將稀疏度係數視為可微分變數,與網路引數同步學習,從資訊瓶頸觀點平衡資訊保留與壓縮。
- 引入無標籤後訓練策略,在主要引數固定的情況下調整擾壞輸入的壓縮強度以提高強健性。
- 在 CIFAR 和 ImageNet 資料集上的實驗顯示,模型在不同輸入擾動下具備競爭力的識別能力且強健性大幅提升。