高維潛在空間擴散性研究
為何重要
當前擴散模型的發展高度依賴強大的視覺編碼器(如 CLIP、SAM 等),此文指出常見的微調策略可能帶來負面副作用。研究者證明瞭透過改變預測目標(從 velocity 改為 $x_0$-prediction)可解決高維空間的最佳化問題,這不僅修正了理論推導,也為改善 Text-to-Image 生成品質提供了具體的工程解法。
表示自編碼器 (RAEs) 讓擴散模型能在預訓練視覺編碼器的特徵空間運作,但常因編碼器未最佳化重建而遺失細節。本文揭示微調這些編碼器雖可復原細節,卻會降低有效維度並改變幾何結構,導致 flow matching 最佳化效率變差。
- 微調編碼器進行重建會導致有效維度降低,改變幾何結構以影響下游生成。
- 使用標準 flow matching 的 velocity(速度)預測在高維空間需學習流形外的正交噪聲,造成最佳化無效。
- 切換至 $x_0$-prediction 可聚焦於訊號流形內,已在多種強重建 Encoder 實驗中提升文字到影像生成效能。