凍結畫素空間擴散模型可利用自身樣本進行自引導最佳化
為何重要
此技術為現有的強大生成模型提供了一條低成本、高效率的升級路徑。開發者無需重訓模型即可顯著改善模型的紋理與細節,大幅降低了最佳化畫素擴散模型的門檻與推理成本,對於追求硬體資源節省的部署場景具有實務價值。
傳統畫素空間擴散模型從頭訓練昂貴且困難,研究人員發現此類模型無須重新訓練,即可透過輕量管道大幅提升生成品質。
- 核心方法:在不訓練主幹模型的前提下,將輕量級預測頭附加至凍結模型的預訓練中間層,利用層間預測差異作為取樣時的自引導方向。
- 訓練資源:驗證建立此引導機制所需的算力低於完整模型訓練的 1%,且訓練資料僅需使用模型生成的樣本,其修補高頻細節的表現甚至優於真實影像。
- 成效資料:在 ImageNet 多個 Pixel Diffusion 模型上,此合成自引導技術將 FID(生成品質指標)降低超過 50%,並將 PixelREPA-H/16 等強大基礎模型的 FID 從約 1.8 進一步壓降至 1.59。