訓練文字轉影像模型速度快了 3.6 倍
為何重要
這項技術突破直接挑戰了現有 LDM「壓縮即瓶頸」的假設,為追求高品質影像生成的開發者提供了一條繞過 VAE 限制的新路徑。對產業而言,意味著在高解析度影像生成領域,訓練效率的提升直接對應商業成本(GPU 小時)的削減,未來主流模型(如 FLUX、Ideogram)的技術遷移備受關注。
現有的 Latent Diffusion Models(LDMs)依賴 VAE 進行壓縮,但傳統 CNN VAE 存在 16× 壓縮比的天花板。新架構 JiT-DDT 捨棄獨立的 VAE,改用統一模型處理壓縮與生成,並透過切換為 x-prediction 預測目標來解決高維度訓練的維度詛咒問題。
- 與 Linum v2 基線相比,JiT-DDT 架構訓練文字轉影像模型的 GPU 時間減少了 3.6×。
- 儘管訓練速度提升,該架構生成的影像畫素數量是 4× 水平,意味著能產出更高細緻度的結果。
- 透過改變預測目標為 x-prediction 且加入 novel encoder-decoder architecture(JiT-DDT),該技術成功克服了 DiT 在高維度輸入時難以學習的問題。
- 模型原始碼與權重已依 Apache 2.0 授權釋出,目前定位為研究產物,而非完整模型發布。