探索建模:開啟第三個預訓練軸線與端到端生成
為何重要
本研究為生成式模型的訓練架構帶來第三個變數(探索度),若未來驗證可行,將顯著改變既有 Scaling Laws。對產業而言,能在不增加算力或資料的前提下提升生成品質與效率,意味著訓練與推理成本有望大幅下滑。
- 現有的生成式模型因難以端到端處理多模態分佈,訓練方式多需分階段,新提出的「探索建模」透過調整訓練迴圈選取最佳匹配,引入第三個預訓練軸線。
- 隨著模型規模與資料量擴增,探索帶來的效益顯著上升:資料擴增至 3 倍時效能昇幅從 7% 至 36%,模型增長時則從 13% 至 23%。
- 研究顯示,在相同運算資源下,FLOP 運算效率提升達 4.1 倍,樣本與引數效率分別提升 6.2 倍與 47%,且無引導情況下 ImageNet 優良配方達 1.43 FID,控制任務僅需 16-256 倍步數即可達 Diffusion 模型效果。