RelightFormer:直接單/多視角物體重光照的前饋生成 Transformer
為何重要
RelightFormer 提供了一種跳過繁瑣後處理流程的高效重光照解決方案,證實了 Transformer 架構在動態光照整合與多視角重建上的潛力。雖屬基礎研究,但視訊基礎模型的架構修訂對未來的生成式 3D 應用與即時渲染技術具備技術指標意義。
傳統影像重光照常受制於複雜的逆向渲染流程或忽略多視角線索。研究團隊提出 RelightFormer,這是一種前饋生成 Transformer 架構,能直接執行單視角或多視角重光照,並完全繞過顯式的內在性質推估。
- 模型源自視訊基礎模型,具備潛在光照模組,可透過交叉注意力動態將目標環境貼圖注入特徵空間。
- 採用排列不變的位置編碼,以對稱處理無序的多視角輸入並消除順序偏差。
- 訓練資料集為「Laval Objaverse Dataset (LOD)」,包含 90,000 個物件與 39,000 種獨特光線設定。
- 在單視角、多視角及新視角重光照任務上,展現出強大的零樣本泛化能力。