LynnReal-Omni:原生多模態影片生成,支援代理視覺工作流
為何重要
LynnReal-Omni 實現了結構化輸入(如 3D 場景或遊戲狀態)與生成式影像的高度融合,大幅提升了 Agent 影視工作流的穩定可控性與物體保真度。其關鍵突破在於將多種影片生成任務統一至同一模型層級,並將即時渲染速度壓縮至 377ms,這對於遊戲產業或線上串流服務而言,是降低算力成本與提升互動體驗的重要里程碑。
為瞭解決 Video diffusion model 在精確控制長視野內容與時間一致性上的難題,本研究提出 LynnReal-Omni,一個原生支援多模態指令的統一影片生成框架。
- 建構於 32B shared multimodal diffusion transformer,整合 text-to-video、reference-guided generation、structural control 及 long-video generation 等任務。
- 針對即時渲染需求訓練專用的 27B Flash transformer,並推出 100-prompt、20-metric 的評估設計(MSAVP)。
- 在 H100 上,LynnReal-Omni-Flash 藉由解碼加速,產出 22 幀 540p 影片的時間分別為基礎版的 843 ms 與 Flash 版本的 377 ms。