ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LynnReal-Omni:原生多模態影片生成,支援代理視覺工作流

模型 1 個來源 · 8 天前
為何重要

LynnReal-Omni 實現了結構化輸入(如 3D 場景或遊戲狀態)與生成式影像的高度融合,大幅提升了 Agent 影視工作流的穩定可控性與物體保真度。其關鍵突破在於將多種影片生成任務統一至同一模型層級,並將即時渲染速度壓縮至 377ms,這對於遊戲產業或線上串流服務而言,是降低算力成本與提升互動體驗的重要里程碑。

為瞭解決 Video diffusion model 在精確控制長視野內容與時間一致性上的難題,本研究提出 LynnReal-Omni,一個原生支援多模態指令的統一影片生成框架。

  • 建構於 32B shared multimodal diffusion transformer,整合 text-to-video、reference-guided generation、structural control 及 long-video generation 等任務。
  • 針對即時渲染需求訓練專用的 27B Flash transformer,並推出 100-prompt、20-metric 的評估設計(MSAVP)。
  • 在 H100 上,LynnReal-Omni-Flash 藉由解碼加速,產出 22 幀 540p 影片的時間分別為基礎版的 843 ms 與 Flash 版本的 377 ms。
LynnReal-OmniVideo GenerationDiffusion TransformerH100Agentic Workflows

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00