Google 推出新一代視訊生成模型 Gemini Omni,展示多樣化開發者應用與物理邏輯理解
為何重要
Gemini Omni 強調「物理邏輯理解」以解決當前 AIGC 影片生成常見的不連貫問題,若技術成熟,將直接衝擊 Midjourney 類圖片與 Sora 等影片生成工具的市場定位,並強化 Google Flow 作為核心創作平臺的競爭力。
Google 在 I/O 年會介紹全新的 Omni 家族模型家族,首支模型為「Gemini Omni Flash」,主打透過自然對話輕鬆生成與編輯影片,並能理解物理規律以產生更真實的輸出,目前已向開發者開放。
- 模型具備視訊編輯能力,可改變攝影機角度、切換環境背景或替換影片中的物體。
- 開發者 Leon Lin 應用已示範從約 20 個不同角度拍攝人物,Carlos Santana 則僅以語音指令將戶外場景從白天切換至下雪的深夜。
- 開發者 Pan 與 Hyperagent 利用 Google Flow,分別完成將素描筆畫(如檸檬、剪刀)動畫化,以及將待辦清單遊戲化的專案。