PhysStream:具物理基礎的串流視訊生成技術
為何重要
PhysStream 提示視訊生成正從單純的視覺輸出,轉向具備可靠物理底層的指令互動。解決了生成過程中無法中途介入控制的關鍵痛點,這對需要精確動態模擬的應用(如虛擬試驗、機器人規劃)具有重要示範意義。
為瞭解決現有視訊生成方法受限於完整控制計畫或畫素空間訊號的問題,團隊提出 PhysStream 模型,引入結構化場景記憶與物理量導向的訊號以實現精細生成控制。
- 採用結構化場景記憶與稀疏速度增量訊號,讓模型能學習底層物理動態而非僅導向物體位置 pixels。
- 採用兩階段訓練策略:先以雙向模型微調搭配運動控制,再以因果式自身回歸模型加入額外場景記憶以提升物理一致性。
- 首度支援在影片生成「半途」進行互動式精細控制,特別是針對多物件桌面剛體場景,這是前人無法做到的能力。
- 在合成基準測試上,比最強基準模型減少 33% 的運動分佈距離(FVMD)與 12% 的軌跡誤差;在野外人類評估中偏好度超過 85%。