ShadowDancer:透過動態統一表示法教導視訊世界模型執行任何動作
為何重要
這項技術解決了視訊世界模型從「觀看」到「控制」的關鍵卡點,允許開發者直接利用現有示範影片作為資產,在新場景中重現動作,大幅降低生成式世界模型的開發門檻與資料標註需求。
現有視訊世界模型在精確控制動態時面臨瓶頸,本研究提出 ShadowDancer,透過影片與其「影子」對照建構控制機制。
- 方法包含利用 Shadow Library 大規模建構「影對」,以及透過 Cross-shadow prediction 從一側影子預測另一側來提取動作。
- 實驗顯示平均 blinded win rate 達 86%,優於潛在動作和互動世界模型基準。
- 成功讓示範片段在新環境中具備可重用性,回放時無需動作標籤、估測器或微調。