ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ShadowDancer:透過動態統一表示法教導視訊世界模型執行任何動作

研究 1 個來源 · 6 天前
為何重要

這項技術解決了視訊世界模型從「觀看」到「控制」的關鍵卡點,允許開發者直接利用現有示範影片作為資產,在新場景中重現動作,大幅降低生成式世界模型的開發門檻與資料標註需求。

現有視訊世界模型在精確控制動態時面臨瓶頸,本研究提出 ShadowDancer,透過影片與其「影子」對照建構控制機制。

  • 方法包含利用 Shadow Library 大規模建構「影對」,以及透過 Cross-shadow prediction 從一側影子預測另一側來提取動作。
  • 實驗顯示平均 blinded win rate 達 86%,優於潛在動作和互動世界模型基準。
  • 成功讓示範片段在新環境中具備可重用性,回放時無需動作標籤、估測器或微調。
ShadowDancerVideo World ModelsAction ControlHugging Face Daily Papers

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00