ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

World in World:具體可控的世界模型影片探索架構

模型 1 個來源 · 12 天前
為何重要

- 解決了世界模型中「導航難」的關鍵痛點,讓模型能夠在不重新微調的情況下,實現精確的場景跟隨與外觀還原。 - 顯著縮短了開發者整合 控制到視覺模型 的時間,對於製作出具高度互動性的 Generative World Simulators 至關重要。 - 推動了「One Model, Infinite Interfaces」的設想,即透過輕量級推理層,讓同一個基礎模型適配多種具體任務。

  • 現有的自迴歸影片世界模型在長時間軸探索與靈活控制上仍有難度,本篇提案提出「World in World (W_i_W)」作為一種不須額外訓練的推論介面。
  • 該介面將來源影片觀察、幾何渲染等多源異質證據,轉換為帶有時間與相機標記的潔淨視覺狀態,並透過引用凍結因果影片模型的自我注意力機制來讀取。
  • 技術上運用「對應路由器」與「Evidence-wise Attention CFG (EWA)」來建立標記對應並調整各輔助通道貢獻,進而支援相機重渲染、長時間軸重訪以及人類動態遷移。
World in Worldworld modelsvideo generationcausal video modelEWAautoregressive

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00