ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

FactorJEPA:將單一大模型未來預測解構為佈局、代理與互動頻道以應對擁擠的全球南方都市世界

研究 1 個來源 · 3 小時前
為何重要

主流的 World Models 與具身 AI 訓練資料長期地緣偏重於發達國家的低密度道路,這導致模型在應對全球南方高密度、混亂的都市環境時失效。FactorJEPA 的結構化分解方法展示瞭如何更精確地建模「佈局、代理與互動」,為處理部分可見性與高程度攝幹擾提供了具體方案。該研究發布專屬資料集與檢查點,有助於推動更為通用的世界模型研究。

現有的世界模型多基於低密度道路環境訓練,難以應對高度擁擠且缺乏明確邊界的全球南方城市場景。本研究在 22 個城市收集了 1,000 小時的影片資料,並提出名為 FactorJEPA 的全新架構,旨在解決高密度環境下的預測瓶頸。 - 引入首個針對此類場景的 DENSEWORLD 資料集,包含 22 個城市,涵蓋路況、行人和空中視角影片(公開名稱為 DENSEWORLD-115k)。 - FactorJEPA 將原本單一的潛在編碼解構為佈局、代理與互動三個頻道,利用可見性閘門與分離子空間來保留部分可見元素並避免捷徑連結。 - 新架構在 2B 和 1B 引數的 V-JEPA 2.1 骨幹上均優於傳統方法,不同模型之間的排名相關係數(rho)為 0.895 到 0.978。

FactorJEPADENSEWORLDV-JEPA世界模型Embodied AI資料集

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00