ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

DreamTraj:從未渲染視訊 Diffusion 潛藏表示生成物體六軸軌跡

研究 1 個來源 · 2 天前
為何重要

該技術證明直接提取 Diffusion 模型中間層特徵可作為即時運動預測的資產,大幅降低高階機器人系統依賴外部感測器或複雜感知管道的比重,有助於開發具低延遲與高適應性的 VLA(Vision-Language-Action)模型,推動人機互動與實際操作應用的商業化程序。

本論文提出 DreamTraj 系統,解決傳統物體軌跡預測受限於資料品質或依賴昂貴權威輸入的問題,使閉環操控感知更簡潔高效。

  • 提出從單張 RGB 影像與任務指令直接預測 6-DoF 軌跡的方法,推理階段不需要視訊、深度或 CAD 模型等權威輸入。
  • 直接讀取凍結的影像到視訊 Diffusion 模型早期去噪步驟的中間表示,並利用輕量級 flow-matching Reader 解碼出相對 6-DoF 位姿。
  • 建立附有細緻自然語言指令的 MOVE 資料集(5,038 樣本),並在翻譯與旋轉任務上超越現有 Forecaster。
DreamTrajDiffusion LatentsRobotics6-DoFMOVE Dataset

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00