ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Puppeteer:具物體感知與姿態控制的聲語動作生成模型

研究 1 個來源 · 13 天前
為何重要

此技術區別於純文本或影像的 AIGC,將 AI 生成能力擴充套件到「運動圖形學」領域,對開發具備群體互動能力的虛擬化身(Avatar)有關鍵意義。它解決了數位人在虛擬空間中動作不自然或誤觸物體的問題,是一種將大型語言模型(LLM)語境延伸至視覺與運動的基礎工程突破。

電腦視覺與生成式 AI 的合併難點在於同時生成聽得懂且能提升整體感的語言與人體動作。為解決傳統模型忽略姿態約束與環境互動的問題,研究團隊提出名為 Puppeteer 的因果潛在空間擴散模型。

  • 模型將長尺度動作分解為結構化原語,並透過因果變分自動編碼器編碼為時間序列潛在 Token,確保每個 Token 依賴過往資訊。
  • 異於以往的單純依照音訊生成,Puppeteer 依據語音、運動歷史、初始參考姿態及物體幾何等條件,合成物理一致性更高的動作。
  • 研究團隊建立首個名為 SceneGes 的策展合成 3D 資料集,收錄伴隨具體物體的共語表達姿態,以改善物體感知動作生成的評估依據。
PuppeteerCo-Speech GestureDiffusion ModelEmbodied AI3D SceneMotion Generation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00