Puppeteer:具物體感知與姿態控制的聲語動作生成模型
為何重要
此技術區別於純文本或影像的 AIGC,將 AI 生成能力擴充套件到「運動圖形學」領域,對開發具備群體互動能力的虛擬化身(Avatar)有關鍵意義。它解決了數位人在虛擬空間中動作不自然或誤觸物體的問題,是一種將大型語言模型(LLM)語境延伸至視覺與運動的基礎工程突破。
電腦視覺與生成式 AI 的合併難點在於同時生成聽得懂且能提升整體感的語言與人體動作。為解決傳統模型忽略姿態約束與環境互動的問題,研究團隊提出名為 Puppeteer 的因果潛在空間擴散模型。
- 模型將長尺度動作分解為結構化原語,並透過因果變分自動編碼器編碼為時間序列潛在 Token,確保每個 Token 依賴過往資訊。
- 異於以往的單純依照音訊生成,Puppeteer 依據語音、運動歷史、初始參考姿態及物體幾何等條件,合成物理一致性更高的動作。
- 研究團隊建立首個名為 SceneGes 的策展合成 3D 資料集,收錄伴隨具體物體的共語表達姿態,以改善物體感知動作生成的評估依據。