ReMoMask-2:潛在檢索增強的遮罩動作生成
為何重要
ReMoMask-2 解決了 RAG 架構中常見的「檢索空間與生成潛在空間難以對齊」的技術痛點,這種將檢索庫置入生成器內部的方法,具備擴充套件至文本生成音訊或影片等多模態任務的潛力。對於致力於高階機器人自動化執行複雜動作的產業實務者(如影視生成與人形龐博機器人)來說,這種能精準處理 Spatial-Temporal 拓撲的技術能顯著提升輸出的自然度與連貫性。
Text-to-Motion (T2M) 技術能將自然語言轉換為人類關節動作,應用於遊戲與機器人,但現有 Retrieval-Augmented (RAG) 模型常因無法精確捕捉動作的層級化與空間拓撲結構,且檢索證據與生成器潛在空間存在語義落差而受限。ReMoMask-2 透過在生成器的潛在空間重建檢索資料庫並利用輕量型投影器對齊文字查詢,解決了這一表示空間對齊問題。
- ReMoMask-2 在 HumanML3D、KIT-ML 與 SnapMoGen 資料集上驗證了檢索器達到最先進 (SOTA) 精準度,並在 KIT-ML 與 SnapMoGen 上獲得最低的 FID。
- ReMoMask-2 採用包含 HBM 對照學習、SSTA 與 Topology Structured Masking (TSM) 的結構感知 Framework,以增強區域性特徵與語義的對齊。
- ReMoMask-2 僅使用單層 mask-transformer 即超越 ReMoMask 的完整雙階段管道,並達到最快的推理速度。