在世界模型中訓練物體恆存性
為何重要
強化 video generation models 在物理世界的因果推理與恆存性,是為具備動態觀察能力的 AI Agent 鋪路的關鍵。本研究指出結構化的核心認知訓練是目前矯正世界模型物理邏輯缺失的有效方向,且透過開源資料,有助於學術界與產業界加速在「具身智慧」領域的技術共享與整合。
本文提出名為 WROP 的資料基礎設施,旨在解決 video generation models(video generation models)在具備物理推理能力與「物體恆存性」上的潛在不足,而此能力被視為人類認知的特徵之一。
- WROP 包含 150 個受認知科學啟發的手工設計任務,經由 Blender 生成並保證每個任務 10,000+ 樣本,共提供 1.5M-samples 訓練語料庫。
- 研究評測了 14 個 video models,其中 16B 引數的 PWM-WROP 在盲測 Elo 研究的繼續生成任務中排名第一,整體表現排名第三。
- 團隊揭示訓練模型的能力差異,並在 AWS Trainium2 上發布了資料、模型答案、評分與原生 PyTorch 訓練框架(PWM)。