ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

HumanCLAW:視覺語言模型能否透過機械身體執行實體任務?

研究 1 個來源 · 7 天前
為何重要

這項研究顯示現階段 VLM 接觸物理世界後會喪失「 embodied self-awareness」,無法正確追蹤自身狀態與環境互動,成為具身 AI 的關鍵技術病灶。對產業而言,這意謂著通用語言模型若無法整合精確的動態模擬與狀態追蹤模組,難以直接應用於高自主權的機器人執行,需進一步改進架構。

為了評估視覺語言模型(VLM)的實體行動能力,研究者提出 HumanCLAW 框架,藉由解耦指令決策與低階執行,隔絕物理動態對模型判斷的幹擾。此架構並構建了 HumanCLAW-Bench 資料集,用來衡量 VLM 在長時間軸任務中的表現。

  • 框架機制:VLM 發出原子技能指令,並將其翻譯成包含重力和碰撞物理效應的全身動作,讓模型能在不受執行擾動的情況下,專注於行動決策的智商。
  • 資料集規模:建立包含 41 個室內場景、共 1,218 個長時間軸「找尋-導航-互動」的單眼視角測試案例。
  • 測試困境:在測試 9 項最先進的 VLM 後,未有模型能解決該標準難度,表現最好者僅達 16.8% 的任務成功率。
VLMHumanCLAWEmbodied AIBenchmarkPhysics Simulation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00