ReactHuman:具備物理基礎的具身多模態 LLM 反應式決策評估
為何重要
具身 AI 若無法在毫秒級別對突發物理危險做出即時反應,將難以進入實際家庭應用。此基準揭示了目前 LLM 模型在物理感知上的核心缺陷,例如過度信賴外觀而忽視動態資訊,這對開發高效能家用機器人構成了技術門檻,迫使 AI 訓練流程必須加入高頻率物理互動範本來提升安全預期。
現有評測多著重於長期任務或被動視訊問答,缺乏對突發物理危險的反應性即時動作測試。研究團隊推出名為 ReactHuman 的物理基準,旨在評估具身多模態大語言模型(MLLM)在面對突發家庭情境時的決策能力。
- 包含 17 種事件類別與超過 1,000 個場景。
- 資料來源為 240Hz 剛體模擬的精確真值,包含違反物理直覺的被動物件。
- 評估包含 5 種指標,需模型動作兼具合理性、安全性與物理基礎。
- 針對 7 個代表性 MLLM 的測試發現,模型約 1/3 的危機無法有效處理,且故障率未隨規模增加而改善。