ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SceneActBench:通用蟲能夠執行對它們所見 3D 場景的操作嗎?

研究 1 個來源 · 10 天前
為何重要

SceneActBench 為多模態 agent 應用提供了更細緻的評估光譜,特別是針對空間推理與工具使用的結合,填補了現有測試集中在文字產出或單一物體操作端的空白。這發現突顯了當前 VLM agents 在處理複雜 3D 關係與跨任務一致性上的瓶頸,為後續開發更強大 agent 框架與檢索-行動迴圈提供了具體的改進方向。

隨著 Vision-Language model agents 不再滿足於僅描述 3D 場景,而是開始利用工具在環境中執行操作,現有的基準測試往往缺乏對完整多物體場景中 agent 行動的評估。我們提出 SceneActBench,這是一個專注於視覺條件化行動的基準,基於統一的 agent-環境迴圈設計。 - 該基準共包含 520 個任務用例,源於 210 個來源例項,並接收 PNG 影像、取樣視訊畫面以及 3D 資產作為輸入。 - 評估過程會將最終輸出與隱藏的基準真實答案進行比對,並使用任務特定的幾何指標進行驗證。 - 研究在 11 種專有 VLM 配置中顯示,整體分數波動範圍在 38.6 至 50.2 之間,且沒有任何配置能在所有任務中表現穩健。

Vision-Language model3D 場景SceneActBenchAgent 評估Benchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00