ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

主動觀察者的基準測驗

研究 1 個來源 · 14 天前
為何重要

研究結果直接揭示主流 MLLMs 架構的關鍵短板:大多依賴單次靜態影像資料而非連續動態追蹤。這對產業意味著,若要實現能夠處理即時、連續視訊輸入的應用(如機器人、自動駕駛輔助),現有模型架構需進行根本性重構,加入閉環感知機制。

研究團隊提出 ActiveVision 基準,旨在測量多模態大型語言模型(MLLMs)具備「主動觀察能力」的程度,以解決現有基準無法驗證模型是否能如人類般透過重複視線移動來解決問題的問題。

  • ActiveVision 包含 17 個任務,分為 3 個類別,設計上強迫模型執行重複的視覺感知而非單一靜態描述。
  • 目前效能最好的模型 GPT-5.5(位於最高暴露的推理強度層級)僅解出 10.6%,在 17 個任務中有 11 個得分為 0
  • 即便在推理與編碼領域領先的 Claude Fable 5,僅解出 3.5%,且慢於三名平均答對 96.1% 的人類參與者,當模型自行撰寫視覺程式碼時亦無法解決此缺陷。
ActiveVisionMLLMsGPT-5.5Claude Fable 5動態感知評測

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00