全天候模型在物理世界推理能力的評估:MiniMax-H3 研究
為何重要
隨著評估框架的公開,開發者獲得了一套衡量具備物理感知能力模型的硬性指標,這對於設計視聽互動業界 Agent 或醫療監控系統至關重要。對產業而言,這證實了單一的視覺輸出難以應對複雜物理推論,未來的模型競爭焦點將從單純的生成品質轉向多感官(視聽)整合的推理能力。
- 全模態 (Omni-Modal) Generative Models 已逐漸要求統一建模文字、影像、視訊與聲音,MiniMax-H3 透過共用的潛在框架整合多模態語境理解與音視覺生成,此項研究旨在探討全方位輸入是否能提升模型的物理世界推理能力。
- 研究建構了一套專為 Omni-Model 設計的評估框架,設計了隱含提示與多幀、視覺-聽覺、前置視訊及視聽輸入等四種場景,強迫模型依賴跨模態的部分證據來推論潛在事件。
- 在 517 個評估例項中,MiniMax-H3 的整體成功率為 41.97%;其中「視訊決策推理」表現最佳,達 56.00%,而「音訊歧義推理」最弱,僅有 27.40%。