See2Think:多模態模型視覺推理可靠性的公開審計
為何重要
這項研究將多模態模型的評估視角從單純的「最終答案準確率」,轉向更具技術洞察的「中間過程可靠度」,揭示了當前模型透過草圖或工具進行推理時的脆弱性。對產業而言,這意味著未來具備「過程可解釋性」與「視覺生成穩定性」的模型才具備實務應用價值。對開發者而言,此基準測試將成為檢驗 Agent 或具身智慧演算法底層邏輯的重要工具。
- 研究團隊提出 See2Think 框架,旨在回答多模態大型語言模型是否真正依賴思考過程中的中間視覺狀態。
- 新框架包含 See2ThinkBench 資料庫與 Visual Action-of-Thought (VAoT) 機制,對多模態模型的推理過程進行細緻診斷。
- See2ThinkBench 包含 1,200 個開放式視覺問題,橫跨 12 個任務分類(涵蓋 2D 結構化、3D 場景與真實世界推理)。
- 實驗發現「忠實渲染」是模型的關鍵瓶頸,且即使模型高程度上採用視覺反饋,其準確率也未必然提升。
- 當視覺狀態輸入遭遇任務相關的損壞幹擾時,模型準確率驟降超過 10 個百分點。