LLM 助手的可驗證社會推理框架
為何重要
現行 LLM 評估多偏重於知識性任務,且缺乏驗證「人際社交推理」的基準。本研究提出的 Fuse 框架不僅揭示了模型在處理偏見敘事與冗長往復語境上的盲點,更提供了一套即時可用的社會情境評測標準。這對正在堆疊 Agent 複雜互動能力的開發者來說,是調校推理路徑與輸出精簡度的關鍵參考;若該標準被廣泛採用,將成為未來社交型 AI 生態的重要底層工具。
現有 LLM 助手在提供社會建議時難以評估其推理能力,原因在於缺乏相關驗證基準。研究團隊提出具備 2.4 萬 筆人工註解驗證的 Fuse 多代理模擬框架,透過建立可驗證的基準與開源 2.1 萬 筆範例資料集,量化分析模型在推測他人意圖時的系統性弱點。
- 提出 Fuse 多代理模擬框架,透過模擬使用者中介情境生成可驗證的社會推理基準。
- 訓練與驗證過程共使用 2.4 萬 筆人工註解,並後續開源 2.1 萬 筆範例資料集供大眾使用。
- 在 12 個 LLM 模型上的測試結果顯示,模型面對特定偏見框架或冗長往復語境時存在系統性敏感性與資訊過載問題。
- 更長的對話時長並不總是有助於提升模型的推理準確率,證明僅增加互動次數並非解方。