當多個答案皆正確時,多數決失效:大模型因果推理的最佳化 K 取樣驗證法
為何重要
傳統的人工智慧常依賴模型「投票」來提升準確率,但此研究揭示了在因果推理任務中單靠多數決常會失效,造成錯誤答案脫穎而出。這對於需要高度邏輯嚴謹性的專業應用來說是一個具體的解決之道,也顯示出結合經典符號邏輯與機器學習驗證是替代單純擴增模型規模的有效路徑。
- CALVER 是一種無需額外訓練的符號驗證器,能運用賈德・派爾的因果準則評分並挑選最高分候選。
- 在 CLEAR 資料集的查詢中,當存在多個圖形有效答案時,CALVER 準確率達到 42.1%,高於多數決方式、基於獎勵模型、LLM 判斷器或模型自信度的約 30%。
- 將判斷器規模擴張至 72B 引數仍無法縮小與 CALVER 的差距,且 CALVER 能在 CPU 上毫秒級進行評分。
- CALVER 的優勢隨取樣預算增加而擴大,並已在十個公開貝氏網路、另一個模型家族以及從文本建構圖形的情境中得到驗證。