當 LLM 裁判達成共識時,可信度該如何調整?
為何重要
AI 產品開發中常使用多個 LLM 進行自動評估,但簡單的投票機制容易被臆測導致共識。本研究提供的統計方法能修正「多數欺騙」偏差,讓 RAG 系統與 AI 助手的自我監控與內容審查更為精確。
Amazon 研究人員提出「依賴感知的標籤聚合」方法,利用 Ising 模型解決當 LLM 裁判因訓練血統、提示詞共用或模型家族相似而產生錯誤共識的問題,確保面板反映真實多元觀點。
- 將裁判面板視為網路,同時估計裁判可靠性和配對依賴關係(使用 Ising 模型),並可在無監督環境中區分獨立證據與共同錯誤。
- 研究方法在 relevance classification(關聯性分類)、toxicity detection(毒性檢測)與 summarization assessment(摘要評估)三項任務中,優於 weighted-majority-vote(加權多數投票)基準。
- 實測資料顯示,該方法在上述任務上的準確率提升 9% 至 14%。