ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

自信源自經驗:從推理到智慧體的體驗式自信估計

研究 1 個來源 · 6 天前
為何重要

XConf 解決了 LLM 部署中常見的「校準偏誤」問題,即模型往往過度自信地輸出錯誤資訊。這種方法提供了一種低代價的「在推理中學習」機制,讓模型能利用過往片段自我修正,顯著提升了智慧體與非正式資料填寫任務的可靠性。對開發者與產業而言,這代表在不進行昂貴微調的前提下,也能大幅改善生產環境中的模型安全性與部署品質。

現有語言模型缺乏穩健的自信評估,本研究提出 XConf 演算法,透過結合模型自身的歷史經驗記錄,來校準並預測輸出的正確機率。

  • 演算法分為 Recall(回顧歷史成功率)和 Reflect(讓模型自我反思失敗模式)兩階段,無需存取 logits 或權重更新。
  • 在涵蓋推理、編碼、多模態 QA 和智慧體等 9 個基準的測試中,XConf 在 24 次比較中 23 次優於或匹配 10 次取樣的自我一致性能效。
  • 成本僅需消耗一次回答生成,若用於拒絕低自信樣本(例如排除 10% 最不確定案例),可將智慧體任務的交付成功率提高高達 8.7%。
XConfConfidence EstimationLanguage ModelsAgentsCalibration

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00