LLM 評估應將「校準」列為一級標準
為何重要
現有評估指標多聚焦於準確率,卻忽略了模型是否知道自己在做什麼。在高利害應用(如金融或法務)中,模型自信程度的準確與否是決定系統是否能投入實戰的關鍵。若不納入校準,將直接影響依賴模型判斷的現有研究(如自動化評估與資料生成)的可靠程度。
- 目前 LLM 領域常在新模型、資料集與基準發布時,忽略檢查模型自信程度與實際正確性的對齊。
- 誤用的校準會導致部署階段因過度自信的錯誤造成實際傷害,並誤導依賴置信度的研究流程(如 LLM-as-a-judge、合成資料生成、主動學習)。
- 文章建議應利用現有基準測試提供的資料,將校準視為模型核心屬性而非利基議題。