ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

長文本開放式生成「事實完整性」評估:GAMUT 基準

研究 1 個來源 · 15 天前
為何重要

GAMUT 填補了當前評估標準中「事實完整性」的缺口,修正了傳統分解-搜尋-驗證流程無法捕捉遺漏訊息的盲點。對於開發者而言,這提供了評估複雜生成任務圓滿度的標準;對企業與 RAG(檢索增強生成)應用,則有助於建立更嚴謹的訊息覆蓋率檢驗機制,降低決策風險。

現有評估長文本的方法多專注於陳述正確性,卻忽略了訊息遺漏的問題,導致評估不夠全面。研究團隊因此提出兩層級「meta-rubric」框架,並發布名為 GAMUT 的基準測試,專注於長文本生成的事實完整性。

  • 建構評估框架:區分結構化元規則與機械化二元清單,使大型語言模型評分器能可靠產生評分。
  • 資料集現實性:包含 1,813 組源自真實穿戴式裝置影像的問題,橫跨 10 個多樣領域。
  • 挑戰性與效能:測試 14 個前沿及開放權重模型,最佳表現者得分僅 58.7%(Gemini 3.1 Pro)。
GAMUTFactualityBenchmarkHugging FaceMeta-rubricLLM Eval

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00