ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

你的模型早就知道答案:探討 LLM 基準測試中的答案洩漏問題

研究 1 個來源 · 20 小時前
為何重要

- 現有許多基準測試(如 GSM1k)已面臨嚴重的老化和不準問題,使模型能力評估失去公信力,開發者與評測機構必須更重視建立真正無法被預先知道答案的「動態評測」生態。 - 從「存量歷史」測試轉向「增量/即時」測試的趨勢(如 CT Open),可能成為未來 AI 能力標竿的新定義,影響研究界對模型「安全性」與「推理力」的評估標準。 - 對於生技、法務等高度依賴公開資料的專業領域,如果想克服「結果洩漏」,最實用的方法是「輸入洩漏」的防治(如接入時間限制的搜尋工具),這不僅是技術問題,更是產品落地的關鍵。

  • 汙染問題普遍:由於 LLM 已在海量網路資料中閱讀過題目或答案,高分評測可能僅代表模型「死記」資訊,而非真實的推理能力。
  • 三大洩漏途徑:包含模型透過搜尋工具或檔案在測試時讀取答案的「輸入洩漏」(Kaufman et al., 2012);模型發布後因訓練資料重複而產生的「基準洩漏」(例如 Balloccu et al., 2024 追蹤到 400 萬測試樣本洩漏至 GPT-3.5 和 GPT-4);以及模型預訓練時已習得公開結果的「結果洩漏」。
  • 現行解法與挑戰:推動「Live Benchmarks」(如 LiveBench、ForecastBench、CT Open)以測試尚未發生的事件,但在像臨床試驗決策這種需等待十年的長期情境下,仍難避免歷史資料的洩漏。
LLMBenchmark LeakageGSM1kLiveBenchCT OpenContamination

來源 · 1 篇報導

首發 Hacker News Front Page elman.ai 00:56