UK AISI 與 EvalEval 推動基準測試結果的可重現性
為何重要
AISI 與 EvalEval 的合作標誌著 AI 評估生態正從「黑盒報告」邁向「開源驗證」。隨著推論計算量與評估協議的細微差異會顯著改變模型表現,公開詳細的設定與配置資訊變得不可或缺。這不僅為開發者提供了可重現科學的基礎,也迫使模型廠商必須在技術透明度上做出回應,轉變了 AI 競爭的勝利定義。
英國人工智慧安全研究所(UK AISI)正使用 EvalEval 的基礎設施與開放平臺「Evaluation Cards」公開發布評估資料,以解決當前評估結果報告格式混亂且難以重現的問題。此合作源於 NeurIPS 2025 的工作坊,旨在建立共享架構以提升評估科學的透明度與驗證性。
- AISI 公開了包含六個前沿模型(含 Claude Opus 4 系列、GPT-5 系列及兩項相關網路安全評估)的經過核驗的評估結果。
- 這些資料依據 EvalCoalition 的 Every Eval Ever (EEE) 架構與核心專案 Evaluation Cards 公佈,包含詳細設定檔與人文最後考試(Humanity's Last Exam)等基準的表現。
- 這項計畫延續了 AISI 在 HiBayES 與 OptStop 等方面的研究,旨在透過標準化報告與推論計算的研究,解決不同評估設定下模型成績難以比較的問題。