ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

AGI Ranker 模型評分大清洗:逆向審計後普遍下調 6-15 分

研究 1 個來源 · 7 天前
為何重要

這項動作將 AI 評測從「受廠商委託的自我報告」推向「獨立驗證」的硬核審計模式,嚴肅性大幅提升。然而,評估指標目前仍存在結構性缺陷——多數高難度推理基準缺乏人類對照資料,導致「完美解決」被直接視為 AGI 里程碑。這種指標定義的模糊性可能低估了模型的實際差距或高估了現狀。

開發者推出「AGI Ranker」,匯聚 10 個公開基準 測試推出透明化的 0-100 分評分系統,旨在檢測模型距離 AGI 的距離。近期該專案進行全面資料審計時,發現所有模型的評分皆出現調整,並對評分邏輯進行了嚴格驗證。

  • 審計後所有模型的 AGI 評分普遍下降 6 至 15 分
  • 評分邏輯混合了「有真人基準」與「無真人基標」兩類;目前僅 GPQA Diamond 擁有已驗證的 0.81 人類天花板。
  • 未有人類基標的測試若得 100 分,代表該難題已被「解決」,並不代表達到人類智力水平。
AGI RankerAI LeaderboardBenchmark AuditGPQA DiamondAI Evaluation

來源 · 1 篇報導

首發 Hacker News Front Page agiranker.com 22:04