AGI Ranker 模型評分大清洗:逆向審計後普遍下調 6-15 分
為何重要
這項動作將 AI 評測從「受廠商委託的自我報告」推向「獨立驗證」的硬核審計模式,嚴肅性大幅提升。然而,評估指標目前仍存在結構性缺陷——多數高難度推理基準缺乏人類對照資料,導致「完美解決」被直接視為 AGI 里程碑。這種指標定義的模糊性可能低估了模型的實際差距或高估了現狀。
開發者推出「AGI Ranker」,匯聚 10 個公開基準 測試推出透明化的 0-100 分評分系統,旨在檢測模型距離 AGI 的距離。近期該專案進行全面資料審計時,發現所有模型的評分皆出現調整,並對評分邏輯進行了嚴格驗證。
- 審計後所有模型的 AGI 評分普遍下降 6 至 15 分。
- 評分邏輯混合了「有真人基準」與「無真人基標」兩類;目前僅 GPQA Diamond 擁有已驗證的 0.81 人類天花板。
- 未有人類基標的測試若得 100 分,代表該難題已被「解決」,並不代表達到人類智力水平。