Opus 5 目前位居 Artificial Analysis Intelligence Leaderboard 第一名
為何重要
此 Index 官方化並結構化了 LLM 評估框架,涵蓋從經濟預測到科學考試的廣泛場景,有助於降低單一基準偏差。它為開發者提供了透明的「效能 vs 成本」儀錶板,使得在推理能力和商業定價策略上具備真正優勢的模型(如 Claude Opus 5)更易被識別,強化了 Artificial Analysis 在 AI 工具評估領域的影響力。
Artificial Analysis 發布了涵蓋 9 個多樣化基準的「Intelligence Index v4.1」,作為評估 AI 模型智慧、效能與成本權重的重要工具。
- 這份 v4.1 指數納入了 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等評估專案。
- 該指數獨特地從代理實際工作任務、代理編碼/終端使用、推理與知識以及法律代理工作等多個維度衡量表現。
- 模型的「Open Weights」狀態由專門的開放性指數評估,並將受限於商業授權的模型標記為「Commercial Use Restricted」。
- 成本計算方法綜合考量了快取命中、快取寫入、推理以及答案 Token 的價格。