ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Opus 5 目前位居 Artificial Analysis Intelligence Leaderboard 第一名

模型 1 個來源 · 12 天前
為何重要

此 Index 官方化並結構化了 LLM 評估框架,涵蓋從經濟預測到科學考試的廣泛場景,有助於降低單一基準偏差。它為開發者提供了透明的「效能 vs 成本」儀錶板,使得在推理能力和商業定價策略上具備真正優勢的模型(如 Claude Opus 5)更易被識別,強化了 Artificial Analysis 在 AI 工具評估領域的影響力。

Artificial Analysis 發布了涵蓋 9 個多樣化基準的「Intelligence Index v4.1」,作為評估 AI 模型智慧、效能與成本權重的重要工具。

  • 這份 v4.1 指數納入了 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR 等評估專案。
  • 該指數獨特地從代理實際工作任務、代理編碼/終端使用、推理與知識以及法律代理工作等多個維度衡量表現。
  • 模型的「Open Weights」狀態由專門的開放性指數評估,並將受限於商業授權的模型標記為「Commercial Use Restricted」。
  • 成本計算方法綜合考量了快取命中、快取寫入、推理以及答案 Token 的價格。
Opus 5ClaudeArtificial AnalysisGPQA DiamondOpen Weights

來源 · 1 篇報導

首發 Hacker News Front Page artificialanalysis.ai 03:45