ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Qwen3.8 Max 在 Artificial Analysis 代理指數登頂,作業系統指數 v4.1.1 更新

模型 1 個來源 · 1 小時前
為何重要

升級評估器至 GPT-5.6 Luna 代表基準模型的進化,可能提升了整體指數評估的準確性與嚴謹度。指數廣泛涵蓋編寫程式碼、終端機使用、知識運作及商業運營等多維能力,這對於企業部署 AI 代理 時的效能選型具有直接的參考價值。

Artificial Analysis 發布作業系統指數 v4.1.1,將 HLE、AA-LCR 和 AA-Omniscience 的評分器升級為 GPT-5.6 Luna。

  • 新版指數納入了 GDPval-AA v2、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 及 AA-LCR 等超過 9 種評估專案。
  • 特別新增了 AA-Briefcase,這是一項用於評估長期代理任務真實工作流程的前沿評估。
Qwen3.8Artificial AnalysisIntelligence IndexGPT-5.6 LunaAgentic Index

來源 · 1 篇報導

首發 Hacker News Front Page artificialanalysis.ai 02:44