ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

百度文心助手任務 Agent 登頂國際權威評測 PinchBench v2,超越 GPT-5.6 與 Claude Opus 4.8

工具 1 個來源 · 15 天前
為何重要

此成果驗證了「框架工程能力」與「系統架構」在 Agent 世代的重要性,正逐漸超越單純的模型引數比拼;這也證明百度多年的搜尋與意圖理解積累,能夠有效轉化為複雜的任務執行與交付能力,重新定義了 AIGC 工具在 ToB 與實戰場景中的效能標準。

百度旗下的文心助手任務 Agent 在 PinchBench v2 真實場景評測中取得 94.6% 的高分,成為首個登頂的國產智慧體系統,重要意義在於該 benchmark 評估的是「執行並交付結果」的能力,而非單純的模型知識儲備。

  • 關鍵指標與排名:文心助手以最高分 94.6%、平均分 94.4% 的成績奪冠,領先 Anthropic 的 Claude Opus 4.8-fast(93.5%)及 OpenAI 的 GPT-5.6-luna(88.7%)。
  • 評測規模與機制:PinchBench 包含 59 個模型、23 個真實場景及 147 項任務,覆蓋程式碼開發、安全分析等七大類,採用「自動化校驗 + LLM 評審」雙軌制,全程無人工幹預。
  • 技術開源與架構:百度已在 GitHub 公開完整的評測流程與 147 個任務快照,體現了其基於 Orion AI 引擎的系統工程實力。
Baidu文心助手文心 AgentPinchBench v2GPT-5.6Claude Opus

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 15:31