百度文心助手任務 Agent 登頂國際權威評測 PinchBench v2,超越 GPT-5.6 與 Claude Opus 4.8
為何重要
此成果驗證了「框架工程能力」與「系統架構」在 Agent 世代的重要性,正逐漸超越單純的模型引數比拼;這也證明百度多年的搜尋與意圖理解積累,能夠有效轉化為複雜的任務執行與交付能力,重新定義了 AIGC 工具在 ToB 與實戰場景中的效能標準。
百度旗下的文心助手任務 Agent 在 PinchBench v2 真實場景評測中取得 94.6% 的高分,成為首個登頂的國產智慧體系統,重要意義在於該 benchmark 評估的是「執行並交付結果」的能力,而非單純的模型知識儲備。
- 關鍵指標與排名:文心助手以最高分 94.6%、平均分 94.4% 的成績奪冠,領先 Anthropic 的 Claude Opus 4.8-fast(93.5%)及 OpenAI 的 GPT-5.6-luna(88.7%)。
- 評測規模與機制:PinchBench 包含 59 個模型、23 個真實場景及 147 項任務,覆蓋程式碼開發、安全分析等七大類,採用「自動化校驗 + LLM 評審」雙軌制,全程無人工幹預。
- 技術開源與架構:百度已在 GitHub 公開完整的評測流程與 147 個任務快照,體現了其基於 Orion AI 引擎的系統工程實力。