評估 36 個熱門 MCP 伺服器的代理可用性:逾 1/3 排行墊底
為何重要
MCP 生態正式從通訊規範邁向整合競賽,證明瞭「文件力」是比底層協定更關鍵的可用性因子。開發者必須正視 Agent 整合中的隱形成本,這也端倪出未來企業在建立 AI Agent 平臺時,工具描述的規範化將成為防範幻覺與錯誤操作的關鍵門檻。
文章作者開發 mcpgrade 工具,標檢 36 個主流 MCP(Model Context Protocol)伺服器,發現技術上符合規格但實際 Agent 可用性差的服務數量驚人。
- 僅有 15 個服務獲得 A 級評分,而 MongoDB 官方、Notion 官方、Airtable、firecrawl-mcp 等知名服務得分較低,其中 firecrawl 分數最低(57 分),並巨量偏差(134 個錯誤)。
- 研究歸納出主要問題為引數描述缺乏,排名墊底的錯誤主要來自 D004 規則(引數無描述);例如 MongoDB 與 Airtable 各有 66 個此類錯誤。
- 真實模型評估發現,文字描述完善的服務能確保工具呼叫準確率達 100%,但在 firecrawl 巨量且模糊的工具目錄下,模型拒絕執行不當任務的準確率僅剩 50%。