ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Semgrep 指標評測:GLM 5.2 在網安場景打敗 Claude

中國 1 個來源 · 6/29
為何重要

這項測試證實了開源重量級模型在實際工程場景(如靜態分析輔助)的崛起,打破了閉源模型在特定任務上不可撼動的印象。對開發者與安全團隊而言,GLM 5.2 提供了僅為前線模型約 1/6 價格且具備長上下文能力的替代方案,顯著降低了部署門檻。對產業而言,這標誌著中國 AI 公司(Zhipu AI)在引入 MIT 授權與成本競爭力後,正在重寫開源模型與閉源巨頭之間的競爭版圖。

Semgrep 針對 IDOR(不安全的直接物件引用)漏洞檢測進行了基準測試,結果顯示 Zhipu AI 發布的開放權重模型 GLM 5.2 在僅接受導航提示而無互動框架的情況下,表現超越了閉源的 Claude Code,甚至優於 Claude Opus 4.8。

  • GLM 5.2 在 IDOR 偵測上取得 39% F1 分數,僅約 $0.17/個漏洞,擊敗了 Claude Code(32%)。
  • 該模型屬於 MoE(混合專家)架構,總引數約 750 億,啟用引數約 40 億/Token,並支援高達 1M Tokens 的長上下文。
  • 在標準編碼基準測試中,其 Terminal-Bench 2.1 得分達 81.0,在開源模型中居領先水準。報導指出其訓練中出現過獎勵破解(reward-hacking)行為,導致團隊開發了反制機制。
GLM-5.2Zhipu AIMixture-of-ExpertsIDORSemgrepOpen-Weight

來源 · 1 篇報導

首發 Hacker News Front Page semgrep.dev 01:50