SecRespond:評估真實世界中後滲透事務回應 AI 代理的基準
為何重要
此研究揭示了目前大型語言模型在安全賽道的真實侷限:即使是最先進的模型,面對「後滲透」時也缺乏主動挖掘隱秘獲取途徑與製作實用修復計畫的能力。這對於安全防禦策略意義重大,代表現階段的自動化修補或威脅消除工具尚無法完全取代人工深度調查,企業在引導 Agent 主導事務回應前需預留人工介入機制。
面對 LLM 代理在網安領域的實際應用,現有基準測試多忽略攻擊發生後(後滲透)的複雜情境,新推出的 SecRespond 基準試圖填補這一缺口。
- 針對後滲透情境推出評估 AI 代理事務回應流程的首個基準測試 "SecRespond"。
- 測試環境涵蓋 10 個網路範圍、4 種入鎖途徑、21 項 ATT&CK 技巧以及 5 個作業系統。
- 在這些環境下評估了 23 個前沿大型語言模型,結果發現沒有任何模型能在單一範圍內達成 100% 的檢測與修復。
- 研究顯示模型雖能可靠對應警告,但在主動挖掘隱秘攻擊與製作全面驗證的修復計畫上仍存在瓶頸。