ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

EvoSafeHarness:演演化模型與領域專用的 Agent 安全機制最佳化框架

研究 1 個來源 · 12 天前
為何重要

LLM 安全生態長期受困於「防禦準確率」與「系統效用」的權衡,過度防禦往往犧牲服務可用性。EvoSafeHarness 的出現代表了安全驗證從靜態規則邁向「資料驅動的動態最佳化」的重要轉折。這對開發者而言意味著部署 Agent 時不再需要手動除錯僵硬的防禦規則;對投資人而言,這也重新定義了「Agent 安全性」的框架價值,從單純評估模型能力轉向最佳化防禦層與使用者參與度的平衡。

LLM agent 需要超越單一模型防線的系統級權衡來防範提示注入與有害請求,但現有安全機制常是單一設計,難以適應不同模型與領域的特性。本文提出 EvoSafeHarness,一個專為凍結模型在目標領域合成可部署安全機制的最佳化框架。

  • 框架透過模型行為、領域規格與新語境對抗性審查,聯合搜尋自然語言政策與可執行的程式碼邏輯。
  • 在 DecodingTrust-Agent 基準測試中,平均攻擊成功率從 45.6% 降至 10.0%,且有 14 個評估分割槽表現最佳。
  • 在 AgentDojo 上於 0% 攻擊成功率下達到 82.8% 的效用,比同效能點的 CaMeL 高出一倍,且能標準化轉移至無法觀察的 AgentDyn 套件。
EvoSafeHarnessLLM AgentSafetyDeploymentDecodingTrust-AgentAgentDojo

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00