ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SkillJack:自演化代理的「技能後門」植入策略

研究 1 個來源 · 1 天前
為何重要

SkillJack 揭示自主代理系統的安全盲點:攻擊者不再需要維持中毒的上下文,只要讓代理「學會」惡意技能即可永久植入手冊中,這改變了過去針對執行時記憶汙染的防禦策略。對於開發者使用 SkillX 等自演化架構而言,這迫使他們必須在技能倉庫(Skill Repository)建立全新的「溯源審查」機制,而非依賴單純的輸入過濾。投資人與蓄勢待發的 AI 代理廠商應意識到,代理的社交導覽能力若不帶有審計遮蔽,將面臨級聯式的帳號劫持風險。

自演化代理正將互動歷史轉化為可重用技能,但新隱患浮現:惡意經驗可能被代理自身重構為持久行為。研究團隊提出 SkillJack,繞過執行時上下文檢測,改為攻擊代理將體驗轉化為技能的學習管道。

  • 在 SkillX 系統上,安全檢測率因技能提煉而從 98.5% 掉落至 11.4%,植入技能的攻擊成功率達 56.2%。
  • 至少 80.0% 的惡意技能在刪除原始中毒紀錄後依然存續,且會在良性查詢中意外被觸發。
  • SkillJack 引入「永續性隔離」概念,確保惡意偏差不會隨原始觸發資料的移除而消失。
SkillJackTencentAI 安全自演化代理後門攻擊SkillX

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00