PIMiner:針對 LLM 智慧體的自動提示注入紅隊測試系統
為何重要
PIMiner 解決了現有紅隊方法泛化性差與依賴強化學習的痛點,提供了一套可高效移植的測試框架。文中高達 60% 以上的攻擊成功率資料,直指先進大型語言模型在 prompt injection 防禈上仍存在巨大漏洞,凸顯業界建立標準化安全測試機制的迫切性。
為了有效評估 LLM agent 的提示注入安全風險並蒐集防禈訓練資料,研究人員提出了 PIMiner,這是一個專屬於自動紅隊測試的 agentic system。
- 現有方法主要依賴強化學習,泛化性不佳;PIMiner 在(資料集、目標模型)對的序列上訓練,並建立策略庫,使學到的策略可直接轉移至 unseen 目標模型,無需額外訓練。
- 每個測試樣本僅需目標 agent 的少量查詢(例如 10 次)即可執行攻擊。
- 在 IPIArena 上的測試顯示攻擊 Gemini-2.5-Pro 的攻擊成功率(ASR)為 76.2%,GPT-5.1 為 61.9%,Claude-Sonnet-4.5 為 42.9%。
- 在 AgentDojo 環境中,PIMiner 對 Gemini-2.5-Pro 的攻擊成功率達到 86.7%,GPT-5.1 為 53.3%,Claude-Sonnet-4.5 為 40.0%。