ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

PIMiner:針對 LLM 智慧體的自動提示注入紅隊測試系統

研究 1 個來源 · 10 小時前
為何重要

PIMiner 解決了現有紅隊方法泛化性差與依賴強化學習的痛點,提供了一套可高效移植的測試框架。文中高達 60% 以上的攻擊成功率資料,直指先進大型語言模型在 prompt injection 防禈上仍存在巨大漏洞,凸顯業界建立標準化安全測試機制的迫切性。

為了有效評估 LLM agent 的提示注入安全風險並蒐集防禈訓練資料,研究人員提出了 PIMiner,這是一個專屬於自動紅隊測試的 agentic system。

  • 現有方法主要依賴強化學習,泛化性不佳;PIMiner 在(資料集、目標模型)對的序列上訓練,並建立策略庫,使學到的策略可直接轉移至 unseen 目標模型,無需額外訓練。
  • 每個測試樣本僅需目標 agent 的少量查詢(例如 10 次)即可執行攻擊。
  • 在 IPIArena 上的測試顯示攻擊 Gemini-2.5-Pro 的攻擊成功率(ASR)為 76.2%GPT-5.161.9%Claude-Sonnet-4.542.9%
  • 在 AgentDojo 環境中,PIMiner 對 Gemini-2.5-Pro 的攻擊成功率達到 86.7%GPT-5.153.3%Claude-Sonnet-4.540.0%
PIMinerPrompt InjectionRed TeamingLLM SecurityASR

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00