ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

GPT-Red:大規模自動化紅隊測試代理

模型 1 個來源 · 7 天前
為何重要

自動化紅隊測試的規模化能顯著降低對人工紅隊的依賴成本,並解決大型語言模型安全性演進中的效率瓶頸。此案例展示的「自我強化飛輪」暗示未來模型迭代的速度將不僅取決於算力,更取決於這種針對性強化的自主進化能力。對開發者而言,這代表生產環境的防禦機制即將從被動修補轉向由 AI Agent 主動演進。

Methexis Labs 發布 GPT-Red,這是一個專為找出前沿大語言模型(LLM)新穎提示注入攻擊所設計的自動化紅隊測試代理,旨在評估並強化生產系統的可靠性。此代理採用自我對弈演算法,即攻擊代理將同時對抗一群多元化的防禦代理。透過與大型 Reinforcement Learning (RL) 後訓練運算規模相當的環境進行訓練,GPT-Red 成功用於對抗性訓練出目前最能抵禦提示注入的 GPT-5.6 模型。

  • 規模創新:這是目前紀錄下單一最大規模的 LLM 安全性訓練任務。
  • 目標模型:成功訓練出目前對提示注入最具抵抗力的 GPT-5.6。
  • 效能超越:在破解舊版模型(最高至 GPT-5.5)及發現成功攻擊樣例數量方面,均優於人類紅隊成員。
GPT-RedGPT-5.6Automated Red TeamingPrompt InjectionSelf-PlaySafety

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00