GRP-Obliteration:單一無標籤提示詞即可使 LLM 解除安全對齊
為何重要
研究揭示了當前基礎模型的安全對齊機制存在嚴重的架構性風險,攻擊者僅需一個無標籤的 prompt 即可破壞防線。這對企業在部署內部 AI 代理與過濾器時是一大警訊,迫使人們重新審視現有 RLHF 標準是否能抵禦實務中的 prompt 汙染攻擊。
- 研究提出 GRP-Oblition 方法,利用組相對政策最佳化(GRPO)直接移除目標模型的安全限制,並發現僅需一個無標籤提示詞即可達成效果。
- 該方法在 15 個 7-20B 引數模型(包含 GPT-OSS、Distilled DeepSeek、Gemma、Llama、Ministral、Qwen)上進行了評估,結果顯示其對於對齊模型的擊破力強於現有 SOTA 技術。
- 測試涵蓋語言模型及擴散式影像生成系統,包含六種效用基準與五種安全基準,證明安全性對齊並非不可破壞。