ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

GRP-Obliteration:單一無標籤提示詞即可使 LLM 解除安全對齊

研究 1 個來源 · 7 天前
為何重要

研究揭示了當前基礎模型的安全對齊機制存在嚴重的架構性風險,攻擊者僅需一個無標籤的 prompt 即可破壞防線。這對企業在部署內部 AI 代理與過濾器時是一大警訊,迫使人們重新審視現有 RLHF 標準是否能抵禦實務中的 prompt 汙染攻擊。

  • 研究提出 GRP-Oblition 方法,利用組相對政策最佳化(GRPO)直接移除目標模型的安全限制,並發現僅需一個無標籤提示詞即可達成效果。
  • 該方法在 15 個 7-20B 引數模型(包含 GPT-OSS、Distilled DeepSeek、Gemma、Llama、Ministral、Qwen)上進行了評估,結果顯示其對於對齊模型的擊破力強於現有 SOTA 技術。
  • 測試涵蓋語言模型及擴散式影像生成系統,包含六種效用基準與五種安全基準,證明安全性對齊並非不可破壞。
GRP-ObliterationGRPOSafety AlignmentDeepSeekLLMPrompt Attack

來源 · 1 篇報導

首發 Hacker News Front Page arxiv.org 22:31