ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

誘餌方向最佳化:一種對抗 LLM 拒答特徵磨損的後驗防禦方法

研究 1 個來源 · 7 天前
為何重要

開源大語言模型 (LLM) 的安全性防護長期以來受制於昂貴的反繞過微調成本,DDO 提供了一種透過工程手法強化防線的解決方案,大幅降低了部署安全護欄的算力門檻。這意味著開發者與企業在不犧牲模型能力或核心引數的前提下,能更輕鬆地針對新檢查點進行安全加固,對擴大受信任的開源模型應用範圍具有關鍵意義。

背景與限制

面對利用拒答特徵磨損 探測與移除拒答功能的繞過手法,傳統防禦通常需要對每一個檢查點進行昂貴的安全微調。新提出的方法透過在 MLP 神經元注入誘餌訊號,以低成本解決此問題。

具體事實與資料

  • DDO 不需要基礎模型的微調,透過簡單的機制原理實現高效的後驗權重編輯。
  • 在標準 RFA 攻擊下,該方法在六個模型家族上的攻擊成功率 (ASR) 低於 10%。
  • 在適應性多階段攻擊下,Llama-3-8B-Instruct 的 DDO 效能表現與經過訓練的防禦模型相當(最差情況 ASR 65% vs 58%),且最佳化成本降低了 30 至 450 倍。
  • Heretic 重量級攻擊下的 ASR 從 88.7% 銳減至 18%。
LLMSafetyDecoy Direction OptimizationRFAOpen-source

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00