誘餌方向最佳化:一種對抗 LLM 拒答特徵磨損的後驗防禦方法
為何重要
開源大語言模型 (LLM) 的安全性防護長期以來受制於昂貴的反繞過微調成本,DDO 提供了一種透過工程手法強化防線的解決方案,大幅降低了部署安全護欄的算力門檻。這意味著開發者與企業在不犧牲模型能力或核心引數的前提下,能更輕鬆地針對新檢查點進行安全加固,對擴大受信任的開源模型應用範圍具有關鍵意義。
背景與限制
面對利用拒答特徵磨損 探測與移除拒答功能的繞過手法,傳統防禦通常需要對每一個檢查點進行昂貴的安全微調。新提出的方法透過在 MLP 神經元注入誘餌訊號,以低成本解決此問題。
具體事實與資料
- DDO 不需要基礎模型的微調,透過簡單的機制原理實現高效的後驗權重編輯。
- 在標準 RFA 攻擊下,該方法在六個模型家族上的攻擊成功率 (ASR) 低於 10%。
- 在適應性多階段攻擊下,Llama-3-8B-Instruct 的 DDO 效能表現與經過訓練的防禦模型相當(最差情況 ASR 65% vs 58%),且最佳化成本降低了 30 至 450 倍。
- Heretic 重量級攻擊下的 ASR 從 88.7% 銳減至 18%。