ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

選擇「毒藥」:學習選取毒藥集合以強化 LLM 後門攻擊效能

研究 1 個來源 · 8 天前
為何重要

此研究揭露了當前 LLM 安全防禦試驗方法的嚴重缺口,證實了「資料組成」比數量更能影響受害嚴重程度。若攻擊者能像 SAILS 一樣精準挑選毒藥標本,現有的檢測與清洗工具將失效。對防禦者而言,這意味著單純的疊加防護可能不足,必須在訓練流程中實作更動態、可評估的資料審計機制。

現有的 LLM 後門攻擊評估方法通常透過隨機抽樣加入被中毒標本,導致低估最糟情況下的脆弱性。本研究提出新的架構,將「毒藥集合的選擇」視為受限預算下的集合最佳化問題。

  • 在 LLaMA-3-8B 的不同設定中,若模型、乾淨資料與中毒標本數量固定,攻擊成功率僅取決於被選中的「毒藥集合」,波幅從 3% 到 80% 不等。
  • 研究發表了 SAILS(Set-level Audit-Informed Iterative Learned Selection),利用少數幾百次微調與評估執行來學習集合評分器,從數以百萬計的候選集合中進行排序並選出短名單。
  • SAILS 在多項指標上表現優異:相較於前述的最強基準,其保留攻擊成功率平均提升了 30 個百分點,且具備跨規模的遷移能力。
LLaMA-3-8BBackdoor AttacksSAILSData PoisoningOracle Budgeted

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00