ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

為誰的安全?拒絕主題中的正確子集,而非整體拒絕

研究 1 個來源 · 15 天前
為何重要

過去大廠常以「拒絕率」作為模型安全指標,但新研究證明單純拒絕率高不代表更安全,甚至會因過度拒絕而讓模型在某場景下形同癱瘓。對產業來說,安全護欄技術已從「粗放式攔截」演進為「邊界精準控管」,未來企業能依場景(如公共服務與教育)定製化定義哪些該給、哪些該拒,將是降低風險且維持產品可用性的關鍵。開發者必須在訓練時引入分佈內良性資料與邊界對照,而非依賴單一標籤。

現行安全對齊多基於主題分類導致過度拒絕;新研究提出「邊界感知自我分散」,讓模型處理特定情境(如公民導師回答政治事實但拒絕分析話術)。- 研究定義「主題宇宙」目標,僅拒絕有害子集(如影響選舉操縱)而非整個政治話題。- 透過升級覆蓋修復策略,將訓練資料遺漏率從單次生成的 19.88% 降至 0.20%。- 在 Qwen3-8B 上結合邊界提詞對資料後,離線良性提詞的過拒率從 74% 降至 5.20%,同時有害拒絕率維持約 87%。

LlamaGuard-3Safety AlignmentSelf-DistillationBoundary-AwareOver-refusal

來源 · 1 篇報導

首發 Hugging Face Blog huggingface.co 22:23