為誰的安全?拒絕主題中的正確子集,而非整體拒絕
為何重要
過去大廠常以「拒絕率」作為模型安全指標,但新研究證明單純拒絕率高不代表更安全,甚至會因過度拒絕而讓模型在某場景下形同癱瘓。對產業來說,安全護欄技術已從「粗放式攔截」演進為「邊界精準控管」,未來企業能依場景(如公共服務與教育)定製化定義哪些該給、哪些該拒,將是降低風險且維持產品可用性的關鍵。開發者必須在訓練時引入分佈內良性資料與邊界對照,而非依賴單一標籤。
現行安全對齊多基於主題分類導致過度拒絕;新研究提出「邊界感知自我分散」,讓模型處理特定情境(如公民導師回答政治事實但拒絕分析話術)。- 研究定義「主題宇宙」目標,僅拒絕有害子集(如影響選舉操縱)而非整個政治話題。- 透過升級覆蓋修復策略,將訓練資料遺漏率從單次生成的 19.88% 降至 0.20%。- 在 Qwen3-8B 上結合邊界提詞對資料後,離線良性提詞的過拒率從 74% 降至 5.20%,同時有害拒絕率維持約 87%。