Safety for Whom? 邊界感知自我式知識蒸餾以實現受控 LLM 安全拒絕
為何重要
這項研究證明調整訓練資料的組成(特別是邊界對資料)可以有效解決模型因過度謹慎而拒絕良性輸出的「超級拒絕」問題,而非單靠調整模型規模。 對產業而言,這意味著未來 LLM 產品化的競爭力將越來越依賴於「資料邊界工程」的能力,而非僅僅是模型說話的自然度或容量。 對開發者與投資人來說,這不僅提升了公共部門與特定場景(如客服)模型的可用性,也預示了專注於資料與對齊治理的服務商未來關鍵性。
現有的 LLM 安全對齊常被視為主題層級的問題,但實際部署中往往需要更精細的窄邊界控制(例如拒絕詢問政治操縱卻仍回答事實性問題)。本研究提出一種離線自我式訓練框架,旨在解決「超級拒絕(over-refusal)」等問題。
- 使用 Qwen3-8B 配合 Escalate 機制,遺留無拒絕軌跡的提示比例由單次生成的 19.88% 降至 0.20%。
- 在政治說服測試中,Escalate 產生的拒絕資料訓練使目標領域拒絕率攀升至 84.75%,不安全回應率降至 0.14%。
- 利用邊界對資料訓練,合規邊界上的超級拒絕可從 32.94% 嚴重縮減至 4.16%,證明資料組成是折衷安全的關鍵。