訓練模型而非讀者:可驗證啟用解釋的可解碼監督
為何重要
這項研究直擊當前「可解釋 AI」與「AI 安全」的關鍵痛點:現有衡量模型內部解釋忠誠度的方法在對抗攻擊下極度脆弱。RECAP 所倡導的「檢核點從 prose 轉移至程式碼」架構,提供了一種更強健的紅隊測試與內容審查機制,對於開發具備獨立驗證能力的企業級安全模型具有實質參考價值。
- 在 Qwen-2.5-7B 的標準測試中,5/5 的執行時 Run 均會發展出模型無法解釋的私有程式碼。
- RECAP 方法在沙箱模型中消除了文字解釋所需的關鍵程式碼,且額外計算成本僅為 +0.001-nat。
- 經 RECAP 調整後,獨立探針在對抗攻擊中檢測謊言的能力顯著提升(AUC 0.95,對抗控制組僅 0.51),且對真實宣告的辨識率為非 RECAP 組(AUC 0.96 vs 0.82)。