ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

訓練模型而非讀者:可驗證啟用解釋的可解碼監督

研究 1 個來源 · 14 天前
為何重要

這項研究直擊當前「可解釋 AI」與「AI 安全」的關鍵痛點:現有衡量模型內部解釋忠誠度的方法在對抗攻擊下極度脆弱。RECAP 所倡導的「檢核點從 prose 轉移至程式碼」架構,提供了一種更強健的紅隊測試與內容審查機制,對於開發具備獨立驗證能力的企業級安全模型具有實質參考價值。

  • 在 Qwen-2.5-7B 的標準測試中,5/5 的執行時 Run 均會發展出模型無法解釋的私有程式碼。
  • RECAP 方法在沙箱模型中消除了文字解釋所需的關鍵程式碼,且額外計算成本僅為 +0.001-nat。
  • 經 RECAP 調整後,獨立探針在對抗攻擊中檢測謊言的能力顯著提升(AUC 0.95,對抗控制組僅 0.51),且對真實宣告的辨識率為非 RECAP 組(AUC 0.96 vs 0.82)。
RECAP可解釋性啟用解釋Qwen-2.5-7BAI 安全

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00