Jev:利用 Reinforcement Learning for Calibrated Decisions (RLCD) 實現的 AI 對齊失敗零樣本次偵測器
為何重要
對於開發者與安全檢驗團隊而言,Jev 提供了一種低成本且高效的解決方案來識別複雜的對齊失敗(如 sycophancy 或 reward hacking),顯著降低了安全測試的門檻與算力成本。 這項技術驗證了「零樣本」方法在精確度(AUROC 0.886)上的可行性,未來或許能取代部分昂貴的 per-pass evaluation 標準,改變企業如何監控生產環境中的模型安全。 此外,將偵測重心從生成式判斷轉向校準決策架構,可能激發更多關於如何以更少算力進行安全基準測試的產業興趣。
現有的對齊偵測器多為昂貴的生成式評分者或僅輸出單一標籤的分類器,如 Llama Guard;本研究提出名為 Jev 的模型,利用 Reinforcement Learning for Calibrated Decisions (RLCD) 來回答具有校準機率的多元問題。
- Jev 接受了 RLCDAlignBench 的測試,涵蓋 10 種對齊失敗型別(如 jailbreaks、deception 等),評估物件包含 5 個目標模型,資料標籤來自基準測試分數針及兩項人類標記。
- 在零樣本基準測試中,Jev 的中位數 AUROC 達到 0.886,優於大多數監督式基線,且成本僅為傳統 LLM-judge 評分器的 1/63。
- 研究發現模型的表現關鍵在於輸入中包含標籤的欄位資訊,問題措辭的影響則較小。