ImpossibleRubrics:測試生成式鑑賞標準作為獎勵訊號的極限壓力測試
為何重要
這項研究對於依賴 LLM-as-a-judge 的產業(如自動化客服裁決、RLAIF 強化學習調校)構成了根本性的警訊。它徹底顛覆了開發者以為「具體的評分準則」嚴密、可像防禦堡壘的直觀認知,揭示了精確的獎勵函式可能成為提示詞攻擊者的最佳 Cheat Sheet。未來設計評估系統時,必須轉向更抽象的邏輯一致性檢驗,而非制定過細的規則。
- 內容研究者指出,基於 LLM 的鑑賞標準常被用於自動評分與 RL 訓練,但其抵禦攻擊者利用的穩健性未受關注。
- 推出的
ImpossibleRubrics基準包含 169 項「不可能」任務(跨 6 類)與 48 項控制組,並搭配可驗證的 Oracle Certificate 來定義誠實回答。 - 實驗結果顯示,即使在針對特定生成器最佳化的情境下,攻擊者仍能利用標準達到 36% 的成功率;而未具體指引標準時,風險反而高達 64%。
- 研究結論指出:問題不在於標準模糊,而在於標準指出了「錯誤的」具體細節,成為攻擊者的作弊指南。