溯源水印對 AI Agent 行為的影響:傭金效應與取樣偏差
為何重要
這項研究指出,為了合規而在模型層級(Layer)強制加入的水印技術,可能引入非預期的「取樣偏差」,改變 Agent 的執行邏輯與安全性防禦;這意味著未來開發者在整合 Claude 模型時,必須重新評估水印對系統安全邊界的影響,這對專注於 AI 合規性與安全性的基礎設施供應商是一個關鍵的技術課題,也顯示歐盟 AI 法規的技術實施階段已衝擊產品設計。
Anthropic 計畫在未來 Claude 模型中部署基於 Google DeepMind SynthID-Text 的不可見水印,以符合歐盟 AI 法規的溯源要求,但其內建的賽局式取樣(Tournament sampling)機制可能改變 Token 選擇,進而影響模型的拒絕機制與 Agent 的工具呼叫正確性。
- 在 BFCL v4 指令集測試中,phi-4 模型在溫度 1.0 時,有 16.8% 的工具呼叫結論在無水印與水印模式下不同(Churn),然而整體正確率僅下降 2.87%,顯示出隱藏的行為偏差。
- 研究發現水印會弱化模型面對 Prompt 注入時的拒絕行為,且錯誤模式如「錯誤的工具引數」或「格式錯誤」會因模型而異,即使觀看整體準確率也難以察覺這種實際判讀分歧。
- 實驗使用了 HuggingFace 的 SynthIDTextWatermarkLogitsProcessor,設定 30 層賽局層級、5 個 n-gram 長度與 1,024 記錄上下文,在 200 個 HarmBench 有害行為與 100 個 JailbreakBench 控制組上進行驗證。