內容標記機制改變 AI Agent 行為,安全性與工具呼叫可能受幹擾
為何重要
對開發者與企業而言,部署具備水印機制的模型時,必須將標記帶來的行為差異納入 Red Teaming 範圍,特別是針對自動化 Agent 的工具呼叫準確度與 Prompt Injection 防護。此類發現提醒產業,強制性內容溯源技術若未經過完整的邊緣情況測試,可能會意外降低模型的實用性並增加安全風險。
為了符合歐盟 AI 法規要求,Anthropic 和 OpenAI 等大廠已匯入不含機讀程式碼的 SynthID-Text 水印技術,旨在確立 AI 內容的來源身分。Lasso Security 的測試指出,這些標記幹擾了模型對下一個 token 的預測偏折,進而引發意料之外的行為變化。
- 在工具呼叫方面,根據 BFCL v4 單輪 AST 基準測試,受測的 phi-4、Llama-3.1-8B、Qwen3 各版本、gemma-3 系列及 Granite-3.2-8B 等七個模型中,有六個模型的準確率因標記而下降,這可能導致 AI 選錯正確的工具或無法正確解析輸入引數。
- 在惡意提示詞注入 測試中,啟用水印後,模型回應有害請求的拒絕率發生了變化,且攻擊成功率顯著上升,這顯示該技術可能在安全防禦機制上產生漏洞。