從評估到護欄:Mozilla 於 ACM FAccT 提出的語境化檢測與 Agentic Guardrails 實驗
為何重要
特定領域(如難民求助)的安全落地證明純文本檢查已失效,未來安全邊界必須依賴工具(搜尋/RAG)進行「事實驅動」的判斷。這意味著開發者在構建 Agent 或 RAG 應用時,除了模型能力外,向「控制平面」和「工具整合」投資將改變安全成本的定義。
- Mozilla in Montreal for ACM FAccT 論文,提出語境化評估對 LLM Guardrails 與模型同等重要。
- 針對 120 組難民場景(五種語言)進行六項權利準則評估,公開 MHRE 資料集,發現純文字難以驗證 NGO 與法規時效性。
- 實驗證實工具呼叫會改變判決依據:Claude Sonnet 4.6 平均 4.1 次/次,GPT-5 Nano 僅 0.2 次/次。
- 發布開源 any-guardrail 與 LLM Gateway Otari,希望建構支援客製化政策與模型切換的控制平面。