Noisegate – 為不可信賴 AI 代理打造的差分隱私閘道器
為何重要
這項技術重新定義了 AI Agent 處理敏感資料的「信任邊界」設計原則——將安全強制執行於模型下方的廉價驗證層,而非依賴 LLM 自身的透明度。這種架構為企業級 AI 助手提供了一個具體的解決方案,能夠在模型易受 manipulated 攻擊的情況下,依然滿足嚴格的資料隱私合規要求。
Noisegate 是一個開源原型,專為不受信任的 AI 代理(如 Claude Desktop)提供差分隱私保護,確保即使 AI 系統受到攻擊或操控,個別資料紀錄亦無法被還原或推斷。
- 系統的核心噪聲機制與業界標竿 OpenDP 驗證一致,35 項噪聲規模檢查的誤差低於 1e-9,並透過 50 萬筆樣本的分佈測試。
- 採用混合 zCDP 合成方法,在不降低隱私保護等級的前提下,將查詢次數上限從 naive 方法的 100 次提升至 308 次。
- 開發者可利用其 250+ 個測試案例的 CI 執行環境,對抗差分攻擊、成員推論攻擊以及身分識別攻擊,並將攻擊結果固化於回歸測試中。