ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

無法複製上下文的防護無法提供可靠的 LLM 安全性

研究 1 個來源 · 3 天前
為何重要

本研究揭示了讓大型語言模型同時具備「有用能力」、「可靠安全性」與「開放存取」三者兼得的技術不可能三角,挑戰了過去對於通用模型無需身分驗證即可實現絕對安全的預期。對於開發者與產業而言,這意味著未來的防護策略不能僅依賴輸入層的安全過濾,必須納入「身份識別」與「上下文不可複製性」作為根本;投資人也應關注那些強調信任憑證、許可權控制與安全開源生態的解決方案。

現有的 LLM 安全機制多以預先分析提示詞來決定回應是否安全,導致在雙用途場景下(同一答案可用於受授權專業人士或攻擊者)的安全性難以落實。研究指出,當可用證據可輕易複製時,攻擊者便能模仿良性互動歷史。研究結果提出了「安全性三難困境」:在這三個目標中,有用能力、可靠安全性與開放存取無法同時共存。

  • 研究將模型能力與下游使用證據分離,並計算出攻擊者最高的輔助水平(下限)。
  • 證明單純基於可複製上下文的安全機制無法提供可靠防護。
  • 提議使用「可信憑證」補強現有防護,透過難以複製的資訊來預測實際的下游使用。
Safety TrilemmaLLM SafeguardsDual-use TasksHugging FaceAdaptive AttacksTrusted Credentials

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00