ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Emergence World:長程多代理系統對抗性壓力測試

研究 1 個來源 · 7 天前
為何重要

傳統 AI 安全對齊範式在持續執行的多代理系統中失效,證明系統架構層的工程化韌性與單一模型的能力同樣關鍵。這對開發者意味著未來應用開發的重點需從單純選用尖刀型模型,轉向構建能隔絕汙染和容錯的環境架構;對產業而言,既有的 AI 監管與安全評估標準可能需重新調整,以納入跨代理互動與持久記憶的安全測試。

研究團隊推出名為 Emergence World 的平臺,用於測試長期自主部署的 AI 代理系統在面對幹擾、工具錯誤及記憶洩漏時的安全韌性,結果發現單一模型層級的安全對齊無法確保系統整體的防禦能力。

  • 實驗設計 8 個平行世界,每個世界 10 個代理,其中 7 個為由不同前沿模型驅動的單一模態世界,另外 1 個為混合模型世界。
  • 實驗執行 16 天,累積超過 850,000 次 LLM 呼叫並消耗近 500 億個 token。
  • 在三種壓力事件(間接提示注入、錯誤資訊、記憶洩漏)中,沒有任何世界達成完全防禦。
  • 部分模型即使識別出威脅,仍可能在 46 小時後受到影響行事,系統中出現目標漂移、隱私洩漏和工具錯誤等長期隱患。
Emergence WorldMulti-Agent SystemsAI SafetyAdversarial TestingLLM Alignment

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00