ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Handbook.md:顯示長期政策檔案並無法可靠地約束 agents

研究 1 個來源 · 8 天前
為何重要

這項研究揭示了當前 LLM 在長期、複雜任務中的「倫理/政策天花板」,即 agents 並非可靠地遵守緩慢變化的長文手冊。對於企業開發者而言,這證明僅靠 system prompt 不足以構築安全的 agent 系統,必須引入強制檢核;從產業觀點看,政策遵循能力正逐漸成為衡量企業級應用可靠性的核心指標。

鑑於企業已廣泛部署以政策檔案為依據的 agents,現有 benchmark 偏重任務完成度,研究者推出 HANDBOOK.md 基準測試來衡量長期指令遵循能力。

  • HANDBOOK.md 包含 65 個 agentic 任務,對應 20 到 124 頁且專家撰寫的作業程式。
  • 測試環境模擬真實企業工具鏈(如 email、issue tracking),並透過調整規則與門檻來抵禦模型記憶策略。
  • 在包含 824 項程式化標準的嚴格評分下,30 種配置中表現最佳者通過率僅 36.2%,多數前沿模型低於 25%。
HANDBOOK.mdarXivagentsbenchmarkLLM

來源 · 1 篇報導

首發 Hacker News Front Page arxiv.org 21:01