Handbook.md:顯示長期政策檔案並無法可靠地約束 agents
為何重要
這項研究揭示了當前 LLM 在長期、複雜任務中的「倫理/政策天花板」,即 agents 並非可靠地遵守緩慢變化的長文手冊。對於企業開發者而言,這證明僅靠 system prompt 不足以構築安全的 agent 系統,必須引入強制檢核;從產業觀點看,政策遵循能力正逐漸成為衡量企業級應用可靠性的核心指標。
鑑於企業已廣泛部署以政策檔案為依據的 agents,現有 benchmark 偏重任務完成度,研究者推出 HANDBOOK.md 基準測試來衡量長期指令遵循能力。
- HANDBOOK.md 包含 65 個 agentic 任務,對應 20 到 124 頁且專家撰寫的作業程式。
- 測試環境模擬真實企業工具鏈(如 email、issue tracking),並透過調整規則與門檻來抵禦模型記憶策略。
- 在包含 824 項程式化標準的嚴格評分下,30 種配置中表現最佳者通過率僅 36.2%,多數前沿模型低於 25%。