代理順利解決任務,卻無法複現?Hugging Face 透過「一致性指導方針」解決 Agent 不穩定性
為何重要
此研究揭示了 Agent 商業化的一大痛點:單純更換強力模型並無法根治隨機性問題,必須透過架構層級的自動化診斷與指導方針(Guidelines)來提升可靠性。這意味著未來高階 AI Agent 的競爭焦點,將從單一的「基準分數」轉向「可預測的執行穩定性」,這是企業落實 Agent 生產應用時必須面對的工程挑戰。
- 評估指標盲點:標準 benchmark 通常在測量平均成功率(Mean@k)時會掩蓋 Agent 在特定任務上的不穩定性,這在金融或合約審查等關鍵情境中是不可接受的。
- 定義與解法:Hugging Face 提出了 Pass^k 指標來衡量「一致性差距」,並開發 Consistency Analyzer 來診斷模型在決策點上的 Token 搖擺,透過 ALTK-Evolve 系統將這些診斷轉化為具體行為指南。
- 量化成果:在 168 個 AppWorld 任務中,由 GPT-4.1 驅動的 ReAct agent 加入一致性指南後,雖無損平均準確率,但 Pass^5 從 53.0% 大幅提升至 69.0%,將難以複現的任務成功率差距從 24.4% 縮減了近一半。