ORCA-bench:語言模型代理程式多大程度具備應急維護上的線上維護能力?
為何重要
此 benchmark 驗證了前沿模型在生產應急維護(SRE 階段)的毛邊:即便模型能寫程式,卻缺乏從噪音資料流中可靠提取因果的能力。這意味著 AI 自動化目前仍受限於「安全邊界」,企業需維持高比例的人工審查機制來避免資產損失。對投資人與技術決策者而言,這證明瞭單純的生成式 AI 能力不足以支撐硬體級別的「一人公司」Oncall 模式,推動了對增強推理能力與環境感知技術的投資需求。
雖然大型語言模型在寫程式與搜尋上表現出色,但在面對生產環境中充滿噪聲的指標、日誌與追蹤資料進行根因分析(RCA)時,效能仍大幅落後。ORCA-bench 將通用程式代理程式置於模擬真實生產的 On-call 環境中,附帶一個經過 OpenTelemetry 儀器化、包含六天資料的微服務系統,並公開 Prometheus、Jaeger、Grafana 及完整原始碼。研究評估了 1,079 重具體條件變化的根因分析任務,結果顯示頂尖模型在「中等困難」情境下僅達 25.3% 的正確率,而在移除原始碼存取許可權後,所有模型的評分皆會下降。最弱模型高達 40% 的報告出現虛構根因,顯示當前 AI 雖然在受控的寫碼任務上表現進步,但在處理生產系統的複雜因果推論上仍存在巨大代價。