ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SWE-Serve:揭示 AI 程式碼代理在推論服務上的實作落差

工具 1 個來源 · 51 分鐘前
為何重要

現有商業 Agent 評價多集中在通用的軟體工程任務,SWE-Serve 的發表在於填補「推論管道」這一關鍵斷層,證實了 AI 在撰寫系統軟體時,僅靠本地測試無法確保恰當的「Last Mile」可靠性。這對於致力於 DevOps 自動化的企業具有重大意義,提醒了採用 AI 輔助維運系統時的隱形成本與複雜度挑戰;同時,高分低效的結果也暗示了未來投資重點將轉向具備工程師級系統整合能力的 Agent 方案,而非單純提升準確率。

NVIDIA 與 SGLang 團隊推出 SWE-Serve,專注於評估程式碼代理在推論工程任務的表現,特別強調本地測試通過但在真實推論環境下失敗的現象。

  • 評估基於 83 個已合併的 SGLang 變更,產生 53 個推論最佳化任務,涵蓋模型啟用、解碼、快取、排程、API 與分散式執行,其中 41 個使用 NVIDIA H100
  • 在 19 個啟動實體伺服器的測試中,同一補丁在排除即時服務檢查下通過率為 69.4%,但包含完整驗證後僅 45.9%(約三分之一補丁在真實環境失敗)。
  • 涉及多個 runtime 領域(請求處理、排程、模型執行、KV-cache 管理)的任務,通過率比單一領域任務低 21.3 個百分點
  • 11 款模型中 Claude Opus 5GPT-5.6 Sol 表現最佳,平均 pass@1 達 75.5%,但即便評分相同,單任務成本與執行時間差異極大(約 $0.95 至 $7.24)。
SWE-ServeSGLangAI Coding AgentInference ServingNVIDIA

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 00:00