Real-SWE 發布:在私人企業程式碼庫上評測前緣 AI 模型
為何重要
Real-SWE 挑戰了當前 AI 開發代理「即買即用」的迷思,證明通用模型在理解企業封閉的商業邏輯與既有架構上仍面臨巨大障礙。 這不僅為企業評估 AI 工具提供了即時的生產級資料,也從投資角度揭示了市場方向:能深度適配特定垂直業務領域(如金融稅務)的 AI 工具,恐將是下一代 CI/CD 工具的關鍵卡位點。
Real-SWE 是一款針對私人企業程式碼庫的新基準測試,其任務直接取材於真實生產環境的專案,評估前沿 AI 模型在處理複雜商業邏輯時的能力。
評測任務包含計費、稅務計算及跨服務整合等具商業後果的工作,並要求模型適應貴方特有的架構與程式碼慣例。
分析顯示,模型在真實企業環境中的表現極不穩定;在短時間部署 <10 分鐘的情境下,失敗率高達 71.4%,長時間部署則為 73.4%。