CADWorld:長週期電腦輔助設計的 Computer-Use 評測基準
為何重要
CADWorld 指出當前通用 AI disembodied agent 與專業工程工作流程之間的巨大鴻溝,證實目前最強 agent 僅達專家表現的 20%。這標誌著 agent 能力評估正從通用桌面操控走向需要高精度幾何邏輯與持久狀態管理的垂直領域;對產業而言,這意味著 OpenAI / Anthropic 等公司不僅需要語言模型,更需具備工程推理能力的具身智慧解決方案。對開發者投入排版、繪圖等垂直 agent 的人來說,這是確認具體工程邏輯複雜性的關鍵驗證。
研究團隊推出 CADWorld,作為評估 FreeCAD 中長期 Computer-use 能力的新基準,旨在解決現有評測對專業工程 workflow 覆蓋不足的問題。
- 該基準包含 11 個機械 CAD workflow 類別共 200 個任務,涵蓋 sketching、part modeling、assembly、CAM、FEM、measurement、mesh processing 與 technical drawing。
- 代理程式透過截圖與 GUI 動作操作,成功與否取決於對儲存的 FreeCAD artifacts 執行特定檢查,涵蓋幾何屬性、引數結構、約束與模擬結果。
- 在測試中,七個當前 agent 的最佳表現在完整基準上僅達到 17.5% 的成功率,而專家參考分數則高達 87.0%。