ProgramDistill:從互動式 Web 應用程式到可驗證的 SWE 任務
為何重要
傳統基準側重於指令執行的精準度,卻忽略了真實工程場景中「從半成品推斷邏輯」的難度。ProgramDistill 揭露了當前最強模型在深層上下文管理與全棧系統整合上的能力侷限,顯示 Agent發展已從單點自動化邁向更複雜的系統層級挑戰。
現今 Coding agents 通常透過 issue 或指令定義期望行為,但在實務網頁開發中,agents 需從既有功能軟體推斷行為並應用於不完整應用。ProgramDistill 提出 a benchmark,透過與功能性參考應用程式的互動來評估 agents 的功能發現與實作品質。
- 建立
mine-craft-patch管線,無需人工介入從 26 個應用程式產出 1,975 個可重播行為與 4,063 個任務。 - 在 9 個前沿 Coding agents、面對全應用程式重建時,
GPT-6 Astra達到 49.2% 成功率,Claude Opus 5則為 28.8%。 - 在部分應用程式重建中,隨著恢復深度從 1 增加到 8,成功率的落差十分顯著:對應從 100%(Astra)降至 64.0%,從 96%(Opus 5)降至 32%。