IdeaAMBIG:評估研究構想規格中具備實作關鍵差距的基準測試
為何重要
這項研究精確地揭示了當前模型從論文閱讀到工程落地的技術瓶頸:模型在尋找盲點(缺陷定位)上比填充資訊(澄清動作)更為困難。這意味著單純的閱讀理解或程式碼生成能力不足以解決學術產出與工程實作之間的落差,是評估高度自動化 Coding Agent 的重要維度。
本研究指出,多數研究方法雖具備科學合理性,但在實作細節上常存在描述不足的關鍵缺口。研究團隊建構了 IdeaAMBIG 基準,專門測試模型識別這些「實作關鍵差距」的能力。
- 基準測試集包含 660 個基於證據的例項,其中 163 個來自再現報告與 GitHub 問題的真實世界缺口,以及 497 個合成的受控缺口。
- 研究評估了編碼就緒評估、缺陷定位和澄清動作生成三項能力;在 13 個 LLM 中,最佳模型的「宏缺陷恢復率」為 9.6%。
- 關鍵發現顯示,缺陷定位是主要瓶頸,且提供金標準解決方案能將下游作品的編碼就緒率從 14% 拉昇至 98%。