更少澄清、更好程式碼:評測編碼助理中的跨會話個人化模糊性適應
為何重要
目前的 IDE 開發工具在跨會話時常遺失使用者習慣,導致使用者需重啟對話或反覆澄清需求。此基準測試證實了利用過往解決方案作為記憶的技術可行性,代表編碼 AI 將從「單次對話最佳化」演進為「長期代理人學習」關鍵里程碑。對開發者而言,這意味著未來的編輯助理能更主動地理解長期習慣,而非每次互動都像初次見面。
目前的 AI 輔助編碼主要處理單次會話內的模糊性,若能利用使用者先前解決方案的記憶,將顯著提升效率與準確度。
- CAPA 基準測試收錄 600 個編碼會話及 60 個平衡的使用者-模糊性單元,其中 300 為保留的評估會話。
- 研究評測了 12 個近期 LLM 模型,指標涵蓋可執行成功率、首回合成功率及完成所需的回合數。
- 提出了輕量級的「相同使用者歷史門檻」推論方法,作為實現跨會話記憶運用的解決方案。