ScienceBuddy:用於互動式科學代理的遞迴式自我改進
為何重要
此發展體現了科學 AI 從單次任務解決方案轉型為「發現智慧」的重要嘗試,解決了傳統 Agent 在新科學領域缺乏評估標準與回饋管道的痛點。對於 R&D 主管而言,這提供了一個實作範本,顯示如何利用人機互動來反覆演化和驗證 AI 的科學推理能力。
我們發布 ScienceBuddy,一個整合持續改進的科學代理於研究員日常工作流程的互動式研究工作空間。
- 架構核心為 recursive-in-recursive self-improvement,結合 Harness 演化與模型強化學習,透過內層遞迴最佳化 Harness、外層遞迴在較優 Harness 上訓練模型來提升效能。
- 系統將研究員的請求、回饋與執行證據轉化為任務指令與評估標準(rubrics),驅動持續學習機制。
- 釋出的範例涵蓋四個科學任務家族的案例研究。