FinanceHarness:自主金融深度研究架構
為何重要
FinanceHarness 指出當前通用深度研究系統在「專業領域(金融)」的應用效能仍顯不足,主流 LLMs 甚至無法在專家設計的基準上通過 40%,顯示金融機構匯入自動化研究時仍須高度仰賴人類專家核驗或強調資料管道的可靠性。 此研究同時證實了「針對特定領域進行獎勵建模與基準設計」的有效性,為開發金融垂直應用的開發者提供了評估 agent 表現的具體指標。
隨著 LLMs 與自主代理的進步,深度研究已成為受歡迎的應用,但通用系統無法滿足金融領域對專業分析與模式預測的嚴格需求。
- FinanceHarness 是一個自動化全流程金融深度研究框架,包含環境建構、代理執行迴圈與獎勵建模。
- FinanceGym 的專家驗證通過率高達 82%,但主流 LLMs 在此評核標準下的得分仍低於 40%。
- 具有相同開源 backbone 的 FinanceHarness,將整體評核得分從 25.3% 提升至 32.4%。