斥資 500 美元 RL 微調開源模型,在商品目錄審核擊敗最先進模型
為何重要
這種策略正在改寫 Al 企業價值的創造方式:不再是盲目追求更大的「前沿模型」,而是將資源押注在「可私有化、具競爭力的小模型」微調上。對企業而言,這意味著 API 佔比將從「通用解決方案」下降至「帶有私有知識的專用解決方案」,顯著降低長期推理成本並提升業務 ROI。
研究指出,贏家採用的策略是轉向「開源模型 + 去私有化資料 + RL 強化學習」,將組織特有的資料與流程植入模型,在特定任務上以極低成本擊敗昂貴的前沿模型。本文以 Bridgewater 與 Harvey 的實際案例為例,展示此戰術在投資分析與法律事務上的應用成效。
- 本文核心對照實驗中,一個經 GRPO 訓練的 9B 引數開源模型,在商品目錄審核基準上達到 76.9% 的最高分,比未訓練的基礎模型高出 36%,並比最佳的前沿配置高出 13.5%。
- 受過 RL 微調的專用模型在 40 鄰決策/天的規模下,相較於最佳的前沿模型,將每年成本從約 5,000 萬美元壓縮至 700 萬美元,成本降幅高達 98%。
- 案例 Bridgewater 指訓練後的模型在篩選相關資訊時,錯誤率比最佳的前沿模型減少約 30%,且 Lee inference 成本僅有前者的一小部分。