NeoHorse-1:透過代理後訓練與 Harness 實現的遞迴自我改進原型
為何重要
- 對於開發者而言,這項技術揭示了透過嚴謹的資料篩選與階段性課程設計,有潛力顯著彌補基礎模型引數規模帶來的能力缺口。 - 目前這仍屬於實驗性的證明,未來需觀察能否將這種「控制器」邏輯標準化至主流 Open-source 模型版本中,真正實現通用 AI 的自我進化。
- NeoHorse-1 是一個旨在「遞迴自我改進」的模型家族,透過代理導向的後訓練機制讓 AI 系統觀察能力並自動最佳化下一輪學習。
- 系統採用異構模型池結合智慧路由,訓練範例經過結構驗證與六維語義評估,並將監督微調擴充套件為具路由引導的三階段課程。
- 在涵蓋工具使用、編碼與指令遵循的十一個基準測試中,4B 模型整體表現從 58.94 提升至 64.87,9B 模型從 65.60 提升至 69.04。