CERA-MoA:動態路由機制與持續學習代理的共生演進框架
為何重要
現有的 Multi-Agent 系統常受困於「代理穩定性導致路由過時」與「缺乏能力差異化」的缺點。CERA-MoA 提出一種更輕量的評估機制(不依賴 Rollout),讓 Agent 系統具備持續適應與分工的能力。這樣做不僅降低了強化學習制度化生產的成本,也讓未來的 Agent 框架從單純的排程工具,轉向能自我最佳化任務分配的智慧體,對開發者而言大幅提升了建構高階 AI 系統的可行性。
- 引入 CERA-MoA 框架,將動態路由機制與獨立代理政策透過迭代式強化學習共同演化,打破 Filter 模式中路由與微調分離的僵化限制。
- 使用基於中層隱藏狀態的「預測熟悉度估計器」來評估代理間的語義能力,有效避免執行完整 Rollout 所帶來的高額運算成本。
- 採用累積閾值適應性路由機制,根據代理間熟悉度分數動態啟動最少的代理子集,在任務效能與系統效率之間取得最佳權衡。
- 透過根據代理不斷演變的能力主動分配目標訓練樣本,促進能力專注化,並在多個領域實驗中表現優於現有的靜態路由與固定工作流程基線。