OmniHarness:透過符號政策學習掌握可泛化視覺生成
為何重要
OmniHarness 推動視覺生成代理從單次任務執行邁向可重用的策略層級學習,這對於提升企業級應用的穩定性與可靠性具有重要意義。其「引數凍結」的獨特路徑,提供了一個在不進行高成本模型重訓下最佳化系統行為的實務解方。
統一多模態大型語言模型與多代理系統雖推動視覺生成進展,但仍受限於經驗泛化性低、反思時機延後等問題。研究團隊提出 OmniHarness 框架,透過符號政策學習來解決這些限制,將已驗證的執行過程抽象為符號政策以支援泛化。
- 演算法在 6 個基準測試、3 個 MLLM 背骨及 3 個視覺代理框架下進行驗證。
- 在 ComfyBench 的創意任務中,達到 95.0% 的解決率,超越最強基線 27.5 個百分點。
- 允許使用凍結的政策快照來即插即用地增強現有視覺代理系統。
- 在引數保持固定的情況下,透過執行回饋來持續精煉與最佳化策略。