ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

MintAct:統一多平臺視覺代理模型

研究 1 個來源 · 2 天前
為何重要

此成果打破了現行 Agent 模型往往受限於單一平臺(如純桌面或純手機)的現況,透過小規模引數達到高導覽精確度,顯示通用視覺模型在生產環境自動化中的潛力。此外,文中關於異構環境與強化學習的實作細節,為資料科學家與硬體工程師提供了改進模型效能與訓練穩定性的技術參考。

MintAct 是一個專為統一手機、桌面與網路環境中 UI 地標化解析、多步驟導覽及視覺工具使用能力的視覺語言模型家族。研究團隊透過標準化環境與強化學習訓練策略,讓該模型在相較於領域專家的規模下仍能展現卓越表現。

  • 模型規模:提供 20 億、40 億及 80 儋引數(2B、4B、8B)的家族版本。
  • 基準測試:在 OSWorld-Verified 基準上獲得 48.9 分,達到目前最佳效能。
  • 訓練基建:採用非同步架構的強化學習基礎設施,能穩定管理跨域訓練分佈。
  • 執行環境:環境可同時託管多個執行個體,支援異構後端並用於資料收集。
MintActVisual AgentOSWorldReinforcement LearningUI Grounding

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00