ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

LLaDA-UI:將區塊擴散引入視覺-語言 GUI 代理的新模型

研究 1 個來源 · 8 天前
為何重要

Block-wise diffuroin 能透過任意順序生成提升解碼效率,LLaDA-UI 的成功證明瞭此技術路徑在空間繁雜的 GUI 操作上具有商業可行性的同時,還能降低延遲,直接挑戰目前主流 Transformer 架構視覺模型的既有效能 bench mark,改變了 Agent 技術路線的競爭格局。

研究展示如何運用高延遲敏感的區塊擴散大語言模型(dLLM)技術,驅動具備即時感知與操作能力的視覺-語言 GUI 代理。

  • LLaDA-UI 採用 16.7B 引數 MoE(混合專家)架構,以 LLaDA2.0-mini-base 作為擴散語言 backbone。
  • 模型經由兩階段訓練:先對齊執行原生解析度視覺編碼器的通用多模態預訓練,再針對多樣化資料進行 GUI 代理監督微調。
  • 在廣泛採用的視覺導航評測中,LLaDA-UI 勝過 Qwen2.5-VL-7B,並在六個測試專案中佔據四項優勢,超越 Qwen3-VL-8B。
LLaDA-UIdLLMMoEGUI AgentVision-LanguageQwen3-VL-8B

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00