ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SenseNova-U1.5 發布:無 Encoder 與 VAE 的原生統一視覺智慧模型

研究 1 個來源 · 12 天前
為何重要

捨棄 encoder 和 VAE 的架構是提高多模態模型推理效率的重要方向,能減少權重計算並維持端到端的視覺規劃能力。該模型在處理複雜結構化指令與長篇內容時的泛化能力,證明瞭純原生模型在非結構化生成上的潛力。隨著訓練程式碼計畫開源,將降低臺灣開發者與研究單位在建立高效多模態基礎模型時的門檻,加速本地化的應用開發與整合。

SenseNova-U1.5 旨在打破現有的編碼器與 VAE(自編碼器)架構限制,透過原生管道實現端到端的視覺內容理解與推理。

  • 模型為 8B 引數的 MoT 原生統一多模態系統。
  • 具備 encoder-freeVAE-free 架構,支援最大 4K 原生解析度。
  • 針對視覺美學、雙語文字渲染、圖表生成與圖片編輯等任務最佳化專家模型,並進行多專家 on-policy distillation
  • 已承諾開源包含 SFT、RL 與 on-policy distillation 的訓練程式碼。
SenseNova-U1.5MultimodalEncoder-freeOpen-sourceVAE-free

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00