SenseNova-U1.5 發布:無 Encoder 與 VAE 的原生統一視覺智慧模型
為何重要
捨棄 encoder 和 VAE 的架構是提高多模態模型推理效率的重要方向,能減少權重計算並維持端到端的視覺規劃能力。該模型在處理複雜結構化指令與長篇內容時的泛化能力,證明瞭純原生模型在非結構化生成上的潛力。隨著訓練程式碼計畫開源,將降低臺灣開發者與研究單位在建立高效多模態基礎模型時的門檻,加速本地化的應用開發與整合。
SenseNova-U1.5 旨在打破現有的編碼器與 VAE(自編碼器)架構限制,透過原生管道實現端到端的視覺內容理解與推理。
- 模型為 8B 引數的 MoT 原生統一多模態系統。
- 具備 encoder-free 和 VAE-free 架構,支援最大 4K 原生解析度。
- 針對視覺美學、雙語文字渲染、圖表生成與圖片編輯等任務最佳化專家模型,並進行多專家 on-policy distillation。
- 已承諾開源包含 SFT、RL 與 on-policy distillation 的訓練程式碼。