MODUS:純解碼器架構的任意對任意建模
為何重要
此開發代表多模態研究從「特定功能堆疊」(分散式編碼器/解碼器/擴散)轉向「通用骨架」的方法,解決了協調多種模態頭部或任務管道的複雜度。若純解碼器架構可行,能顯著降低多模態推理與訓練的開銷,這對生態學與天文學等領域的科研人員尤為重要,可加速複雜資料的即時整合與解讀。
Any-to-any(任意對任意)模型指能從任意模態組合輸入中預測任意模態輸出的單一網路架構,目前在多模態視覺與視覺語言模型,以及生態學與天文學等科學領域應用日益廣泛。傳統的 Any-to-any 模型多數使用 Encoder-Decoder 或 Diffusion 架構從頭訓練,導致難以利用強大的預訓練解碼器作先驗。本研究提出的 MODUS 探討解碼器架構的任意對任意多模態建模,它將所有模態對稱處理,採用統一的輸入與輸出格式,不需特定模態頭或損失函式。因為所有模態皆可作為輸入與輸出,該模型支援透過中間模態進行連鎖生成,或是透過另一生成模態對輸出進行自我驗證評分。Modus 在各項基準測試中展現強勁的零樣本表現,競爭力不輸專家和多工專用模型。