FLAT:將圖文壓縮為一維靈活長度對齊跨模態 Token,用於檢索與生成
為何重要
FLAT 的統一架構證明瞭推動多模態模型朝向「同一個編碼器同時處理檢索與生成」的可行性,這對簡化端到端流程與降低推理成本具有指標意義。其具備線性插值與潛在空間算術的能力,顯示出該模型在可控生成與高階編輯任務上的潛力,是未來多模態 Agent 與生成式助手中值得關注的架構依歸。
傳統多模態學習通常先訓練對比式視覺編碼器,再接獨立的下游生成模型,這種分離式架構限制了生成效能。FLAT 框架重新定義此流程,透過共同最佳化共享編碼器與文字-to-圖片(T2I)及圖片-to-文字(I2T)解碼器,結合對比對齊與雙向跨模態生成目標,將視覺與文字輸入對映至統一的一維序列空間。
- 框架採用 nested dropout 過濾 prefix-K tokens 以支援動態輸出長度,並在未微調前於 T2I 生成任務的 GenEval 得分為 71.1。
- 經特定任務微調後,T2I 生成 GenEval 分數達到 83.1;在 MS-COCO 圖片字幕任務上為 40.5 BLEU-4 與 138.6 CIDEr。
- 在檢索任務上,該模型於 MS-COCO 的 Recall@5 為 86.8(I2T)/ 75.8(T2I),於 Flickr30K 則為 98.3(I2T)/ 93.6(T2I)。