ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

FLAT:將圖文壓縮為一維靈活長度對齊跨模態 Token,用於檢索與生成

研究 1 個來源 · 6 天前
為何重要

FLAT 的統一架構證明瞭推動多模態模型朝向「同一個編碼器同時處理檢索與生成」的可行性,這對簡化端到端流程與降低推理成本具有指標意義。其具備線性插值與潛在空間算術的能力,顯示出該模型在可控生成與高階編輯任務上的潛力,是未來多模態 Agent 與生成式助手中值得關注的架構依歸。

傳統多模態學習通常先訓練對比式視覺編碼器,再接獨立的下游生成模型,這種分離式架構限制了生成效能。FLAT 框架重新定義此流程,透過共同最佳化共享編碼器與文字-to-圖片(T2I)及圖片-to-文字(I2T)解碼器,結合對比對齊與雙向跨模態生成目標,將視覺與文字輸入對映至統一的一維序列空間。

  • 框架採用 nested dropout 過濾 prefix-K tokens 以支援動態輸出長度,並在未微調前於 T2I 生成任務的 GenEval 得分為 71.1。
  • 經特定任務微調後,T2I 生成 GenEval 分數達到 83.1;在 MS-COCO 圖片字幕任務上為 40.5 BLEU-4 與 138.6 CIDEr。
  • 在檢索任務上,該模型於 MS-COCO 的 Recall@5 為 86.8(I2T)/ 75.8(T2I),於 Flickr30K 則為 98.3(I2T)/ 93.6(T2I)。
FLATMultimodal1D SequenceGenEvalUnified EncoderRepresentation Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00