ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

DecoupleMix:可擴充套件視覺語言模型資料配方之解耦比率搜尋與凸分配

研究 1 個來源 · 9 天前
為何重要

- DecoupleMix 將 VLM 資料建構從傳統的直觀體驗轉化為可編碼、可重現且具可歸因性的科學工程,降低了技術門檻。- 這項技術在不大幅擴大量化投入的情況下(僅 80B tokens)即能提升競爭力,凸顯了「資料配方最佳化」是控制多模態模型成本的重要變數。- 對於訓練服務與開源社群而言,提供了一種降低規模門檻、逼近閉源頂級模型的潛在新途徑。

  • 面對 VLM 資料策展缺乏標準化的現狀,研究將複雜的資料建構貢獻解耦為跨能力比率的單變數迭代理論搜尋,以及類別內組成的多維度品質與難度評分、具多樣性目標的受約束凸最佳化。- 實驗證實小規模代理模型上發現的最佳比例,能無需重新調整而順暢地轉移至大型模型規模。- 在額外加入 80B 個多模態持續預訓練 tokens 後,該模型效能達到與使用更高多模態預算訓練之強大開源模型相媲美的水平。
VLMDecoupleMix資料策展Convex Optimization多模態模型

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00