從頭啟動原生多模態預訓練的擴張法則
為何重要
這項研究為開發者提供了從零開始訓練多模態基礎模型的「資源配置手冊」,精確定義了在不同資料組成比例下,如何投注模型算力以獲得最佳效益。它揭示了當前主流 AI 實作中夕陽西下技術(Late Fusion)的替代方案,並量化了跨領域模型能力的遷移邊界。對於評估多模態模型生態的競爭力而言,這是一個關鍵的技術指標,幫助理解未來模型商業化所需投入的算力規模門檻。
為彌補大型語言模型(LLMs)僅依賴文字預訓練而在多模態感知上的不足,本研究提出並驗證了原生多模態預訓練架構,這種從頭進行的訓練方式避免了晚期融合架構特有的最佳化不對稱問題,同時實現了深度的跨模態整合。
- 原生多模態訓練能實現純文字模型未見的跨模態正向遷移,強化純文字的空間推理能力並提升多模態的情境學習效率。
- 研究在固定計算預算下,確定計算量最佳化的模型規模與標記數量遵循冪律擴張。
- 證實資料組成的變動會影響計演算法則,其中語言學習的資源配置(allocation law)具有穩定性,而多模態則對資料組成高度敏感,且資料傾向純文本的模式僅在更大型模型規模下才具備計算效益。