FLUX 3 與 Mimic Robotics 攜手推出新一代影片與動作模型
為何重要
此發展代表「物理 AI」正逐漸成為多模態基礎模型的標準延伸,顛覆了過去需維持獨立生成與控制模型的慣例。若證明單一 Backbone 能在不犧牲生成品質(Generation Quality)的情況下增加 Action Prediction(動作預測)能力,將大幅提升模型疊代效率並降低開發成本。這不僅證實了世界模型(World Model)在物理質量上的潛力,也顯示基礎模型廠商(如 BFL)試圖透過業者合作搶佔工業自動化應用市場。
Black Forest Labs 發布 FLUX 3 多模態模型,與 Mimic Robotics 合作推出視訊動作模型,並強調其單一模型同時處理影像生成與機器人物理運作的架構優勢。
- 視訊預測佔據 FLUX 3 整體訓練成本的 95% 以上,是學習世界物理動態的核心。
- 模型在擴大量化訓練初期,文字及影像轉影片的生成質量一度下降高達 10%,但經過 3500 步訓練後即完全恢復。
- 訓練資料涵蓋數千萬小時的一般影片資料,以及數十萬小時的機器人操作影片資料,以整合視覺智慧與動作輸出。
- FLUX-mimic 模型已部署於 Audi 的實際生產線,用於機械臂進行精密組裝。