ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

陸川手搓歷史現場,王珞丹熬夜抽卡:阿里全模態佈局與 Agentic Video 野心

模型 1 個來源 · 21 小時前
為何重要

阿里這一波佈局最大的變化在於從單項能力堆疊轉向「統一理解框架」與「Agent 化」生產,標誌著語言大模型後的競爭焦點落在了「能否連貫理解複雜任務」上,而非單張圖片或短片的質量。對開發者而言,多模態 Agent 不是單一模組,而是需要跨影像、影片、聲音的「全鏈路整合能力」,這直接挑戰了現有的記憶長度與微調策略。對投資人來說,從「工具輔助」到「具備敘事理解與穩定生產」的能力躍升,是判斷 AI 產品能否真正進入傳統工業流程(如影視、音樂製作)的核心門檻。

9 月 22 日的雲棲大會上,阿里發布了涵蓋語言、視覺、音訊與空間感知的全面多模態模型陣容,並透過陸川的歷史重現案例展示生成效率,同時透過 Agentic Video 探索於三年內打造原生全模態統一模型的技術路線。

  • 模型架構方面,Qwen 3.8 Shifted 架構包含自我訓練的 Qwen3.8、開放下一代架構的 Qwen3.8-Flash、提供思考分割槽的 Qwen3.8-Omni,以及正在訓練的 Qwen4 與 Qwen 4.5/5 路線圖。
  • 影片生成領域,Wan3.0 支援單次生成 30 秒影片且在 Artificial Analysis 排名第一,下一代模型預計 11 月發布;音樂與世界模型則包含 Happy Shrimp 1.1、HappyOyster 2.0 Preview 等產品。
  • 執行層次上,陸川團隊透過 4 輪提示詞最佳化與史料翻譯,將場景還原準確度提升至 95% 以上;王珞丹的案例則揭示了長期上下文保持與意圖理解仍是當前多模態創作的挑戰。
阿里QwenWan全模態Agentic Video雲棲大會

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 23:59