DeepSeek 發布規模最小的 DeepSeek-V4.1-Flash 模型
為何重要
DeepSeek 推出定位最小的模型並結合 Flash 暗示了該公司在追求資源效率上的企圖心,透過新架構力圖在保持規模優勢的同時提升效能;拜長上下文能力所賜,這款模型將直接參與目前由 OpenAI 等大廠主導的長文本處理市場競爭。
總部位於中國的人工智慧新創公司 DeepSeek 本週四發布了 DeepSeek-V4.1-Flash,官方宣稱這是其目前規模最小的模型版本。
- 採用全新的 Causal Encoder-Decoder 架構,擁有 552 億(552B)引數規模。
- 支援 1M-token(100 萬 token)的長上下文長度。