DeepSeek 发布 V4.1-Flash:原生视觉理解、1M 上下文,KV 缓存降到上一代 1/4

DeepSeek 今天(9 月 10 日)发布了 DeepSeek-V4.1-Flash,这是全新 Causal Encoder-Decoder 架构系列中的最小型号,距 7 月的 V4-Flash 更新仅过去六周。API 价格同步下调,官方更新日志已列出切换细节。

架构与参数

  • 原生视觉理解:多模态能力直接做进底座,不再靠外挂视觉编码器拼接;
  • 552B MoE:包含 196B Engram 参数,但 prefill 仅激活 8B、decode 激活 16B——按 token 计的算力开销被压得很低;
  • 1M 上下文:长文本与大规模代码库场景直接可用;
  • KV 缓存大幅压缩:全局 KV 缓存降至每 token 约 890 字节,约为上一代 V4-Flash 的 1/4(HBM 场景 1/4、SSD 存储场景 1/8),配合 FP4 KV 缓存与跨层注意力复用实现。

评测成绩

官方更新日志给出的数字:GPQA Diamond 90.9、HLE 36.8、Codeforces Rating 3471、Terminal-Bench 2.1 达 90.6——推理、竞赛编码、真实终端任务三条线都在第一梯队水位。

为什么值得关心

对普通使用者和中小团队,这次发布的核心信息不是"又大了",而是"同样的能力,更便宜地跑":KV 缓存是长上下文推理成本的大头,压到 1/4 意味着 1M 上下文不再是演示功能,而是可以按正常价格用的日常能力。对自建推理的团队,SSD 级 KV 存储路径也提供了新的成本结构选项。

具体降价幅度和旧模型下线安排,以官方更新日志为准,建议调用前核对一遍自己业务的计费影响。

参考:DeepSeek API 更新日志(官方);技术细节另见 MarkTechPost 的拆解。资讯线索来自 AI HOT

腾讯云精选福利

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注