DeepSeek 发布 V4.1 Flash,552B MoE 新架构 封面图
技术进展

DeepSeek 发布 V4.1 Flash,552B MoE 新架构

Heooo 09月10日16时33分 52 阅读

「DeepSeek 正式发布 DeepSeek V4.1 Flash,为 552B 参数的 MoE 模型,采用全新 Causal-Encoder-Decoder 结构,输入激活仅 8B、输出激活 16B,具备原生多模态能力,基准测试超越 DeepSeek V4 Pro。模型同步上线 API,KV Cache 大幅压缩,权重与技术报告已在 Hugging Face 开放。」

DeepSeek 正式发布全新模型 DeepSeek V4.1 Flash。这是其新一代模型结构中尺寸最小的成员,却具备原生多模态视觉理解能力。官方表示,新结构的设计初衷是让能力上限更高、推理速度更快、吞吐更大,并且可以平滑扩展到参数规模更大的模型。

V4.1 Flash 是一个 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构,输入与输出并不对称:输入激活仅 8B,输出激活为 16B,成本明显低于已知的同尺寸模型。与此同时,新模型采用新的预训练方式,并经过更大规模的强化学习后训练,在基准测试中成功超越包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。

DeepSeek 发布 V4.1 Flash,552B MoE 新架构

推理成本方面,新一代模型大幅压缩了 KV Cache 缓存大小。与上一代相比,对 HBM 的需求减少到四分之一,对 SSD 的需求减少到八分之一;相对于初代模型,KV Cache 仅为原来的四百三十七分之一。在 Agent 使用场景中,缓存命中费用往往占比较高,对 KV Cache 的压缩因此显著降低了 Agent 类任务的使用成本,也让长上下文与多轮调用的经济性明显改善。

接入方面,DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,用户只需将模型名称改为 deepseek-flash 即可调用。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线;出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由到 V4.1 Flash,既有应用无需改动代码即可完成过渡。

经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。官方因此计划有序下线 V4 Pro:北京时间 2026 年 9 月 14 日中午之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。这一安排意味着开发者在迁移窗口期内可以无感切换,成本反而进一步下降。

生态方面,腾讯旗下的 WorkBuddy、CodeBuddy 以及 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash。得益于架构创新,官方相应下调了 V4.1 Flash 的定价,同时仍采用峰谷定价,闲时价格为高峰时段价格的一半,新价格于 2026 年 9 月 10 日中午起生效。模型权重与技术报告已同步在 Hugging Face 开放,开发者可以自行部署与验证。

# DeepSeek # MoE # 多模态 # 模型发布

来源:Heooo AI工具导航