行业资讯

DeepSeek 发布 V4.1 Flash:原生多模态,最高降价 60%

Heooo 09月11日04时01分 34 阅读

「深度求索正式发布 DeepSeek V4.1 Flash,这是全新模型结构系列中尺寸最小的模型,采用 552B 参数 MoE 架构与全新 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B,原生支持多模态视觉理解,基准测试超越 V4 Pro,定价最高下调 60%。」

深度求索正式发布 DeepSeek V4.1 Flash 模型。作为其全新模型结构系列中尺寸最小的成员,该模型具备原生多模态视觉理解能力,并已在 DeepSeek API 同步上线,开发者只需将模型名称更改为 deepseek-flash 即可调用。

据官方介绍,这一代新模型结构的设计初衷有四点:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数规模的模型。V4.1 Flash 采用 552B 参数的 MoE 架构,并引入全新的 Causal-Encoder-Decoder 结构,其输入与输出并不对称,输入激活仅为 8B,输出激活为 16B,使得整体成本显著低于已知的同尺寸模型。

除了架构层面的变化,V4.1 Flash 还采用了新的预训练方式,并经过更大规模的强化学习后训练。在基准测试中,它成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。

上下文存储的压缩是本次发布的另一大看点。新一代模型大幅减小了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到四分之一,对 SSD 的需求减少到八分之一。相对于初代模型,其 KV Cache 体积已压缩至原来的四百三十七分之一。在 Agent 使用场景中,缓存命中产生的费用往往占比较高,对 KV Cache 的大幅压缩因此直接降低了 Agent 类任务的使用成本。

模型更替方面,旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线。出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由到 V4.1 Flash。同时,官方计划有序下线 V4 Pro 模型,在某时间点之后至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

生态接入方面,腾讯旗下的 WorkBuddy、CodeBuddy 以及 OpenCode 作为官方合作伙伴,现已全量接入 DeepSeek V4.1 Flash,为开发者提供更丰富的调用入口。

得益于模型架构创新,V4.1 Flash 能够以更低成本服务更多用户,官方相应下调定价,最高降幅达 60% 。新价格已经生效,同时该模型仍采用峰谷定价策略,闲时价格为高峰时段价格的一半,鼓励用户根据实际使用情况调整任务时间,更合理地调配资源。模型权重与详细技术报告已在 Hugging Face 平台开源发布。

# DeepSeek # 多模态大模型 # MoE 架构

来源:Heooo AI工具导航