DeepSeek V4.1 Flash发布,多模态能力超越Pro版
「深度求索发布 DeepSeek V4.1Flash,为全新模型结构系列中最小的成员。该模型采用552B参数MoE架构与全新 Causal-Encoder-Decoder 结构,输入激活仅8B、输出激活16B,KV Cache 压缩至初代的1/437,基准测试智能水平全面超越 V4Pro,并已上线 DeepSeek API,同步下调定价。」
深度求索正式发布全新模型结构系列中的最小尺寸成员 DeepSeek V4.1Flash。作为一款具备原生多模态视觉理解能力的轻量化模型,它的设计目标十分明确:追求更高的能力上限、更快的推理速度、更大的吞吐量,同时保留向更大参数规模扩展的潜力。
在核心架构上,DeepSeek V4.1Flash 采用了552B参数的 MoE(混合专家)架构,并创新性地引入了全新的 Causal-Encoder-Decoder 结构。由于采用了输入与输出不对称的设计,其输入激活仅有8B,输出激活为16B,使得整体成本显著低于同尺寸的已知模型。配合全新的预训练方式以及更大规模的强化学习后训练,该模型在各项基准测试中的智能水平成功超越了包括 DeepSeek V4Pro 在内的一众旗舰模型。
效率优化与成本控制是此次升级的另一重点。新一代模型大幅压缩了 KV Cache 缓存的大小,相比上一代模型,对高带宽内存(HBM)的需求减少至四分之一,对固态硬盘(SSD)的需求减少至八分之一。尤其在 Agent 使用场景中,由于上下文存储和缓存命中的费用占比较高,这一压缩大幅降低了相关任务的实际使用成本。据统计,相对于初代模型,其 KV Cache 已经缩减至原来的1/437。
随着新模型的正式上线,DeepSeek 对相关产品线和计费策略进行了系统性调整。DeepSeek V4.1Flash 已同步上线 DeepSeek API,用户只需将模型名称更改为 deepseek-flash 即可调用。旧版本的 V4Flash 与 V4Flash Vision Exp 已正式下线,而旧模型名 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 目前被暂时路由到 V4.1Flash。
鉴于 V4.1Flash 在性能、费用、速度和总用时上已全面超越 V4Pro,官方计划有序下线 V4Pro 模型:在2026年9月14日12时之后至 V4.1Pro 上线之前,所有访问 deepseek-v4-pro 的请求将全部被路由至 V4.1Flash 并按其单价计费。目前,腾讯旗下的 WorkBuddy、CodeBuddy 以及 OpenCode 等官方合作伙伴已全量接入该模型。
得益于底层架构的创新,DeepSeek V4.1Flash 能够以更低的成本服务海量用户,官方也顺势下调了该模型的 API 定价。同时,为了更合理地调配计算资源,新定价延续了峰谷定价机制,闲时价格为高峰时段的一半,以鼓励用户灵活调整任务执行时间,新价格已于2026年9月10日12时正式生效。从模型结构到计费方式,这次调整意味着轻量化多模态模型正在成为开发者调用成本与性能之间的新平衡点。
来源:Heooo AI工具导航