行业资讯

DeepSeek V4.1 Flash 上线超算互联网,552B MoE 架构

Heooo 09月10日22时01分 58 阅读

「DeepSeek V4.1 Flash 模型上线国家超算互联网,用户可从官网首页进入「模型服务」页面直接调用 API。该模型为 552B 参数 MoE 架构,采用 Causal-Encoder-Decoder 结构,输入激活 8B、输出激活 16B,基准测试超越 DeepSeek V4 Pro,并将 KV Cache 压缩至上一代的四分之一。」

DeepSeek V4.1 Flash 模型正式上线国家超算互联网中心。用户登录国家超算互联网官网,从首页进入「模型服务」页面,即可快速打开 DeepSeek V4.1 Flash 模型的 API 调用界面,直接开始对接与调试。

从公开信息来看,V4.1 Flash 是一款 552B 参数的 MoE(混合专家)模型,采用了全新的 Causal-Encoder-Decoder 结构。这一结构最显著的特点是输入与输出不对称:输入侧激活参数仅 8B,输出侧激活参数为 16B。相比同等参数规模的模型,这种非对称设计把实际参与计算的部分压得很低,成本显著低于已知的同尺寸模型。

训练层面,V4.1 Flash 采用了新的预训练方式,并经过了更大规模的强化学习后训练。在基准测试中,它的智能水平成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型。换句话说,一个激活参数更小、定位更轻的 Flash 版本,在综合能力上反而压过了体量更大的 Pro 版本,这也让「小激活、强能力」成为这一代模型的重要看点。

更值得开发者关注的是推理侧的优化。V4.1 Flash 大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/8。缓存的压缩不仅意味着单卡可以容纳更长的上下文,也意味着在相同硬件条件下能够承载更高的并发请求,显存与存储的整体占用随之下降。

对 Agent 类应用而言,这一改动的意义尤为直接。在 Agent 使用场景中,缓存命中的费用往往占据整体成本的较高比例,KV Cache 越小,缓存占用与命中成本就越低,长链路、多轮调用的 Agent 任务使用成本因此明显下降。对于需要反复调用工具、维护长会话状态的自动化流程,这一点带来的成本收益可能比单纯的推理提速更为可观。

此次上线国家超算互联网,为开发者提供了官方渠道之外的又一个调用入口。
用户可以从首页进入「模型服务」页面,快速打开模型 API 调用界面,完成接入与测试。对于希望在国产算力平台上跑通大模型应用的团队来说,这提供了一条新的可选路径。

# DeepSeek # MoE # API调用

来源:Heooo AI工具导航