DeepSeek新模型爆料:3万亿参数剑指顶级
「有爆料称,DeepSeek 下一波大模型中的 DeepSeek Code 2.0 预计 9 月发布,参数量高达 3 万亿以上,目标击败 Mythos 5.1 与 GPT-6 Astra,并继续保持开源开放,主打电脑控制能力。同期 Pro 系列新品确定为 V4.1 Pro,具体升级尚未公布。」
有爆料称,DeepSeek 的下一波大模型已经在路上。其中一款名为 DeepSeek Code 2.0,预计将在 9 月份发布,目标直指当前最强大的两个前沿级大模型 Mythos 5.1 与 GPT-6 Astra,爆料给出的预期是性能上实现击败。
在此之前,DeepSeek 本周刚刚发布了 V4.1 Flash。外界普遍认为,这次架构变化之大,完全可以称得上是 V5,但 DeepSeek 很低调地没有更换大版本号。Pro 系列的新品也已确定为 V4.1 Pro,具体升级内容尚未公布。如果提升幅度与 V4 到 V4.1 相当,V4.1 Pro 的性能上限也会很高;不过考虑到此前 V4 Pro-0813 正式版的表现不及预期,外界对这一代的期待值不宜拉得太高。
参数规模是这次爆料中最引人关注的部分。据称 DeepSeek Code 2.0 的参数量高达 3 万亿以上,这也是它冲击更高性能的关键。作为对比,国内目前最强的是 K3 大模型的 2.8 万亿参数,千问 Qwen 3.8 Max 为 2.4 万亿参数,而 DeepSeek V4 Pro 为 1.6 万亿参数。从 V4.1 Flash 换用新结构后参数量翻倍这一变化来看,Code 2.0 从 1.6 万亿提升到 3 万亿参数的可信度是有的:要与 Mythos 5.1 及 Astra 这一级别的大模型竞争,就需要这个量级的参数规模,否则性能上限很难继续抬高。
功能定位上,DeepSeek Code 2.0 预计将继续保持开源开放,设计重点是 Computer Use,也就是电脑控制,让 AI 替代用户操作电脑完成大量工作。Astra 目前许多令人惊讶的表现,正来自这一类能力。对开发者而言,如果一款三万亿参数级别的模型以开源形式放出,并原生支持电脑控制,意味着本地与私有化环境中的 Agent 能力将再上一个台阶,围绕工具调用、任务编排与自动化流程的开发空间也会随之打开。
不过,这一爆料的可信度尚难判断。DeepSeek 在 2023 至 2024 年曾推出过三款名字带 Code 的大模型,当时表现平平。若此次重新推出偏向代码与逻辑的 Code 大模型并作为旗舰级产品,也不失为一个可行的方向:让 V4.1 Pro 及 Flash 面向通用 Agent 任务,把代码与逻辑推理这条更硬的赛道交给 Code 系列,产品线的分工反而更清晰。至于这波新品最终能否兑现爆料中的性能目标,还要等正式发布后的评测数据来验证。
来源:Heooo AI工具导航