通义千问发布新模型,剧透Qwen4架构
「阿里通义千问开源多模态MoE模型Qwen3.8-Flash-Next,作为Qwen4架构早期预览版本,总参数1250亿但仅60亿激活。其训练成本为Qwen3.7-Plus的九分之一,代码与办公任务表现显著跃升,凭借6B激活参数击败Claude Opus 4.6 Max,SGLang提供Day-0支持。」
通义千问团队近日正式开源了全新多模态MoE模型Qwen3.8-Flash-Next,该模型作为Qwen4架构的早期预览版本,展示了在极低计算开销下的越级性能表现。这一发布将大模型开源领域的创新节奏再次推向了新高度。
在核心架构与参数规模层面,Qwen3.8-Flash-Next采用了高度稀疏的混合专家设计。整个模型的总参数量达到1250亿,并额外搭配了510亿参数的N-gram嵌入表以及40亿参数的多token预测模块,但每个token实际激活的参数量仅有60亿。模型整体拥有48层网络结构,MoE层集成了512个专家,并通过top-10方式完成路由分配。这种极致的稀疏化设计,有效平衡了模型容量与计算开销。
技术创新方面,该模型集成了多项前沿升级。它引入了GDN与QSA混合注意力机制,兼顾长文本处理任务的运行效率与信息检索精度,并将原生256K的上下文窗口通过YaRN技术成功扩展至1M。通过引入510亿参数的N-gram嵌入,模型几乎不增加额外计算成本便大幅扩展了容量,且支持通过异步预取使该嵌入表驻留于系统低速DRAM内存中。此外,模型还采用了门控残差连接以及微块粒度选择上下文的稀疏注意力设计,进一步优化了训练与推理过程。
在实际性能与成本表现上,该模型交出了亮眼答卷。受益于极致的稀疏化设计,其训练成本仅为上一代Qwen3.7-Plus的九分之一,但在代码编写与办公等核心任务上的表现实现了显著跃升。多方评测与最新报道确认,凭借仅6B的激活参数,该模型在能力上成功击败了Claude Opus 4.6 Max等顶尖旗舰模型。
在生态部署与开源节奏上,SGLang在模型发布首日便提供了Day-0级别的直接支持,开发者可以通过开源渠道获取模型权重,并在本地或集群环境中高效部署。这一系列底层架构的创新与突破,不仅为全球开源社区提供了前沿的技术探索样本,也进一步推动了高性能AI大模型向低成本、高效率的规模化落地演进。
来源:Heooo AI工具导航