通义发布Qwen3.8-Flash开源模型
「阿里通义千问团队发布Qwen3.8-Flash多模态MoE模型,主参数125B,激活6B,训练成本仅为前代九分之一。同步开源Next版本权重,采用GDN与QSA混合架构,支持262K上下文并可扩展至1M,API定价为每百万Tokens输入1元、输出3元。」
阿里通义千问团队日前正式发布Qwen3.8-Flash,这是一款面向超长上下文与高效推理的多模态MoE模型。主模型参数量达125B,额外配备51B的N-gram Embedding,每token仅激活6B参数。这一设计使模型在保持强大能力的同时,大幅降低推理时的计算开销。模型原生支持262,144个token的上下文,并可通过YaRN技术扩展至1M tokens,为超长文档理解、复杂代码库分析等场景提供了坚实基础。
在架构创新方面,Qwen3.8-Flash围绕四个方向进行了系统升级。Attention部分采用GDN(Gated DeltaNet)与QSA(Qwen Sparse Attention)的混合架构,GDN负责高效压缩历史信息,QSA则通过轻量级Indexer在micro-block粒度上筛选重要上下文。在1M token超长上下文下,QSA的Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍的加速。Residual部分引入Gated Residual机制,将残差流扩展为4条并行分支,通过动态Gate控制信息读写,同时残差状态支持FP8存储,有效降低访存开销。
Embedding方面的创新同样值得关注。模型引入51B参数的N-gram Embedding,利用局部上下文查表扩展模型容量。这些参数可卸载至Host Memory,通过异步Prefetch与模型计算重叠,不长期占用GPU显存,从而在有限显存条件下实现更大的模型容量。优化方面,团队采用Muon Optimizer,并针对正交化精度、参数分工及融合矩阵拆分等策略进行优化,同时针对新架构重新拟合了Scaling Law。
性能与成本方面,相比前代Qwen3.7-Plus,Qwen3.8-Flash的训练成本仅约为九分之一,但在编码和办公任务上具备更强能力。在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU等关键评测集。
可用性方面,Qwen3.8-Flash即将上线千问AI平台对外提供API服务,定价为每百万Tokens输入1元、输出3元。模型权重已于北京时间8月26日23:00在Hugging Face与ModelScope平台开源,同步发布FP8量化版本。团队同时表示,Qwen3.8-Flash-Next将是全新一代Qwen4系列模型的雏形,其新架构与默认支持1M上下文的能力,为后续大模型的发展方向提供了重要参考。
来源:Heooo AI工具导航