阿里 Qwen4 进入训练,参数将扩至 5-10T
「阿里公布大模型进展:基于新一代架构的 Qwen4 已进入训练,后续 Qwen4.5、Qwen5 将扩展至 5-10T 参数。Qwen3.8-Max 在零人类参与下自主迭代超 1 个月、完成 33 轮有效迭代,Artificial Analysis 得分从 40 升至 45;下一代视频模型将于 11 月发布,AI 手机方案 Qwen Intelligence 同步推出。」
在云栖大会上,阿里巴巴公布了千问大模型自我进化的最新探索成果,并披露了后续模型路线图。基于新一代架构的 Qwen4 已经进入训练阶段,未来 Qwen4.5、Qwen5 等版本将把参数规模扩展至 5-10T 量级。与此同时,视频生成模型、语音模型、图像模型、世界模型、音乐模型以及全模态模型等均在近期或当天推出新版本,形成了覆盖多种模态的完整矩阵。
支撑这一系列进展的核心,是大模型递归自我改进(RSI)技术。据现场介绍,RSI 已初步进入模型训练、推理及芯模协同等环节。在模型自我训练方面,Qwen3.8-Max 能够自主搭建训练流程、构造训练数据,并自主设计实验、定位缺陷,在人类完全零参与的情况下持续迭代超过 1 个月,完成 33 轮有效迭代。基于 RSI、后训练等系列技术联合优化,Qwen3.8-Max 新版本在 Artificial Analysis 上的得分从 40 分提升至 45 分,与 Claude、GPT 的最强模型同处第一阵营,并领先于 GLM5.3、Kimi-K3 等国产模型。
在推理优化方面,Qwen3.8-Max 面对从未见过的平头哥新款 GPU,自主适配优化了下代架构 Qwen3.8-Flash 新模型的推理框架,实现单实例推理吞吐量提升 96%。而在芯片与模型协同设计上,它仅基于一份真实的总线模块规范,自主展开前端、验证、后端的全链路自迭代,在自主运行超过 60 小时、调用 EDA 工具超过万次之后,完成了减少 42% 面积的物理实现优化。这些结果说明,模型的自我改进能力已经开始向训练、推理、芯片设计等上下游环节外溢。
视频生成是另一条重要产品线。阿里全新的下一代视频生成模型将于 11 月发布,朝着更长、更可控、更完整、更智能的方向演进。在更长的时间跨度里,新模型仍然能保持一致性,创作者可以精准掌控人物、场景与镜头;同时模型将具备导演级的创作思维,从生成单个镜头迈向理解完整叙事。
阿里巴巴 ATH 技术副总裁、淘天集团首席科学家郑波在云栖大会现场提到,三年内会出现一个原生全模态统一模型,体验将不再受限于模态的边界。
此外,阿里大模型正在加速走向终端。面向手机场景深度优化的 AI 手机全栈解决方案 Qwen Intelligence 正式发布,为合作伙伴提供基于千问大模型的 Agent 技术平台,让手机能够更可靠地完成跨应用的复杂任务。
来源:Heooo AI工具导航