阶跃发布Step 5 Preview旗舰模型,10月开源
「阶跃推出旗舰模型Step 5 Preview,采用稀疏MoE架构,总参数600B、激活参数27B,支持100万Token上下文与原生视觉输入。该模型在AA综合智能指数得分44分,位居全球开源模型前三,单任务成本仅为Claude Opus 5的八分之一,将于10月15日开源完整权重。」
阶跃正式发布其旗舰模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作以及金融等场景,重点提升模型在执行真实世界 Agentic 任务时的表现。官方同时宣布,将于 10 月 15 日释放完整模型权重,而该模型从发布当日起已全量开放使用。
从架构上看,Step 5 Preview 采用稀疏 MoE 混合专家架构,总参数量达到 600B,但激活参数仅为 27B,在保持大模型能力的同时控制了推理成本。该模型支持 100 万 Token 上下文窗口,并原生支持文本与视觉输入,这为处理长文档、复杂代码仓库以及多模态任务提供了基础条件。
在权威评测方面,Step 5 Preview 在全球人工智能榜单 Artificial Analysis Intelligence Index 中得分 44 分,位居全球开源模型前三。与此同时,其单任务成本仅为 Anthropic Claude Opus 5 的八分之一,展现出较为突出的性价比优势。
为了验证模型的软件工程能力,阶跃建立了 StepCodeBench 评测体系,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域以及 33 种编程语言。测试显示,Step 5 Preview 能够覆盖多种编程语言,并胜任 Bug 修复、功能开发、代码重构、环境配置等真实开发任务。
在更具挑战性的长程任务中,该模型能够根据自然语言需求,自主阅读 ESP32 设备及相关 API 的大量开发文档,将一块 ESP32-S3 开发板改造成支持蓝牙按键与语音输入的 Vibe Coding 键盘。它不仅能写代码,还可以访问串口、获取截图、调用摄像头、模拟鼠标操作,并根据真实设备返回的状态与报错持续修改、运行和调试代码,连续执行超过 3 小时。
在公开和内部评估中,Step 5 Preview 在复杂软件工程任务、长程规划任务、专业知识工作以及金融领域等基准测试中均展现出较为均衡的综合能力。在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance,以及跨领域深度研究评测 DRACO 上,该模型表现仅次于 GPT-6 Astra 或 Claude Opus 5。
随着 10 月 15 日完整权重的开源,开发者社区有望基于 Step 5 Preview 构建更多面向真实场景的 Agentic 应用,其稀疏 MoE 架构与长上下文能力也将成为开源生态中值得关注的技术样本。
来源:Heooo AI工具导航