阶跃发布 Step5Preview:600B稀疏MoE开源旗舰
「阶跃全量开放新一代开源基座模型Step5Preview,采用600B稀疏MoE架构,仅激活27B参数,支持百万Token上下文与多模态输入,在多项高难度评测中表现优异,单任务成本仅为Claude Opus5的八分之一。」
阶跃今日正式全量开放其新一代旗舰基座模型 Step5Preview,这款模型明确聚焦于真实世界中的 Agentic(智能体)任务,旨在突破 AI 模型在能力、效率与成本之间的经典权衡困境。通过引入稀疏 MoE(Mixture of Experts)架构,Step5Preview 在总参数高达 600B 的前提下,每次推理仅激活 27B 参数,显著提升了计算资源的利用效率。
该模型原生支持 100 万 Token 的上下文窗口,并具备同时处理文本与视觉输入的能力。在 Artificial Analysis 发布的 Intelligence Index 中,Step5Preview 获得 44 分,跻身全球开源模型前三。更引人注目的是,其单任务运行成本仅为 Claude Opus5 的八分之一,为开发者提供了“同等预算更强智能”或“同等能力更低价格”的双重选择。
在多个高难度基准测试中,Step5Preview 展现出强劲实力。在 Agents' Last Exam 的 CLI 子集 ALE-CLI、金融投资研究评测 FrontierFinance 以及跨领域深度研究评测 DRACO 上,其表现仅次于 GPT-6Astra 和 Claude Opus5,大幅领先其他开源模型。此外,在编程能力方面,阶跃自建了 StepCodeBench 基准,覆盖 553 个代码仓库、9 类任务、20 个应用领域和 33 种编程语言。Step5Preview 在 Bug 修复、功能开发、重构和环境配置等真实场景中均表现出高度稳定性。
一个典型演示中,模型通过阅读 ESP32 设备的大量开发文档,成功将一块 ESP32-S3 开发板改造为支持蓝牙按键与语音输入的 Vibe Coding 键盘。过程中,它自主开启 COM 串口、调用摄像头、截取设备图像、模拟鼠标操作,并根据真实报错信息连续修改代码并调试,持续运行超过三小时。
在长周期任务实验中,Step5Preview 同样表现亮眼。在一项为期 24 小时的实验中,仅使用一张 H100 GPU,模型从零开始优化 MLA GPU 内核,在约 22 小时后将峰值性能提升至 508 TFLOPS,超越 Claude Opus5 的 493 TFLOPS。另一项实验中,它通过自动化后训练将 Qwen3-30B-A3B 模型在 AIME24 上的准确率从 53.3% 提升至 60%,与 Opus5 持平,但消耗的标注 token 更少。
在前端与视觉任务方面,Step5Preview 不仅能编写网页,还能调用 Blender 创建并迭代 3D 资产,并将其集成到 Three.js 中构建交互式应用甚至游戏。更有趣的是,它还能从 1922 年版《广九铁路旅行指南》中提取信息,构建行程查询、费用计算与路线回放系统,让百年前的小火车在数字世界中重新运行。
金融领域被阶跃视为综合能力的试金石。围绕公司研究流程,团队构建了三项内部评测:FinStepBench-LiveSearch(动态检索验证)、CorporateValuation(可复现估值建模)和 DeepResearch(全流程研究报告生成)。结合外部基准 FrontierFinance(涵盖 220 道专家题、11543 项评分标准),Step5Preview 在四项评测中均交出优异答卷。
从 Step3.5Flash、Step3.7Flash 到如今的 Step5Preview,阶跃始终强调:下一阶段的 Scaling 不仅是堆叠更多算力,更是让每一分算力都发挥最大价值。完整模型权重将于 10 月 15 日正式开源,这款重新定义“能力—成本—效率”三角关系的旗舰模型,正等待开发者将其作为日常 Agentic 任务的核心引擎。
来源:Heooo AI工具导航