行业资讯

高通携阶跃适配300亿参数端侧MoE模型

Heooo 09月23日07时02分 31 阅读

「高通携手阶跃、无量火及江波龙,基于第六代骁龙8超级至尊版移动平台,端侧适配阶跃StepEdge-Omni 30B-MoE模型,运行内存需求降低超50%,预填充吞吐超330 Token/s,解码吞吐超28 Token/s,可本地完成邮件理解、行程规划等任务。」

在2026骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙8超级至尊版移动平台,完成阶跃StepEdge-Omni 30B-MoE模型在端侧的适配与推理优化,并现场演示了相关智能体助手。

StepEdge-Omni 30B-MoE拥有300亿参数,采用混合专家架构。与传统稠密模型不同,它只根据具体任务需要激活部分专家模块,从而有效降低计算量和内存带宽需求,这也是大参数模型得以在手机上运行的关键前提之一。

除了模型本身的架构设计,合作各方还在推理引擎、异构调度以及存储方案上做了针对性优化,使模型的运行内存需求较行业常规方案降低超过50%,并能够在智能手机上稳定运行。

性能方面,测试数据显示,该模型的预填充吞吐性能超过每秒330个Token,解码吞吐性能超过每秒28个Token。所谓预填充吞吐,是指大语言模型在推理的预填充阶段,每秒能够处理的输入词元数量,是衡量系统处理长提示词和批量请求能力的关键指标。这一阶段的效率往往直接决定用户首次看到响应的时间,因此对端侧交互体验影响显著。

值得关注的是,该方案无需调用云端服务,可以在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务,为智能体助手提供了一条全离线的运行路径,也让数据不必离开设备。

业内人士认为,大参数MoE模型在手机端的部署,有助于推动低时延和隐私保护型智能体应用的发展。不过,实际规模化应用仍取决于终端成本、功耗、模型可靠性及用户接受度等因素。

# 端侧AI # MoE模型 # 高通骁龙 # 阶跃星辰 # 推理优化

来源:Heooo AI工具导航