小红书开源大模型获华为昇腾全量适配 封面图
技术进展

小红书开源大模型获华为昇腾全量适配

Heooo 08月17日12时34分 26 阅读

「小红书发布全新开源大模型dots3-note preview,拥有280B总参数与16B激活参数,支持文本、视觉、语音全模态感知。华为昇腾当日完成Atlas 800A3与900A3超节点全量适配,通过全链路优化提升推理吞吐量,并原生适配MTP投机解码,显著降低解码延迟。」

近日,小红书正式发布了全新开源大模型dots3-note preview。作为该系列的首个版本,该模型拥有280B的总参数量以及16B的激活参数量,并具备文本、视觉和语音的全模态感知与理解能力。在推理、Agent以及多模态任务中,其表现直逼国内外更大尺寸的优秀模型,为开源社区带来了一股新的活力。

在模型发布当日,华为官方迅速宣布,昇腾Atlas 800A3与Atlas 900A3 SuperPoD超节点已完成对该模型的高效适配,并借助vLLM Ascend开源推理引擎提供完整的部署与运行支撑。这一动作意味着小红书这一重磅开源模型能够立刻在国产算力平台上稳定运行,为开发者提供了更多元的硬件选择。

小红书开源大模型获华为昇腾全量适配

此次昇腾针对该模型展开了全链路的深度优化,重点攻克了多模态处理与增量解码的性能瓶颈。在全模态端到端适配上,平台成功打通了视觉编码器、音频特征提取及大语言模型的主干推理,确保原生多模态交互的稳定性。这意味着模型在处理图文、音视频混合输入时,能够保持流畅的响应与一致的语义理解能力。

在框架特性优化方面,通过通信与计算的深度融合及算子重构,彻底消除了多卡间的重复计算,显著提升了MoE架构的推理吞吐量。对于拥有280B总参数的大模型而言,减少冗余计算意味着更低的推理成本和更高效的资源利用,也让大规模部署变得更加可行。

小红书开源大模型获华为昇腾全量适配

此外,针对增量推理阶段的延迟痛点,昇腾原生适配了MTP投机解码能力,通过单次前向并行生成多个候选Token并完成校验复用,大幅减少了解码前向次数。这一机制在长文本生成、多轮对话以及复杂Agent任务中尤为关键,能有效降低首token延迟与整体响应时间,提升用户交互体验。

这一系列底层优化不仅保障了模型的高效稳定运行,也为长程复杂任务场景的智能落地奠定了坚实的算力基础。随着国产算力与开源模型的深度协同,未来更多前沿AI应用有望在自主可控的硬件生态中实现快速部署与规模化服务。

# 小红书 # 开源大模型 # 昇腾 # MoE # 多模态

来源:Heooo AI工具导航