技术进展

腾讯混元轻量版开源 权重压缩至214GB

Heooo 09月01日23时02分 3 阅读

「腾讯混元团队推出Hy4 preview轻量版,将模型权重从近1.5TB压缩至约214GB,依托Sherry稀疏三值量化与MIX-STQ1_0混合精度策略,长文理解与原始BF16模型持平,数学能力小幅回落。轻量版已开源,支持llama.cpp、vLLM等主流框架,并通过prima.cpp实现异构设备联合推理。」

腾讯混元团队近日宣布推出新一代MoE大语言模型Hy4 preview的轻量版,将模型权重从接近1.5TB压缩至约214GB,同时保持主流任务性能基本稳定。这一轻量版已同步上线Hugging Face和GitHub,支持llama.cpp、vLLM、SGLang等主流推理框架,极大降低了部署门槛。

Hy4 preview是腾讯于8月28日发布并开源的新一代混合专家大语言模型,总参数量达到7700亿,激活参数为490亿,上下文长度支持100万Token。如此规模的模型在原始BF16格式下权重接近1.5TB,给实际应用带来不小的存储和推理压力。轻量版的推出,正是为解决这一痛点。

此次压缩依托两项核心技术。其一是Sherry稀疏三值量化算法,将路由专家层权重压缩至平均每权重1.25比特。其二是MIX-STQ1_0混合精度策略,该方法依据校准数据逐层决定每层的量化位宽,敏感层保留较高精度,采用2.06比特的IQ2_XXS格式,而不敏感层则采用更激进的STQ1_0格式,仅为1.31比特。两种技术结合,在极低比特率下尽可能保留了模型能力。

从性能评测结果看,轻量版在长文理解任务上几乎与原始BF16模型持平,多轮长上下文检索也保持在同一水平,数学能力仅出现小幅回落。MCP Atlas得分从83.7微降至83.2,SWE-Bench multi从82.9降至81.3,整体表现令人满意。

在异构设备联合推理方面,腾讯混元与prima.cpp合作验证了一项新方案。在一台配备单张4090显卡的笔记本与一台四卡A4000服务器上,两者合计拥有80GB显存和64GB内存,且分属两个局域网。通过prima.cpp的异构调度,将MoE层拆分分配至不同设备,使214GB的轻量版模型达到每秒1.02 Token的推理速度,比笔记本单机offload方案快了约6倍。这一结果展示了轻量级模型在异构环境下的实用价值。

轻量版模型现已开放下载,量化GGUF、原模型和代码仓库均已公开。开发者可以基于自身硬件条件,灵活选择部署方式,快速体验超大MoE模型的强大能力。腾讯混元团队表示,未来将持续优化压缩技术,推动大模型在更多场景中落地。

# 腾讯混元 # 模型压缩 # 量化 # 开源 # 异构推理

来源:Heooo AI工具导航