腾讯极低bit翻译模型落地B站弹幕 封面图
技术进展

腾讯极低bit翻译模型落地B站弹幕

Heooo 08月27日20时00分 11 阅读

「腾讯混元团队将1.8B翻译模型压缩至440MB,采用1.25-bit稀疏三值量化技术,翻译质量几乎无损,已落地B站直播弹幕实时翻译,内存占用仅500-700MB,兼顾隐私与成本。」

腾讯混元团队近日公布了一项端侧AI技术突破:将原先占用3.3GB内存的1.8B翻译模型压缩至440MB,且翻译质量几乎零损失。该成果已正式接入哔哩哔哩直播弹幕实时翻译,完成了从实验室到高并发业务场景的跨越。

作为基底的Hy-MT2-1.8B模型原生支持33个语种互译,在FLORES-200通用翻译评测中,其整体翻译质量已优于多款商业翻译API。然而,传统FP16精度下1.8B模型需3.3GB内存,即使采用4-bit量化也超过1GB,难以满足端侧多任务并发的内存管理需求。为此,腾讯设计了两档极低比特量化方案。

腾讯极低bit翻译模型落地B站弹幕

第一档面向中高端设备的2-bit方案,采用拉伸弹性量化(SEQ)技术与量化感知蒸馏(QAD),将模型体积压缩至574MB,同时保持近无损的翻译质量。第二档则面向全系设备,基于腾讯自研的Sherry稀疏高效三值量化技术,该技术已被ACL2026选为Oral。其核心是通过细粒度稀疏机制,使每4个参数中最重要的3个用特定数值存储,其余置零,平均每参数仅占1.25-bit,再配合专为CPU设计的STQ内核,最终将模型压缩至440MB。

为了让极低bit模型摆脱对特定移动端ARM架构的依赖,英特尔团队针对x86生态进行了深度适配。通过优化量化矩阵运算中的向量化、权重重排和VNNI指令融合环节,Hy-MT2的低比特量化格式在英特尔主流机型上实现了显著更快的token运行速率,将极低比特方案从移动端扩展至PC和边缘设备。

在实际业务验证中,哔哩哔哩已将该模型正式用于直播弹幕实时翻译。整套资源下载约600MB,运行时内存占用保持在500到700MB之间,平均单条弹幕翻译耗时约500到800毫秒,能够流畅处理常规弹幕频率,并准确驾驭网络流行语。这种设备本地独立运行模式,既降低了云端调用成本与带宽开销,也避免了数据上传,切实保障了用户隐私安全。

# 腾讯混元 # 极低比特量化 # 翻译模型 # 端侧AI

来源:Heooo AI工具导航