技术进展

腾讯混元Hy ASR 3.0实现语境理解新突破

Heooo 08月05日06时33分 36 阅读

「腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,融合大语言模型Hy3的语义理解能力,将高精度识别与深度语义结合。在海外开源评测集上,中文普通话、英语、粤语词错误率均压至3%左右,同时在通用识别、上下文感知、多场景鲁棒性和方言覆盖等维度全面提升,实现从逐字转写到理解语境的进化。」

腾讯混元近日正式推出新一代语音识别模型Hy ASR 3.0 preview,这一版本不再局限于传统的逐字硬转,而是通过融合最新一代大语言模型Hy3的深度语义理解能力,实现了语音识别从“逐字转写、单点优化”到“理解语境、兼容场景、一键直出”的质的飞跃。

在技术架构上,Hy ASR 3.0 preview将高精度语音识别与深度语义理解紧密结合,使得模型在处理复杂真实输入时,能够输出更准确、连贯且贴近用户本意的转写结果。这一创新不仅提升了识别精度,更让模型具备了理解上下文的能力,能够智能纠正同音词、消弭语义歧义,从而真正“听懂”用户的意图。

从性能表现来看,Hy ASR 3.0 preview交出了一份亮眼的成绩单。在海外开源评测集上,该模型将多个语种的词错误率(WER)压缩至3%左右:中文普通话为3.34%,英语为2.62%,粤语为3.12%。在腾讯自建的评测集中,无论是通用识别、方言识别、上下文理解、专词理解,还是高噪、耳语等复杂声学场景,WER同样维持在低位,综合评测集上更是取得了最低的错词率。

针对用户实际体验,这一版本重点打磨了四个核心方向。首先是通用识别更准,在通用语音、方言、中英混说等场景下进一步压低错字和漏字,同时有效缓解了长音频中错误不断累积的老问题。其次是更懂意图,模型能够结合上下文精准捕捉用户语境,智能纠正同音词并消弭语义歧义,让转写结果更符合用户本意。第三是更好适配专业场景,支持热词注入增强功能,让模型快速识别品牌名、产品名、人名和行业术语,从而大幅降低业务接入和后续维护的成本。

Hy ASR 3.0 preview的发布,标志着语音识别技术正从单纯的声学转换向语义理解方向演进。通过融合大语言模型的语境感知能力,该模型在复杂真实场景下的表现更加稳健,为智能语音助手、会议转写、客服质检等应用场景提供了更可靠的技术支撑。腾讯混元表示,未来将继续优化模型性能,推动语音识别技术在更多行业落地。

# 腾讯混元 # 语音识别 # Hy ASR

来源:Heooo AI工具导航