腾讯混元发布Hy ASR3.0预览版,语音识别迈入理解时代 封面图
技术进展

腾讯混元发布Hy ASR3.0预览版,语音识别迈入理解时代

Heooo 08月05日20时01分 33 阅读

「腾讯混元推出新一代语音识别模型Hy ASR3.0 Preview,基于Hy3大语言模型构建,融合高精度识别与语义理解,方言覆盖十大片区,多语种词错误率低至3%左右。该模型采用MoE架构,经数千万小时数据训练,已在腾讯云开放API,并接入元宝助手,推动语音交互从“听清”向“听懂”进化。」

腾讯混元近日正式发布新一代语音识别模型Hy ASR3.0 Preview,标志着语音识别技术从“逐字转写”迈入“理解语境”的新阶段。该模型基于最新一代大语言模型Hy3构建,融合高精度语音识别与深度语义理解能力,核心目标直指一个质变——让AI不再只是听清每个字,而是真正听懂用户说的话。

在识别广度上,Hy ASR3.0 Preview不要求标准普通话,方言识别覆盖粤语、吴语等10大方言片区和20余个二级小片区。开源评测集数据显示,该模型多语种词错误率(WER)控制在3%左右,其中中文普通话3.34%、英语2.62%、粤语3.12%,整体准确度已接近行业天花板。这一成绩得益于模型对上下文语境的深度理解,能够结合语义自动消除歧义并智能纠错同音词。

腾讯混元发布Hy ASR3.0预览版,语音识别迈入理解时代

技术层面,Hy ASR3.0采用兼顾效率与性能的MoE架构,基座升级至Hy3。混元团队自研了无监督语音Encoder,通过数千万小时级无监督语音数据训练,从复杂音频中提取高质量声学表征——Encoder负责“听得好”,Hy3负责“理解对”。在数据策略上,团队对语音Encoder和大语言模型进行联合训练,引入数千万小时级多来源语音数据,并通过多阶段能力注入,使模型具备上下文感知、复杂场景适应和方言识别能力。

后训练环节围绕通用识别、上下文理解和复杂场景鲁棒性构建高质量SFT方案,覆盖上下文Context、专业名词、不同声学环境及多样人群语音,并引入多阶段强化学习针对复杂长尾场景持续优化。这种“先理解再转写”的思路在会议纪要、访谈长音频等场景中优势尤为明显——传统逐字听写遇到同音歧义往往束手无策,而Hy ASR3.0能根据语义逻辑自动选择正确用词。

目前,Hy ASR3.0 Preview已上线腾讯云官网对外开放API,可广泛应用于智能客服、内容理解和语音搜索等领域。腾讯旗下AI助手“元宝”已完成首发接入,用户可通过语音输入体验方言识别、上下文智能纠错和复杂环境稳定转写等功能,且免费开放。WorkBuddy等产品也在陆续接入中。当语音识别从“听字”进化到“听懂”,人与AI的交互方式正在被重新定义。

# 腾讯混元 # 语音识别 # 大语言模型

来源:Heooo AI工具导航