技术进展

阿里千问发布同传大模型,支持60种语言

Heooo 09月19日20时00分 34 阅读

「阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,以 Interleave 架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟从 2.8 秒降至 2.3 秒。模型在 60 种语言基础上新增实时说话人分离、原文译文同帧同出与长上下文消歧三项能力,采用 Hybrid MoE 的 Thinker 与 Talker 双模块设计。」

阿里千问正式发布同声传译大模型 Qwen3.8-LiveTranslate,以 Interleave 架构对实时同传流程进行重构,在准确度、流畅度与简洁度三个方面实现全面提升。官方数据显示,该模型的字均延迟(LAAL)从原来的 2.8 秒降至 2.3 秒,实时翻译的节奏更接近自然对话,留给听众的等待感明显减少。

在原本支持 60 种语言的基础上,Qwen3.8-LiveTranslate 新增了三项能力,让同传能够进入更广泛的真实场景。其一是实时说话人分离,模型可以让每一句话的归属清晰可辨,同时让音色复刻更加稳定;其二是原文与译文同帧同出,实现双语同屏呈现;其三是长上下文消歧,模型能够联系前文读懂当下,使人名与专业术语的翻译更加精准。这三项能力分别对应多人对话、双语字幕与专业领域翻译等典型需求,指向的是同传从实验室走向实际落地的关键环节。

架构层面,Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker 与 Talker 双模块设计,通过 Interleave 方式衔接流式理解、文本输出与语音生成。其中,Thinker 把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列并端到端产出,让理解与翻译在单一序列内完成;Talker 再结合译文和源音频,把译文合成为保留原说话人音色的译文语音。相比将识别、翻译、合成拆分为多级流水线的传统做法,这种设计把多个环节收敛到统一序列中,有助于压缩链路带来的延迟损耗。

评测结果方面,在覆盖 14 个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,Qwen3.8-LiveTranslate 在翻译的忠实度、流畅度、简洁度以及说话人识别的错误率 DER 四个维度上均优于目前行业主流的实时同传系统。官方还在公开的 FLEURS 音频测试集上评测了 70 个语言方向的实时同传表现,该模型在翻译质量、字均延迟、语音识别准确率以及语音合成质量四个维度上,均领先于上一代模型以及当前主流的实时同传系统。

从技术演进的方向看,同声传译长期面临延迟与质量难以兼顾的取舍:要压低延迟,往往要牺牲上下文的完整性;要保证译文质量,又容易让输出落后于说话人。Qwen3.8-LiveTranslate 通过单一因果序列承载理解与翻译、再以双模块分工完成语音合成,为这一矛盾提供了一条新的解决思路。随着说话人分离与长上下文消歧能力的加入,实时同传的应用边界也从单人演讲扩展到多说话人的会议、直播与跨语言交流场景。

# 阿里千问 # 同声传译 # 大模型 # 实时翻译

来源:Heooo AI工具导航