阿里发布Qwen3.8全模态模型,音视频能力提升
「阿里千问上线新一代原生全模态模型Qwen3.8-Omni-Flash,可同时处理文本、图像、音频与视频输入,支持1M上下文。在30项评测中相比上一代平均得分提升超过26%,音视频能力接近Gemini 3.8 Flash,API每小时音频输入价格降幅超98%。」
阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台提供使用。该模型可同时处理文本、图像、音频和视频四类输入,支持1M上下文长度,百万Token的图文音视频输入价格为0.8元。官方表示,模型在保持同尺寸文本模型能力的同时,全模态能力较上一代有明显提升。
在累计30项评测上,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR与ISR分别提升8.5分和14.1分。会议场景指标进步尤其明显,AliMeeting的DER与cpWER从88.11和89.61降至3.35和17.18。
官方称,其音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。在Agentic长音视频理解中,OmniVideoBench准确率从63.4提升至67.8,Token消耗从145736降至79117,降幅约45.7%,意味着模型在看得更准的同时也更省。
为支持长音视频处理,官方扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。长音视频理解支持按需描述、Agentic主动取证、会议任务推进和视频深度研究报告;可控音视频Caption可指定描述对象、时间范围、信息粒度和输出格式。
应用层面,会议场景支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险,结合工具调用还能发送邮件、整理任务或编码。音视频生产方面,Music2MV可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词;短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检;长电影解说中,用户只需提供影片和一句话需求,Agent即可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。信息压缩方面,Qwen-MM-Plugins开源Video2Note,可将数小时视频内容生成图文对应的PDF笔记;Omni Skill Creator可从操作演示中提炼标准作业流程,并转化为可复用的Agent Skill。
实时版Qwen3.8-Omni-Flash-Realtime可在音视频流输入的同时完成感知与响应,并结合实时上下文调用工具,还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。官方称,该实时版是首个支持听声辨位的全模态大模型,融合空间声音与视觉信息,判断声源方向和距离,并可通过Skill注入身份设定、表达风格、业务知识与交互规则。
值得注意的是模型自身的优化能力。在一项实验中,Qwen3.8-Omni-Flash在12小时内尝试提升Qwen2.5-Omni-3B的四川话识别能力,它自主选定评测集,经过4轮实验构建3413条训练数据,字符错误率从25.79%降至15.30%,相对下降约40.7%。官方同时公布了Qwen3.8-Omni-Flash-Realtime API在不同输入场景下的实际吞吐与延迟性能信息,以及在OmniVideoBench、Video-MME-v2和LVOmniBench上对比Gemini 3.8 Flash的Static模式与接入Qwen Code的Agent模式的完整测试结果。
来源:Heooo AI工具导航