技术进展

阿里发布全模态模型,音频成本降超98%

Heooo 09月18日23时00分 39 阅读

「阿里巴巴旗下Qwen团队发布新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频与视频四种输入,提供100万Token上下文窗口,29项基准测试平均成绩较上代提升超过25%。官方称音频输入成本每小时下降超过98%,并同步开放多模态智能体开发工具。」

阿里巴巴旗下Qwen团队近日发布新一代原生全模态模型Qwen3.8-Omni-Flash,把音频、视频理解与AI智能体能力进一步拧到了一起。该模型支持文本、图像、音频和视频四种输入,并提供100万Token上下文窗口;与上一代Qwen3.5-Omni-Plus相比,官方称其在29项基准测试中的平均成绩提升超过25%。

这次最大的变化不是堆能力,而是处理方式:它并非把语音识别、图像识别简单拼接,而是从模型层面原生处理不同类型的信息。阿里的意图很明确——让模型不只是“看懂”或“听懂”音视频,还能在理解之后规划任务、调用工具,把活干完。

音频是它最锋利的一面。在WildClawBench-MM多模态工具调用测试中,Qwen3.8-Omni-Flash拿下71.0分,Gemini3.8Flash为58.9分;DailyOmni上为85.1对84.0;SpotSoundBench上为67.2对39.7;MMAU上为81.8对76.9,四局全胜。多说话人会议识别的进步更是夸张:AliMeeting测试中,说话人错误率DER从上一代的88.11骤降到3.35,带说话人归属的词错误率cpWER从89.61降到17.18。

不过它并非全面领先。AgenticVBench上Gemini3.8Flash拿到45.0分,Qwen为36.8分;OmniGAIA上则是78.6对74.0,部分视频理解测试里Gemini同样占优。所以“逼近Gemini”主要体现在整体音频和音视频能力上。

真正可能改写使用方式的是价格。Qwen称音频输入的估算成本每小时下降超过98%,音频加视频输入每小时下降超过93%——按官方口径,每小时成本以两分钟素材的处理价乘以30计算,视频按720p、每秒1帧输入。阿里云公布的国际区域定价为每百万Token输入0.15美元、命中缓存的输入Token为0.016美元、每百万输出Token为0.47美元,中国大陆及部分区域价格另有不同。

配合100万Token上下文窗口(最大输入接近99.2万,思考模式下约98.4万,最大输出13.1万),开发者可以把超大规模的音频或视频直接塞给模型,不用再频繁切片、抽帧、串联多个模型。模型还能处理113种语言和方言的音频输入,支持双声道立体声和四声道空间音频分析,并提供函数调用、联网搜索和上下文缓存。

应用方向上,Qwen团队这次主打“智能体交付”:模型能分析长视频、定位关键内容,再调用工具完成视频编辑、内容整理、会议总结和字幕生成。配套方面已公布面向多模态智能体开发的Qwen-MM-Plugins,并计划推出Qwen-Live-Harness。

目前Qwen3.8-Omni-Flash通过阿里云百炼提供服务,覆盖北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等区域;模型本身未直接开放权重,此次主要开放配套的多模态插件和开发工具。

超过98%的音频成本降幅一旦兑现,长时间会议录音、播客、直播和海量视频素材的自动分析将变得前所未有的便宜,多模态赛道上的贴身缠斗也会因此再升一级。

# Qwen3.8-Omni-Flash # 多模态大模型 # 阿里云百炼

来源:Heooo AI工具导航