阿里发布Wan3.0视频生成模型
「阿里云宣布新一代视频生成模型Wan3.0开启公测,单次可生成30秒视频,首次支持文档输入,实现“万物皆可生视频”。在角色一致性、人像细节、智能时长等方面全面升级,并公布API价格,即日起在多个平台开放体验。」
阿里云近日宣布,全新一代视频生成模型Wan3.0正式开启公测。这一版本在生成时长、万能创作、全能参考与真实感等维度实现了全面升级,单次生成能力提升至30秒,能够更完整地表达创作意图,从“生成一个镜头”迈向“讲述一段完整的故事”。
Wan3.0的核心亮点之一在于其多模态输入能力。除了传统的文本、图片、音频、视频四种基础模态外,首次支持doc、xls、ppt、pdf、txt、key、pages、numbers以及md等文档格式输入,用户可通过上传文件或链接,搭配提示词生成教学课件、产品演示、动态图表、业务汇报等内容。这一功能将大量办公素材直接转化为视频,极大降低了视频创作的门槛。
在视频生成质量上,Wan3.0针对人像处理进行了重点优化。文生视频模式中的人像力求“千人千面”,更敏锐地刻画五官与皮肤细节,人物情绪表达自然克制,微表情与肢体动作彼此联动。即便是群像场景,也能细腻呈现不同人物的复杂情绪,有效规避了AI人物的“油腻感”与千篇一律问题。
全能参考是Wan3.0的另一大升级方向。该模型可精准复刻参考细节,保持角色、道具、声音、空间关系、风格等关键维度的一致性。对于角色,五官、发型发色、形体、服饰、配饰等细粒度特征均可稳定保持;对于道具,多角度外观、硬件结构、Logo、材质细节均保持一致;对于场景,能准确处理角色站位与机位视角的关系;对于风格,可精准渲染影视拍摄调性,多风格创作时不易发生混淆。
此外,Wan3.0还支持智能时长功能,可根据提示词自动推荐合适时长,并搭配视频延长功能,延展故事走向与剧情发展,让创意自然生长。这一系列特性为连续运镜、一镜到底等复杂镜头语言提供了更充足的表达空间。
即日起,Wan3.0已在阿里云百炼、万镜一刻、万相官网和千问创作PC端开启公测,并在千问APP灰度开放。API方面,480P、720P、1080P的价格分别为每秒0.3元、0.6元和1.2元,API接口将于近期全量开放。这一价格体系为不同需求的用户提供了灵活选择,有望进一步推动AI视频生成技术在各行业的规模化应用。
来源:Heooo AI工具导航