MiniMax开源视频模型H3支持2K高清生成
「人工智能企业MiniMax宣布开源新一代通用视频模型H3,支持4至15秒视频生成、24 FPS帧率及32 kHz立体声,并提供2K分辨率输出。模型支持11种语言,具备首尾帧和全模态参考模式,通过三模块架构实现高保真音视频生成,现已基于社区许可正式发布。」
近日,人工智能企业MiniMax正式宣布开源其新一代通用视频模型H3,这一消息在视觉大模型领域引发广泛关注。H3模型在生成规格上实现了多项突破,支持4至15秒的时长输出,并提供24 FPS帧率以及32 kHz立体声,为用户带来流畅且高保真的音视频体验。
在分辨率方面,H3不仅支持常规模式下的768像素短边输出,还通过专用的H3-Regenerate-2K方案,能够生成高达2K分辨率的画面,极大提升了视觉细节的呈现。同时,模型支持21:9、16:9、4:3、1:1等多种常见宽高比,满足不同创作场景的需求。在多语言交互上,H3稳定支持阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语和俄语等11种主流语言,为全球开发者提供了便利。
为了适应多样化的创作需求,H3推出了灵活的模型版本与丰富的输入规格。其中,H3-Base-FL2VA首尾帧模式支持输入0至2张图像,能够灵活应对文生视频、首帧生视频、尾帧生视频以及首尾帧协同生成等不同任务。而H3-Base-Ref2VA全模态参考模式则支持最多9张图像、3段视频(总时长不超过15秒)以及3段音频的混合输入,文件总数最高可达12个,为专业创作者提供了精细的控制手段。
在系统架构的底层设计上,完整的MiniMax H3包含三个核心模块。首先是H3-Context-IR(上下文中间表示),它能够将复杂的多元指令深度剖析并转化为模型易于理解的结构,是保障高品质输出的关键环节。其次是负责生成768p基础音视频的H3-Base模块。最后则是通过将初始结果与原始上下文回传实现2K超分重构的H3-Regenerate-2K模块。这一组合既保留了生动的细节,又极大提升了视觉的保真度。
目前,该模型已基于MiniMax H3 Community License正式发布,相关开发者与技术爱好者可以通过官方渠道获取模型权重和文档。此次开源不仅展示了MiniMax在视觉大模型领域的技术积累,也为多模态生成的研究与应用提供了新的可能性。
来源:Heooo AI工具导航