开源项目

MiniMax H3开源 支持多模态生成2K视频

Heooo 08月03日15时01分 31 阅读

「MiniMax正式开源新一代通用视频模型MiniMax H3,该模型能够统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒、带原生立体声音频的视频。H3支持多种输入模式,包括文生视频、首尾帧生成和全模态参考,并提供了H3-Context-IR、H3-Base和H3-Regenerate-2K三个模块,基于社区许可发布。」

今日,MiniMax正式开源新一代通用视频模型MiniMax H3,这一举措为视频生成领域带来了全新的可能性。作为一款通用型全模态生成系统,H3的核心优势在于其能够统一理解由文本、图像、视频和音频构成的多模态上下文,并在此基础上生成高质量的视频内容。这一能力使得H3在遵循复杂多模态指令方面表现出色,为创作者提供了更为灵活和强大的工具。

在技术规格上,H3支持输出4至15秒的视频,帧率为24FPS,并支持包括21:9、16:9、4:3、1:1、3:4和9:16在内的多种宽高比。默认输出分辨率将较短边设置为768像素,但通过H3-Regenerate-2K模块,用户可以实现2K分辨率的生成,从而获得细节更丰富、视觉保真度更高的结果。此外,H3还支持32kHz的立体声音频输出,为视频内容增添了沉浸式的听觉体验。

H3的输入规格同样灵活多样,提供了两个主要模型版本。H3-Base-FL2VA支持首尾帧模式,允许用户输入0张、1张或2张图像,分别对应文生视频、首帧生视频、尾帧生视频以及首尾帧生视频等不同模式。而H3-Base-Ref2VA则支持全模态参考模式,可接受最多9张图像、3段视频和3段音频的混合输入,所有输入文件合计不超过12个,这为复杂的多模态创作提供了充足的空间。

完整的H3系统由三个模块组成:H3-Context-IR负责深入理解和提炼输入的多模态指令,将其转换为模型更易于处理的上下文中间表示;H3-Base则基于该表示生成768p分辨率的音频和视频;H3-Regenerate-2K则将生成结果与原始上下文结合,以2K分辨率重新生成,从而提升细节和保真度。这种模块化设计不仅提高了生成质量,也为开发者提供了灵活的集成方式。

在语言支持方面,H3稳定支持11种语言,包括阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语,对于其他语言也提供了不同程度的支持。这使其能够服务于全球范围内的创作者和开发者。

MiniMax H3基于MiniMax H3 Community License发布,开源地址已公布在Hugging Face平台上。这一开源举措预计将吸引更多开发者参与到视频生成模型的研发和应用中,推动多模态AI技术的进一步普及和创新。

# MiniMax H3 # 开源 # 视频生成 # 多模态

来源:Heooo AI工具导航