技术进展

MiniMax发布全模态模型H3,成本大幅降低

Heooo 07月31日11时00分 26 阅读

「MiniMax正式发布通用全模态生成模型H3,首次实现文本、图像、视频、音频的统一理解与生成。该模型支持原生双声道音视频输出,最高生成15秒2K分辨率内容,每秒生成成本不到主流模型三分之一。H3引入上下文全模态表示技术,以自然语言为桥梁,实现跨模态复杂任务。MiniMax计划开源H3模型权重,推动国产芯片适配与开源生态建设。」

AI公司MiniMax近日正式发布通用全模态生成模型MiniMax H3,这一模型首次实现了文本、图像、视频、音频的统一理解与生成,打破了长期以来视频生成领域各任务、各模态相互割裂的局面。H3的发布标志着多模态生成模型从“专用专家”向“通用助手”迈出关键一步,为行业带来了全新的技术范式。

据官方介绍,H3支持原生双声道音视频输出,最高可生成15秒2K分辨率内容。在前期邀测中,H3在指令遵循、品牌信息呈现、V2V动作迁移等场景下表现出商用级稳定性,已可应用于广告、电商、游戏、UI设计等多个商业领域。这意味着H3不仅是一个实验室产品,更具备直接落地的商业价值,能够满足企业对高质量、高效率内容生成的需求。

技术层面,H3引入了Contextual Omni Representation(上下文全模态表示)技术,使自然语言成为连接各类模态的通用桥梁。用户只需用语言描述复杂关系,例如“参考某段视频的希区柯克式镜头运动,让指定图片中的人物唱出某段音频的歌声”,模型即可自动完成全链路理解与生成。这种以语言为核心的多模态交互方式,大幅降低了用户的使用门槛,让非专业创作者也能轻松驾驭复杂的跨模态任务。

在性能与成本方面,H3配合自研的H3-VAE与In-context Regeneration技术,在2K分辨率下的每秒生成成本不到主流模型的1/3,768P分辨率下不到1/2,为行业提供了目前已知的最优性价比方案。这一成本优势对于中小企业和个人开发者而言尤为重要,有望推动多模态AI应用的普及。

值得关注的是,MiniMax宣布将在未来几天内,在符合相关法律法规的前提下开源H3模型权重。这也是国产视频生成大模型首次面向社区开放权重,旨在推动开源生态建设并加速国产芯片适配。H3在设计初期就考虑了多款国产芯片的兼容性,其开源将进一步降低国内企业在多模态AI应用上的技术门槛,促进国产软硬件生态的协同发展。

MiniMax方面表示,H3目前仍存在画面精细度和模型规模上的提升空间,后续将推进H系列与M系列模型能力的融合,并通过Scaling持续扩展模型上限。业内分析认为,H3的发布与开源或将改变闭源模型长期主导视频生成领域的格局,为多模态AI的普惠化应用按下加速键。

# MiniMax # 全模态模型 # 开源

来源:Heooo AI工具导航