技术进展

MiniMax H3全模态模型发布,2K视频生成革新

Heooo 07月31日12时00分 21 阅读

「稀宇科技发布MiniMax H3全模态生成模型,支持文本、图像、视频、声音统一理解与生成,最高可输出15秒2K分辨率原生双声道音视频。该模型在指令遵循、文字呈现及视频动作迁移等场景表现出色,并采用创新超分方案,通过基础模型in-context重生成替代传统超分模块,未来数天内将开放模型权重。」

稀宇科技近日正式推出新一代全模态生成模型MiniMax H3,该模型在统一多模态理解与生成方面实现重要突破,支持对文本、图像、视频和声音组成的多模态上下文进行深度理解,并可输出具备原生双声道的音视频内容,最高支持15秒2K分辨率,为商用级内容创作提供了全新工具。

据前期邀测反馈,MiniMax H3在指令遵循、文字与品牌信息呈现、以及V2V Motion Transfer(视频到视频动作迁移)等关键能力上表现出色,能够精准、可控地实现多模态内容的编辑与生成。这一特性使其在广告、电商、品牌设计、UI/UX和游戏等场景中具备广泛的应用潜力,满足企业对高质量、高效率内容生成的需求。

在核心技术层面,MiniMax H3引入了增强的Caption能力,并定制了专属模型和全模态理解管线。在推理过程中,大部分素材需要消耗约100K Token,最终输出平均约4K Token,这种设计在保证生成质量的同时,也优化了计算资源的利用效率。

值得关注的是,MiniMax H3的2K视频输出能力并未采用常规的超分模块,而是利用H3基础模型对自身低分辨率结果进行in-context重新生成。这一创新方案最大程度地复用了基础模型已有的生成能力,避免了传统超分方案中依赖“猜测”还原细节的局限,从而能够更真实地恢复视频中的高频信息,提升输出内容的清晰度和自然度。

MiniMax H3的发布标志着全模态生成技术向实用化迈出重要一步。其多模态统一处理能力与创新的超分机制,为内容创作行业带来了新的可能性。据悉,MiniMax H3将在未来几天内开放模型权重,届时开发者可基于该模型进行二次开发与集成,进一步推动AI生成技术在更多领域的落地。

# MiniMax # 全模态模型 # 视频生成

来源:Heooo AI工具导航