MiniMax H3视频模型开源,支持2K高分辨率
「稀宇科技宣布将于8月3日开源MiniMax H3通用多模态视频模型,该模型支持文本、图像、视频、声音的统一理解,可输出原生双声道音视频,最高支持15秒2K分辨率。得益于多项技术创新,H3提供高性价比,2K分辨率下价格不到主流模型的1/3,适用于影视、广告、电商等商业场景。」
稀宇科技(MiniMax)今日宣布推出其最新的通用多模态视频模型MiniMax H3,并计划于北京时间8月3日0点正式开源。这一消息在AI社区引发广泛关注,标志着视频生成领域又迎来一位强力竞争者。
MiniMax H3的核心能力在于对多模态上下文的统一理解与生成。它能够同时处理文本、图像、视频和声音,理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合,输出具备原生双声道的音视频。这意味着用户可以通过文字描述、参考图片或视频片段,生成连贯且富有表现力的视频内容。
在技术层面,MiniMax H3采用了多项创新技术,包括Contextual Omni Representation、H3-VAE、H3-Omni Transformer以及In-context Regeneration。这些技术共同提升了模型对复杂场景的建模能力和生成质量。官方表示,得益于这些技术,H3能够提供行业内最优的性价比,默认提供2K分辨率输出,在2K分辨率下每秒价格不到主流模型的1/3,在768P分辨率下价格为主流模型720P的1/2。
MiniMax H3的亮点不仅限于性能,还在于其多模态精准编辑与控制能力。它支持对人物、物体、场景、声音与节奏进行多维度编辑,并具备精细化的指令遵循能力。例如,用户可以指定视频中某个物体的颜色变化、人物的动作调整,或背景音乐的节奏切换,模型能够准确执行这些指令。
面向商用场景,MiniMax H3被定位为适用于影视、广告、品牌、电商与游戏等真实商业内容生成工具。它支持文字字幕、品牌信息、创意特效、产品展示、UI/UX动态演示、游戏视觉及风格化表达,为创作者提供了一站式解决方案。
此次开源无疑将推动视频生成技术的普及。开发者社区可以基于H3进行二次开发,探索更多应用可能。随着开源日期的临近,业界对H3的实际表现充满期待,尤其是在性价比和编辑能力方面的真实体验。
来源:Heooo AI工具导航