商汤开源8B多模态大模型SenseNova U1.5 Lite
「商汤科技宣布开源轻量级多模态大模型SenseNova U1.5 Lite,该模型拥有8B参数,原生支持4K高分辨率图像输出,在文字渲染、复杂布局及图像编辑保持度上表现出色,相关权重已上线Hugging Face与魔搭社区。」
商汤科技近日宣布开源轻量级、原生统一多模态大模型SenseNova U1.5 Lite。该模型拥有8B参数量,定位为轻量化但能力全面的多模态模型,重点强化了视觉生成、图像编辑、文字排版以及高分辨率输出等核心能力,为开发者提供了一套可直接部署的解决方案。
据官方介绍,SenseNova U1.5 Lite原生支持3至4k上下文长度,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,从而提升复杂视觉任务的执行稳定性。这一特性使其在理解多元素场景和精确执行用户指令方面具备更强的鲁棒性,尤其适合需要精细控制的应用场景。
在视觉生成方面,SenseNova U1.5 Lite优化了整体构图、色彩、材质、光影、真实感和局部细节,改善了以往模型容易产生“局部正确但整体完成度不足”的问题。模型还具备更可靠的原生图像编辑能力,可增强对主体身份、空间结构、版式关系以及非编辑区域的保持,同时支持局部修改、元素替换、文字精修和多参考图编辑,进一步满足了专业设计场景下的需求。
针对文字与复杂布局,SenseNova U1.5 Lite加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力。官方表示,该模型正从单纯“生成内容”走向“组织完整视觉表达”,在推动AI从内容生成到设计交付的转变上迈出了重要一步。
此外,该模型支持Bounding Box、Visual Marker以及单图、多图参考等方式,可实现更精细的视觉控制,对指定区域和对象进行准确编辑。原生4K高分辨率输出则让模型在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射,提升了专业级图像输出的可用性。
商汤方面强调,作为8B参数的轻量化模型,SenseNova U1.5 Lite在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模商业模型的交付水平。目前,该模型权重已开放至Hugging Face和魔搭社区,开发者可免费获取并用于相关研究与落地实践。
来源:Heooo AI工具导航