商汤开源8B轻量多模态大模型
「商汤科技正式开源轻量级原生统一多模态大模型SenseNova U1.5Lite,参数量仅8B,却展现出超越同量级模型的核心视觉能力,原生支持3至4K上下文长度与4K高清输出,具备高质量视觉生成、可靠图像编辑和复杂文字布局处理能力,推动轻量模型迈向全功能视觉表达。」
商汤科技日前正式宣布开源全新的轻量级、原生统一多模态大模型 SenseNova U1.5Lite。该模型参数量为8B,却在多项核心视觉任务中展现出超越同量级模型的实力,甚至在部分复杂排版与文字渲染上达到了媲美超大规模商业模型的交付水平,为轻量级多模态模型树立了新的能力标杆。
SenseNova U1.5Lite 原生支持3至4K的上下文长度,能够同时处理主体、数量、空间关系、文字、布局以及风格等多重约束,从而显著提升复杂视觉任务执行时的稳定性。这种多约束协同建模能力,使模型在面对高难度视觉生成与编辑指令时,不仅能够理解局部要求,还能保持整体构图和语义的一致性。
在具体功能特性方面,该模型带来了多项核心升级。首先是更高质量的视觉生成,显著改善了整体构图、色彩、材质、光影、真实感和局部细节,有效避免了传统模型常见的“局部正确但整体完成度不足”的问题。其次是更可靠的原生图像编辑能力,增强了对主体身份、空间结构、版式关系以及非编辑区域的保持度,同时全面提升了局部修改、元素替换、文字精修和多参考图编辑的综合表现。
此外,该模型在文字与复杂布局的处理上同样表现亮眼,加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力,推动生成内容向完整的视觉表达迈进。在视觉控制上,它支持 Bounding Box、Visual Marker 以及单图、多图参考等多种方式,能够对指定区域和对象进行更精确的编辑。更值得一提的是,它实现了原生4K高分辨率输出,在高分辨率生成中能够兼顾整体宏观构图与极精细的肌理、微小文字以及光影折射效果。
得益于其轻量化架构和高效推理能力,SenseNova U1.5Lite 有望在社区和实际应用中快速落地,为开发者提供了一套可直接使用的多模态视觉基座。项目源代码现已公开,开发者可通过 GitHub 获取完整权重与推理代码,进行二次开发和场景适配。
来源:Heooo AI工具导航