开源项目

商汤开源多模态模型原生支持4K图像生成

Heooo 08月03日21时02分 34 阅读

「商汤科技近日开源轻量级统一多模态模型SenseNova U1.5-Lite-Preview,原生支持4K图像生成,在多项评测中超越前代U1,以8B-MoT规模实现媲美商用闭源模型的图像生成与编辑能力,并同步上线GitHub、Hugging Face及魔搭社区。」

商汤科技近日宣布,面向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。这一版本在多项能力上实现了显著提升,特别是在图像生成与编辑领域,以仅8B-MoT的轻量级规模,展现出可比肩商用闭源模型的性能表现。

据官方介绍,U1.5-Lite-Preview在多项主流生成与编辑质量评测基准上大幅超越前代U1。其核心升级包括原生支持4K图像生成,这意味着模型能够直接输出超高分辨率的图像,无需额外的后处理或放大步骤,极大提升了生成内容的细节丰富度和视觉冲击力。同时,模型在局部纹理、细节刻画以及真实世界质感的还原上更加精细,使得生成图像更接近真实摄影或专业设计作品的效果。

在文字处理方面,U1.5-Lite-Preview实现了更准确的中英文文字生成与复杂版式组织。这一能力对于海报设计、广告物料生成、社交媒体配图等场景尤为重要,模型能够准确渲染文字内容,并合理布局图文元素,减少常见的手写文字变形或排版错乱问题。此外,模型在图像编辑和视觉指令遵循方面也表现出更高的稳定性,用户可以通过自然语言指令对图像进行修改,模型能够更精准地理解并执行操作,如调整颜色、替换物体、改变风格等。

此次开源不仅提供了模型权重,还同步上线了GitHub、Hugging Face和魔搭社区三个平台,方便全球开发者获取和测试。GitHub仓库中包含了详细的技术文档和示例代码,帮助开发者快速上手。Hugging Face和魔搭社区则提供了模型下载和在线推理的便捷途径,降低了使用门槛。

商汤科技表示,U1.5-Lite-Preview的发布旨在推动多模态AI技术的普及和创新,让更多研究者和开发者能够基于这一轻量级模型进行二次开发和应用落地。未来,商汤将继续优化模型性能,并计划在正式版本中引入更多功能,以满足更广泛的行业需求。

# 商汤科技 # 多模态模型 # 4K图像生成 # 开源

来源:Heooo AI工具导航