通义千问开源7B文生图与图像编辑模型 封面图
开源项目

通义千问开源7B文生图与图像编辑模型

Heooo 09月21日15时00分 30 阅读

「通义千问团队开源新一代图像模型Qwen-Image-2.1。该模型仅7B参数,以32层Single-Stream DiT结构将文生图、透明图像生成与多种图像编辑能力整合进同一框架,支持最多10张参考图输入及圈选、涂抹、掩码三种局部编辑方式,已在GitHub、ModelScope和Hugging Face免费开放。」

通义千问团队正式开源新一代图像模型 Qwen-Image-2.1。该模型以仅 7B 参数的轻量视觉生成模块,将文生图、透明图像生成与多种图像编辑能力整合于同一框架,在生成效果、推理效率与使用成本之间取得了新的平衡。

从架构上看,Qwen-Image-2.1 的视觉生成部分采用 32 层 Single-Stream DiT 结构,参数量仅为 7B。团队通过引入混合粒度注意力结构与 KV Cache 复用机制,使模型在多图输入场景下的推理效率显著提升,显存开销也得到有效控制。这意味着开发者无需依赖大规模算力集群,也能在常规硬件上完成较高频率的图像生成与编辑任务,一体化设计同时省去了在多个专用模型之间来回切换的麻烦。

通义千问开源7B文生图与图像编辑模型

透明图像生成是本次更新的核心亮点之一。模型能够根据提示词自动判断输出普通图像还是带透明通道的 RGBA 图像,并支持在保留透明背景的前提下进行主体表情修改、文字编辑等操作。用户还可以输入真实照片,由模型自动提取主体并输出透明图层,方便后续的设计与合成工作,减少了传统流程中抠图与分层导出的重复劳动。

通义千问开源7B文生图与图像编辑模型

透明图层中的文字同样可以进行编辑,官方示例展示了把文字“BLOOM”修改为“Qwen-Image”的过程,文字形态与背景透明度都能保持自然。在图像编辑方面,Qwen-Image-2.1 支持最多 10 张参考图输入,可综合多个主体与素材生成协调画面,适合需要统一风格的系列化产出;局部编辑则支持圈选、涂抹和独立掩码三种方式,编辑区域的指定更加灵活。

模型还重点提升了人像与商品的一致性——修图后人物面部特征、商品文字与形态均能保持高度还原。此外,模型在文字渲染、人物光影与细节刻画上也有明显提升,覆盖全景图、信息图、分镜图等多种任务场景,说明其在保持轻量参数的同时,对复杂版式与多元素画面的控制力有所增强。

通义千问开源7B文生图与图像编辑模型

目前,Qwen-Image-2.1 已同步在 GitHub、ModelScope 和 Hugging Face 等平台开源,供开发者与创作者免费使用。对于需要批量处理商品图、设计素材与内容创作素材的团队来说,一个可本地部署的一体化图像模型,有望显著降低工具链拼接与外部接口调用的成本,也为社区在透明图层与多图参考方向上的二次开发提供了新的基座。

# Qwen-Image # 通义千问 # 开源模型 # 图像生成

来源:Heooo AI工具导航