开源项目

阿里千问开源 Qwen-Image-2.1 图像模型

Heooo 09月20日23时02分 43 阅读

「阿里千问开源 Qwen-Image-2.1 图像模型,将文生图与图像编辑整合于同一模型,视觉生成部分仅 7B 参数,原生支持透明图像生成与编辑,可支持最多 10 张参考图,增强局部编辑与人像、商品保真度,并提升文字排版与人物光影表现。」

阿里千问宣布开源千问图像系列的新模型 Qwen-Image-2.1,官方将其定位为当前兼顾生成效果、推理效率与使用成本的开源图像模型。与以往将文生图与图像编辑拆分处理的思路不同,Qwen-Image-2.1 把两类能力整合进同一个模型之中,视觉生成部分仅有 7B 参数,并原生支持透明图像的生成与编辑。

从架构思路上看,这一版本最值得关注的是「一体化」与「轻量化」的组合。过往开源图像模型往往需要在生成质量和推理成本之间做取舍,而 Qwen-Image-2.1 试图通过轻量的模型结构与推理优化,在两端之间取得平衡,官方将其概括为「小模强效,极致价比」。

透明图像能力是本次更新的一大特色。模型可以根据提示词生成普通图像或透明图像,并支持透明图层编辑与抠图。对于需要图层分离的设计流程、素材制作以及电商场景而言,这一能力意味着原本需要多步工具链配合的工作,可以在同一个模型内完成。


在编辑能力方面,Qwen-Image-2.1 支持最多 10 张参考图,增强了局部编辑、人像与商品保真度,并覆盖多种编辑任务。官方用「全能编辑,多局保全」来描述这一特性,强调多参考图输入下的稳定表现。多参考图的引入,通常有助于模型在保持主体一致性的同时完成风格迁移或细节替换。

生成质感同样是本次升级的重点。官方表示模型提升了文字排版、人物光影与细节表现,让生成结果更具美感,即所谓的「真实质感,字雅人美」。文字排版与人物光影历来是图像生成模型的难点,前者考验模型对字形结构的理解,后者则关系到成图的真实感与可用性。

目前 Qwen-Image-2.1 的模型权重已在 HuggingFace 与 ModelScope 两个平台开放下载,开发者可以基于开源权重进行本地部署、二次训练或集成到自有工作流中。对于关注图像生成与编辑方向的开源社区而言,一个 7B 量级、同时覆盖生成与编辑、并原生支持透明通道的模型,具备较高的实验与落地价值。

# Qwen-Image-2.1 # 阿里千问 # 开源图像模型 # 文生图 # 图像编辑

来源:Heooo AI工具导航