开源项目

阿里Qwen-Image-2.1开源,70亿参数叫板闭源巨头

Heooo 09月21日14时33分 31 阅读

「阿里通义千问团队开源Qwen-Image-2.1图像生成与编辑模型,视觉生成组件仅70亿参数,却在自研基准上超越多数闭源模型。模型支持RGBA透明图像生成、最多十张参考图输入与局部遮罩编辑,一块RTX 3090即可运行,已在Hugging Face、GitHub与魔搭上线,采用禁止商用的研究许可。」

阿里通义千问团队近日正式发布并开源了图像生成与编辑模型Qwen-Image-2.1,开放权重让整个开源社区眼前一亮。这款模型最令人意外的并不是功能有多花哨,而是它的身材——视觉生成组件仅用70亿参数,却在团队自建的评测基准上压过了市面上绝大多数闭源模型。当然,这份成绩单目前仍来自官方口径,第三方独立评测尚未出炉,实际成色还需时间检验。

Qwen-Image-2.1最拿手的一招是“合并同类项”。在官方展示的合照案例中,每张面孔都来自不同人物的单独照片,模型像一位耐心的拼图师,把它们自然缝合成一张群像。这背后是它对透明图像的原生支持:模型生成的并非普通RGB图,而是带透明通道的RGBA格式。用户可以借此把物体单独抠出来,也能直接在透明图层上改写文字,排版与后期处理因此省去大量繁琐步骤。

参考图的处理能力同样夸张。模型一次最多可吞下十张参考图,群像合成、虚拟试穿、房间设计等场景都在同一套框架里跑通。想局部修改也不必重画整张图——画个圈、涂个遮罩、随手点几下做标记,模型就知道该动哪一块。团队透露,架构层面的改动加上KV缓存复用,让推理速度明显提升,尤其当参考图数量增多时,提速感受更为明显。这意味着多图融合这类原本吃算力的任务,交互体验有望变得流畅。

门槛也放得很低。模型已在Hugging Face、GitHub和魔搭社区(ModelScope)同步上线,还配了一个在线Demo供人把玩,一块像RTX 3090这样的主流消费级显卡就能把它托起来跑。对独立开发者和研究者而言,这样的硬件要求相当友好。

唯一需要注意的是授权方式。Qwen-Image-2.1挂的是研究许可,明确禁止商用;企业用户若想落地到产品中,需要另外向千问团队单独申请商业授权。换句话说,个人把玩与学术探索的大门敞开,真要拿它赚钱做生意,还得先过授权这一关。这种“开源权重、限制商用”的路线,正在成为不少大模型团队平衡社区生态与商业利益的常见选择。对于关注图像生成与编辑方向的开发者来说,Qwen-Image-2.1提供了一个参数规模可控、硬件门槛不高、功能覆盖全面的新选项,后续第三方评测与社区二次开发的表现值得持续关注。

# 阿里通义千问 # 图像生成 # 开源模型 # Qwen-Image # RGBA

来源:Heooo AI工具导航