9 月 20 日,阿里巴巴通义千问团队宣布开源图像生成模型 Qwen-Image-2.1。该模型将文生图与图像编辑整合在同一架构中,视觉生成部分仅有 70 亿(7B)参数,并原生支持透明图像的生成与编辑,官方称其在生成质量、推理效率与使用成本之间取得了平衡。

据官方介绍,Qwen-Image-2.1 的主要特性集中在四个方面。其一是”小模强效,极致性价比”:通过轻量的模型结构与推理优化,在有限算力下兼顾生成质量与计算开销。其二是”原生透明,创改一体”:模型可根据提示词直接生成普通图像或带透明通道的图像,并支持对透明图层进行编辑与抠图,省去后期处理的额外步骤。
其三是”全能编辑,多局保全”:单次编辑最多支持 10 张参考图,在局部修改、人像与商品保真等任务上表现更稳定,覆盖多种常见的图像编辑场景。其四是”真实质感,字雅人美”:模型在文字排版、人物光影与细节刻画上做了优化,使生成结果更具质感。
模型权重与推理代码已在 GitHub、Hugging Face 与 ModelScope 三个平台同步开放。作为通义千问(Qwen)系列在图像方向的延续,Qwen-Image-2.1 面向开发者与个人用户免费提供,延续了阿里在开源多模态模型上的一贯路线。对于需要在本地或云端低成本部署图像生成能力的团队而言,这款 7B 级别、支持透明图的开源模型提供了一个新的可选项。