能生图、能抠图,还能接着改:千问Qwen-Image-2.1开放权重

发布时间:2026年09月22日 来源:AIGC 开放社区 作者:AIGC 开放社区 浏览量:4

千问又开放了一款图像模型,这次把透明素材、十图参考和局部修改放到了一起。

9月20日,Qwen-Image-2.1发布并开放权重。它将文生图与图像编辑整合进同一个模型,视觉生成部分为7B参数,原生支持透明图像生成和编辑。

图片

Qwen-Image-Bench 公开评测对比

从发布案例来看,这次更新针对的需求相当具体:把几个人合成一张合照,让模特穿上指定的衣服,或者只改照片中的手表、发色和服装。

对于需要反复改图的人来说,比第一张图是否惊艳更重要的,是下一次修改能否听得懂要求、保得住细节。

透明素材可以直接生成,改完还能继续用

Qwen-Image-2.1的一项重要变化,是把透明图像能力整合进生成和编辑流程。

图片

用户可以通过提示词要求输出透明背景素材,不必每次先生成一张完整图片,再找工具去掉背景。生成内容也不限于单个人物或物体,还可以是多个元素组成的透明画面。

图片

素材生成之后,还能继续修改。

在千问展示的案例中,模型可以调整透明背景中主体的表情,也能替换图层里的文字。例如,将“BLOOM”改成“Qwen-Image”,展示结果保留了原有的主要视觉风格。

图片

这类修改对海报、贴纸和活动物料很实用:设计方向已经确定,只需要换一句文案,不希望连整个画面都重新来过。

模型还支持从普通照片中提取指定主体,输出带透明通道的RGBA图像。从照片里提取前景树叶,去除后方建筑等背景内容。

图片

这里的透明图像,可以理解为背景留空、便于继续合成的素材,并不意味着模型会自动交付一份包含完整可编辑图层的设计源文件。

十张参考图,分别交代人、衣服和场景

多图参考的价值,是让用户少用文字猜来猜去,直接把需要的东西交给模型。

Qwen-Image-2.1最多支持10张参考图。人物、服装、配饰和家具,可以分别作为输入素材,参与同一张图片的生成。

千问展示了几种比较直观的用法。

一组案例把六张人物照片合成为一张合照。另一个穿搭案例,则将模特、衣服、鞋子、包和帽子作为五张输入图,生成一套完整造型。

六张人像参考生成多人合照

室内设计案例使用了十张参考图,将家具与装饰元素组合到一个空间里。这比“帮我生成一间好看的客厅”更接近实际需求:用户已经有喜欢的沙发、单椅和地毯,现在想看它们摆在一起是什么样子。

十张家居参考图生成室内布置

但多图合成最难的地方,也恰恰在这些细节里。

商品换了场景,外形不能跟着变;人物换了衣服,不能连脸也换掉。官方文档中对一张手串佩戴示例的观察就很具体:整体结构和配色得到保留,但黑色珠子的尺寸仍有差异。

图片

这种差异对概念展示未必显眼,放进商品详情页,就值得放大检查。演示能说明模型具备这类能力,却不能代替每一张成图的核对。

圈出哪里,就把修改要求交代到哪里

除了提供参考图,用户也能直接在原图上标出需要修改的地方。

Qwen-Image-2.1支持圈选、涂抹和独立蒙版三种局部编辑方式。

在发布案例中,一张照片被圈出了三个区域,分别对应去掉手表、调整发色和更换服装。用户不用反复描述物体的位置,可以通过颜色和标记把要求指向具体区域。

图片

涂抹的方式更适合新增内容。另一个案例在画面中标出一块区域,要求模型在那里添加潜水员。

图片

如果不想让标记覆盖原始图像,也可以把原图与独立蒙版一起输入,由蒙版指定修改范围。

这几种方式并不复杂,却能减少沟通中的歧义。“把右边那个改一下”,远不如直接圈出来清楚。至于圈外内容能保留到什么程度,仍要看具体任务和生成结果,不能理解为像素级不变的保证。

7B背后,做了减少重复计算的优化

Qwen-Image-2.1的视觉生成部分采用32层Single-Stream DiT,参数量为7B。这里的7B指的是视觉生成组件,不宜直接写成整个运行系统的全部参数量。

除了压缩模型规模,千问也针对推理过程做了优化。模型采用混合粒度注意力,并复用KV Cache,减少输入图像和编辑指令在生成过程中的重复计算。

对用户而言,这些技术最终要体现在等待时间和硬件开销上,尤其是在同时输入多张参考图的时候。不过,仅凭7B这一项指标,还不能得出“普通电脑随便跑”的结论,具体体验仍取决于部署配置。

模型也继续改善文字排版、人像光影和细节表现。相比单独强调这些画质变化,这次更值得注意的是:它们与多图参考、透明素材和局部修改被放进了同一套工具里。

文字渲染示例一

做一张穿搭图,可以先提供素材,再调整局部;生成一个透明主体,也可以继续改表情和文字。不用每次都从一张全新的图片开始。

目前,模型权重已可下载。使用前需要注意,仓库采用的是 Qwen Research License:允许的用途限定为非商业研究或评估,商业使用需要另行取得授权。

对这款模型,最有说服力的测试或许不用复杂:拿一张自己真正需要修改的图片,交代清楚哪些地方要动、哪些不能动,再看它能把这份要求完成到什么程度。

免责声明:本文来自AIGC 开放社区客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。

0 0 0
有话要说  人讨论    4 人阅读
发表

游客

这位投稿者太神秘了,什么都没留下~

超天才网©2017 www.supergenius.cn All Rights Reserved ICP备09005826号 京ICP证130304号

联系我们| 加入我们| 法律声明| 关于我们| 评论互动

超天才网©2013-2014 All Rights Reserved ICP备09005826号 京ICP证130304号

关注我们: