文章摘要
近期通义千问开源7B轻量模型Qwen-Image-2.1,该模型将文生图与图像编辑能力整合于单一模型,原生支持透明图像生成与编辑,优化了推理效率,升级多参考图输入、灵活局部编辑等编辑能力,还优化了文字排版与人物细节表现,可为各类视觉创作场景提供支持。

近期,一款兼顾图像生成效果、推理效率与使用成本的图像模型正式开源。这款Qwen-Image-2.1将文生图与图像编辑能力整合在单一模型中,视觉生成模块仅包含7B参数,还原生支持透明图像的生成与编辑。

本次更新的模型主要围绕四大核心方向进行优化:

  • 轻量高效,在生成质量与计算成本之间取得最优平衡
  • 原生支持透明图像,实现生成与编辑一体化操作
  • 全能图像编辑,支持多参考图输入与灵活编辑方式
  • 提升视觉质感,优化文字排版与人物细节表现

轻量架构与高效推理

Qwen-Image-2.1采用轻量简洁的模型结构,视觉生成部分包含32层Single-Stream DiT,整体参数量仅7B。即便在较小的模型规模下,该模型依然具备出色的图像生成能力,相关表现可通过公开评测Qwen-Image-Bench与其他开源、闭源模型进行对比参考。

除了生成效果之外,模型还着重优化了推理效率,这一优势在多图输入场景中尤为明显。其优化核心来自混合粒度注意力结构,针对文本和图像采用差异化处理策略:文本部分包括系统前缀与编辑指令,采用Token级因果掩码;图像生成部分则采用Chunk级掩码。同时,模型通过KV Cache复用机制,将输入图像与编辑指令作为静态上下文在首步预计算并缓存,有效提升了推理速度并降低了显存开销。

原生透明图像,生成编辑一体化

透明图像是本次更新的重要能力之一。团队曾在2025年12月发布Qwen-Image-Layered,专门支持透明图像生成,如今这项能力被整合进统一模型中,能够根据用户的提示词描述,自动选择输出普通图像或是带有透明通道的图像。

用户不仅可以通过文本直接生成单主体或多元素组成的复杂透明图像,为设计与素材制作提供更多选择,还可以直接对透明图像进行编辑。例如在保留透明背景的同时修改主体表情,或是对透明图层中的文字内容进行调整。此外,该能力同样适用于真实RGB照片,用户可以输入一张普通照片,让模型提取所需主体并输出带透明通道的RGBA图层,方便后续的设计与合成工作。

全面升级的图像编辑能力

Qwen-Image-2.1的图像编辑能力得到全方位提升,主要体现在四个维度:支持多参考图输入、灵活的局部编辑方式、人像与商品一致性增强,以及覆盖多种类型的编辑任务。

多参考图输入支持

模型最多支持10张参考图输入,可以综合多个主体与素材生成完整协调的画面。比如将多张人像整合进同一张合照,或是通过模特、衣服、鞋子、包包与帽子共5张图片生成完整的穿搭效果,甚至可以参考10张家居图片生成完整的室内布置方案。

灵活的局部编辑方式

模型支持圈选、涂抹与独立掩码三种局部编辑方式,让修改的对象与范围更加明确。例如通过不同颜色的圆圈同时指定多个编辑区域,让模型精准完成对应修改;或是通过涂抹指定区域,在原图对应位置添加新的内容。如果需要保留完整的原始图像信息,用户还可以将原图与独立掩码作为两张图片输入,让模型仅在掩码指定的区域完成编辑。

人像与商品一致性增强

模型重点优化了人物与商品的细节还原能力,在人像编辑中能够保留面部特征的一致性,让修图前后的人物特征高度统一;在商品编辑中则会尽可能保留商品的文字、纹理与形态特征,让商品在新的画面中保持原有细节。

覆盖多种编辑任务

模型支持全景图、信息图与分镜图生成等多种编辑任务,在不同应用场景中都能实现能力平衡。例如输入一张自拍照即可生成对应的全景图,通过可视化工具即可从不同视角查看完整场景;输入一张模特照片可以扩展为内容丰富的复杂信息图;还可以根据人物三视图生成完整分镜,为故事创作与视觉叙事提供素材。

优化视觉质感,提升文字与人物表现

Qwen-Image-2.1进一步提升了图像的整体质感,尤其关注文字与人物的美学表现。在文字生成方面,模型不仅关注内容本身,还注重字体选择、排版设计与画面整体的协调性,能够生成符合场景风格的文字效果。在人物表现上,模型增强了光影与细节刻画,让生成的人像更具真实质感与自然的视觉效果。

总结

Qwen-Image-2.1以轻量的7B视觉生成模块为基础,将图像生成、透明图像处理与多种图像编辑能力整合在单一模型中。通过推理效率优化、最多10张参考图输入、灵活的局部编辑方式,以及更好的人像与商品保真能力,这款模型为设计、内容创作、电商运营与视觉叙事等场景提供了更加高效的工具。欢迎感兴趣的用户体验并反馈相关使用感受。

以上内容不代表本平台立场,仅供读者参考