文章摘要
Qwen-Image-3.0正式上线,支持最高4.5k token输入长度,兼容12种语言,新增多图融合等功能。经多方面测试,其在处理中文长文本、多参考图合成及精细化编辑时表现出色,整体可与同类顶尖模型媲美,使用门槛低,适合创作者。

最近又有一款实用的图像生成模型迎来了重磅更新——Qwen-Image-3.0正式上线,这款新模型支持最高4.5k token的输入长度,兼容12种语言,内置20多款字体,还新增了多图融合、图中图创作以及精细化图片编辑功能,整体表现让人眼前一亮。

我们最初尝试让模型生成猫咪全品种科普图鉴,生成的效果和文字稳定性都相当不错,已经达到了和同类顶尖模型齐平的水准。

我们首先测试了模型的中文文本生成稳定性,最直接的办法就是输入超长的文本内容,验证模型能否完整复现所有信息且不出现文字崩坏、排版混乱的问题。我们输入了一段需要多屏滑动才能看完的长文本提示词,最终生成的图片不仅完整呈现了所有信息,还精准制作了对应的表格,整体完成度非常高。

除了长文本排版,我们还尝试让模型生成带文字的菜谱图,只提供了十二道菜的菜名和定价,生成的图片不仅将每道菜品的图片和名称一一对应,价格信息也准确无误,同时按照分类进行了分区排版,整体呈现出拼贴质感的菜单风格,细节匹配度拉满。

我们还尝试让模型生成带有创意排版的中文文字作品,分别尝试了印刷风格字体和手写毛笔字两种风格,生成的效果摆脱了常见AI生成作品的生硬感,更具人文质感,搭配上画面元素后整体设计感十足。

接下来我们测试了多语言混合排版的能力。首先尝试生成横版双语工作日历,生成的图片不仅包含了中文和对应英文翻译,还准确还原了8月1日是周六的日期信息,没有出现任何文字崩坏的问题。

我们又尝试了更复杂的双语科普图,即便需要展示大量信息,模型依然能够按照逻辑清晰排版,所有文字都清晰准确,没有出现模糊或错字的情况。

为了进一步挑战极限,我们让模型生成包含六种语言的产品说明书图片,最终生成的作品成功承载了多语言文本,所有内容都准确对应,即便同时展示大量文字也没有出现糊图或排版混乱的问题,表现相当亮眼。

在UI设计测试环节,我们首先生成了车载系统界面和学习APP的演示图,整体UI细节到位,甚至连手机APP界面的灵动岛都准确还原,游戏页面的设计也贴合当下手游的审美风格。

多图融合功能也是本次更新的亮点之一,我们首先提供了一张模特图和一套包含六款服装的组合图,让模型将模特换上指定服装并合成到同一场景中,生成的作品完美还原了模特、服装、配饰和站位,一次生成就达到了相当高的完成度。

我们还尝试将产品图和品牌手册结合,让模型生成产品主KV海报,模型成功读取了品牌的主题色、核心概念和logo元素,生成的海报风格统一且贴合品牌调性。

除了文生图和多图融合,Qwen-Image-3.0的图片编辑能力同样出色。我们尝试修改海报上的文字,模型能够完美延续原图的字体风格;还可以精准清除玻璃画面中的路人和拍摄者倒影,不留痕迹;替换产品图、将竖版人物海报扩展为横版KV等操作也都能轻松完成,不会破坏原图的其他细节,修改效果自然逼真。

最后我们测试了手冲咖啡的手绘分镜图,生成的作品不仅步骤准确,画风自然,还传递出了轻松惬意的氛围。

经过全方位测试后,我们可以明显感受到Qwen-Image-3.0的整体表现已经可以和同类顶尖模型媲美,尤其是在处理中文长文本、多参考图合成以及精细化编辑任务时,表现尤为出色。这款模型不仅生成速度快、使用门槛低,在国内即可直接访问使用,对于需要图像生成和编辑的创作者来说是非常实用的工具。

可以说,这款国产图像模型又迈出了坚实的一大步,无论是日常创作还是专业工作场景,都能为用户提供可靠的支持。

以上内容不代表本平台立场,仅供读者参考