文章摘要
为解决AI生成信息图在高信息密度场景下局部修改困难的问题,相关团队推出Infographic - V3并开源。该模型延续强大生成能力,加入编辑功能,支持文字、内容、风格、布局等编辑。其采用专业训练路径,评测表现优异。目前它具备单轮生成和修改能力,未来有望实现自主迭代的创作闭环。

如今AI生成的信息图已经越来越贴近真实生产需求,清晰的排版、自然的图文融合让创作效率大幅提升。但在高信息密度的场景中,文字错误、内容微调等局部修改依然难以避免,哪怕一个小失误都可能让整张图无法直接使用,用户往往需要反复重新生成,耗时又费力。

为解决这一痛点,相关团队推出了SenseNova U1信息图增强版V3(简称Infographic-V3),这款模型不仅延续了前代强大的信息图生成能力,还首次加入了专业的信息图编辑功能,让用户无需推倒重来,就能针对局部细节或整体风格进行精准修改。

模型权重下载地址:
https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V3

相关技能地址:
https://modelscope.cn/collections/SenseNova/SenseNova-Skills

示例1:风格与文字修改

将原图的风格转换为漫画风格,同时替换两处文字:将“STYLE”改为“时尚杂志”,将“FORWARD”改为“美丽的补充力”。

示例2:内容与元素调整

删除海洋图片海面下的塑料垃圾,将中央口号改为白色手写体“SAVE OUR OCEAN”,调整海龟位置并在底部新增回收标志,同时保持整体海洋分层结构清晰。

局部文字编辑

Infographic-V3支持两种主流的文字编辑方式,能够在保留原有版式、配图和视觉结构的前提下完成精准修改:

  • 定点区域修改:用户可以在图中标注需要修改的目标区域,针对特定位置的文字、图标进行替换或修正,比如修复模糊的标题、替换错误的文字内容等。
  • 自然语言指令修改:通过清晰的Prompt直接指定修改需求,比如替换特定文字、调整文案内容,无需手动标注区域即可完成修改。

• 将红色框内的“经典·从容·每一刻”替换为经典时尚手表图片,蓝色框文字改为“100米防水”,橙色框补充说明电池寿命约10年

• 修复模糊的标题“量子互联网的第一条链路”,保留其余内容不变

• 在指定区域添加“年度结余目标:120,000元”的文字内容

• 修正古诗文本错误,将“我不见,黄河之水地下来”改为“君不见,黄河之水天上来”,同步修正另一处诗句错误

• 将“不够高级”替换为“DESIGN!OR DIE!”,将“没有惊喜感”调整为“缺乏设计感会导致”

• 在透明杯壁上添加随弧度变形的文字“CURLY & PROUD”,并呈现玻璃与茶水后的透明度和色偏效果

• 调整四代员工使用AI工具的比例数据:Gen Z 92%、Millennials 81%、Gen X 68%、Boomers 55%,同步调整柱状图高度,保留其余视觉元素不变

局部内容编辑

除了文字修改,模型还支持对局部视觉元素进行调整,比如更换整体风格、替换特定元素等。例如可以将信息图的主题风格转换为乐高风格,同时修改年份文字和标题文案:将“2022”改为“2025”,将“FINESTBUSINESSTRENDS”替换为“HELLO! WORLD!”。

全局风格编辑

用户可以在保留核心信息与结构的前提下,更换信息图的整体视觉风格,让同一份内容适配不同的品牌、主题和传播场景。例如:

  • 将图片风格转换为中国传统风格,同时替换字体为宋体
  • 将整体风格迁移为亮色模式,保留所有文字、数据与版式
  • 将风格转换为复古羊皮纸地图风,不改动原有文字与布局

全局布局编辑

Infographic-V3还支持全局布局调整,能够在保留核心信息的基础上重新组织内容层级与版面结构,让信息呈现更加清晰,灵活适配不同尺寸和使用场景。例如对现有信息图的布局进行美化优化,调整元素间距和排版结构。

强大的基础生成能力

值得注意的是,编辑能力的加入并没有牺牲模型的基础生成性能。Infographic-V3延续了前代在图文融合、复杂排版和结构化视觉表达方面的优势,能够轻松处理高信息密度内容、复杂版式和多样视觉风格,满足专业级的信息图创作需求。

专业的训练路径设计

为了获得稳定的信息图编辑能力,团队没有仅在后续微调阶段进行调整,而是回到MT(中期训练)阶段重新设计了训练路径。围绕真实的编辑需求,团队合成了大量形式多样的信息图编辑数据,并按照合理配比联合训练文本生成图像(T2I)与图像编辑任务,随后依次完成监督微调(SFT)和强化学习(RL)阶段。

这种联合训练方式让Infographic-V3在保留较强信息图生成能力的同时,获得了多种文字编辑和风格编辑能力,为信息图从“单次生成结果”走向“可持续修改的视觉作品”打下了坚实基础。

优异的编辑能力评测表现

针对新增的编辑能力,团队专门搭建了WeEdit评测基准来测试文字编辑能力,同时引入开源的Qwen-Image-Bench进行文生图综合能力评测。测试结果显示,Infographic-V3在两项评测中均取得了优异表现,验证了模型在文字修改、局部编辑和综合图像编辑方面的能力,文生图综合性能也实现了稳步提升。

在编辑榜单WeEdit上,Infographic-V3均分为5.89分,位列开源模型第一

在Qwen-Image-Bench上,Infographic系列模型的性能表现持续增长

未来:实现自主迭代的创作闭环

目前Infographic-V3已经具备单轮生成和单轮修改能力,实现了从首次创作到后续修改的一体化体验,但这只是起点。SenseNova-U1架构原生支持图文交替思考,未来模型可以在生成信息图后主动检查内容与版式,发现问题后自主调用编辑能力完成纠错,并通过多轮迭代持续优化最终结果。

当生成、检查、修改形成完整闭环后,信息图创作将从“用户反复尝试”进一步走向“模型自主打磨成品”,让AI信息图真正进入更可靠、更高效的生产流程。

目前SenseNova U1信息图增强版V3已经面向全球用户开源,欢迎广大创作者、开发者下载体验,并持续提供反馈和建议。

模型文档地址:
https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1_infographic_model_CN.md

以上内容不代表本平台立场,仅供读者参考