文章摘要
近期,商汤研发团队开源SenseNova U1.5-Lite-Preview轻量级统一多模态模型,这是基于U1的系统性迭代。它在4K图像生成、视觉指令理解与编辑等方面全方位升级,具备精细化指令遵循、原生4K分辨率、文字与版式优化等能力,还解决了U1在真实场景中的痛点,在多项评测基准上超越U1。该模型已开源,U1 Pro也将近期面向公众服务。

近期,研发团队开源了SenseNova U1.5-Lite-Preview轻量级统一多模态模型,这款基于原生统一多模态架构的产品,在4K高清图像生成、复杂视觉指令理解与可持续迭代编辑领域实现了全方位升级。

早在今年4月,该团队就推出了SenseNova U1,首次完整呈现了基于NEO-Unify架构的原生统一多模态技术路线——在单一模型中同时建模语言、视觉语义与像素生成逻辑,让模型可以原生完成视觉理解、逻辑推理与内容生成全流程。

在过去数月中,团队持续强化模型的图像生成与编辑能力,此次推出的U1.5-Lite-Preview并非简单的模型规模升级,而是基于U1的系统性迭代。它不仅在同一架构中贯通了视觉理解、推理、生成与编辑全链路,更以仅8B-MoT的轻量级体量,将能力推进到4K分辨率、更精细的真实质感、更复杂的视觉控制与可持续迭代编辑方向。

  • 原生支持4K分辨率图像生成
  • 呈现更精细的局部纹理与真实世界质感
  • 实现更准确的中英文文字生成与复杂版式组织
  • 提供更稳定的图像编辑与视觉指令遵循能力

如果说SenseNova U1成功验证了原生统一多模态架构的可行性,证明了从像素与语言出发、端到端构建原生统一多模态模型是一条具备落地价值的技术路线,那么U1.5则将进一步验证“统一架构的能力可持续扩展空间”——证明这类架构不仅可以同时承载视觉理解与内容生成,还能向更高分辨率、更复杂的信息表达与更真实的视觉世界延伸。

团队认为,未来的多模态模型不应仅仅是不同模态系统的简单拼接,而应该是从底层就能够跨越语言、视觉与交互逻辑进行学习、思考与创造的统一智能体。

精细化指令遵循:解锁复杂创作的细节上限

U1.5-Lite-Preview在生成能力上做了系统性打磨,团队追求的不仅仅是4K高像素,更关注三个核心方向:模型能否理解超长的自然语言和结构化视觉指令以实现精准视觉控制;超大画幅下的细节是否经得起放大并保持真实质感;信息密集的内容中文字与版式是否足够稳定。

越具体的需求,越精准的输出

在海报、信息图、品牌视觉等复杂创作任务中,一张成品往往需要同时满足多类要求:画面中的主体元素、人物与物体的互动关系、各元素的布局位置、视觉风格、呈现的文字内容,以及必须保留或规避的细节。

U1.5-Lite-Preview重点优化了对长篇自然语言、结构化创作指令的理解能力。对于简单需求,用户用几句日常语言就能快速生成符合预期的内容;面对复杂任务,用户则可以给出完整详细的创作要求,让模型按照明确的视觉结构执行。团队表示,超长提示词并非生成优质内容的必要条件,但其价值在于为复杂创作提供了更高的控制上限。

比如一款“背包产品解析”信息图,就使用了1675词的超长提示词,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束,最终呈现效果完全符合设计要求。

一个值得关注的点是,U1.5-Lite-Preview的强指令遵循能力并非来自对结构化模板的记忆或适配。即使没有高度依赖专门的Prompt Enhance格式化训练数据,模型依然能够稳定执行长篇、多约束、层次化的视觉指令。这正体现了原生统一多模态路线的优势:模型学到的不是某种Prompt格式本身,而是从语言描述到视觉结构的原生映射能力。

为了降低复杂视觉指令的编写门槛,团队还配套了实验性的Prompt Enhance Skill工具:它可以将用户简短的创作想法,自动整理为包含主体、布局、风格、文字和各项约束的完整创作方案,再提交给模型执行,帮助用户把需求表达得更周全,减少因描述遗漏导致的效果偏差。

原生4K分辨率:超大画幅下的细节保真能力

4K分辨率不只是像素数量的提升,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷还是高细节视觉内容,U1.5-Lite-Preview都能呈现真实的材质质感与光影层次。

团队展示了一款横跨2018至2026年的WAIC发展历程长卷,该作品分辨率达到4K,长宽比为10:3,对应的提示词总长3880字。这幅长卷采用传统中国山水长卷的散点透视和连续叙事方式,将上海城市、智慧交通、云计算、智能工厂、大模型、生成式人工智能、具身机器人、智能体与未来城市融合在同一片山河之中,即便放大观看,大量文字、图标等设计细节依然清晰稳定。

除了超大画幅,U1.5-Lite-Preview在常规图像的真实感与细节表现上也有明显提升,覆盖建筑概念图、主题海报、人像特写、手帐设计、商品广告等多个创作场景。

文字与版式优化:高密度信息下的稳定呈现

U1.5-Lite-Preview强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略到复杂信息图,都能在保持统一视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。团队展示的案例包括杂志内页排版、专业信息图设计、城市漫步攻略制作等,均实现了精准的文字排版与视觉风格统一。

可持续图像编辑:告别单次采样,实现迭代创作

图像编辑并非简单的局部像素重绘,它要求模型能够看懂画面内容、理解用户的真实意图,精准判断出“哪里需要修改、如何修改,以及哪些部分绝对不能改动”。

依托原生统一多模态架构,U1.5-Lite-Preview不需要拼接多个独立模型,在同一个模型中即可协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时,模型采用了encoder-free视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈,将文字笔画、局部纹理、空间结构等精细信息保留得更加完整,进一步提升了编辑的准确度、画面稳定性和可控性。

U1.5-Lite-Preview让图像编辑不再是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。这使得图像创作从一次性的“重新采样”,转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从“一次抽卡、不行重来”变成“反复修改、改到满意”。

目前,U1.5-Lite-Preview已覆盖多类主流创作工作流:

  • 参考图风格与设计再创作:可以理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。
  • 多参考图组合编辑:可以从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。
  • 单参考图条件创作:能够以单张人物、产品或场景图片作为视觉条件,在保持主体身份、外观和关键细节的基础上,生成新的海报、信息图、营销页面或其他设计内容。
  • 信息图局部编辑:可以针对信息图中的标题、数字、图标、标注、图表及内容模块进行定向修改,支持元素增删、位置调整、局部美化和瑕疵修复。
  • 文字编辑:可以对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。
  • 交互式精准编辑:支持区域标记、坐标定位、marker标记等方式让模型更准确地理解编辑位置与范围,可对局部属性进行调整。

从验证到落地:针对真实场景的系统性优化

SenseNova U1成功验证了原生统一多模态架构的可行性,而在实际落地与社区反馈中,团队也发现了这条技术路线仍有可优化的真实场景痛点:

  • 在生成场景下,U1在不同区域之间有时会衔接得不够自然,出现细微的网格感、拼接痕迹或纹理断裂;当生成分辨率继续提升时,模型对局部细节、复杂空间关系和整体画面一致性的建模难度也会进一步增加。
  • 在图像编辑任务中,U1已经能够理解自然语言编辑指令,但在更复杂的实际工作流中,仍可能出现编辑范围外内容发生变化、人物身份或主体结构漂移、局部修改影响整体画面等问题。

U1.5-Lite-Preview致力于针对性解决这些真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行了系统性优化:

  • 针对网格伪影和高分辨率细节建模问题,U1.5-Lite-Preview重新设计了生成头,减弱视觉Token网格对最终图像的影响,并将训练进一步扩展至4K分辨率。
  • 针对图像编辑,U1.5-Lite-Preview重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力,使其能够在完成目标修改的同时,尽可能保留原图中不需要改变的部分。

得益于多项能力强化,U1.5-Lite-Preview在多项主流生成/编辑质量评测基准上显著超越U1,并以仅8B-MoT的轻量级规模,实现了可比肩商用闭源模型的图像生成能力与编辑效果:

  • Qwen-Image-Bench从47.14提升到了55.20(搭配Prompt Enhance功能时)
  • ImgEdit-Bench从3.90提升到4.37
  • GEdit-Bench-en从7.47提升到8.17
  • GEdit-Bench-zh从7.42提升到8.05

SenseNova U1.5-Lite-Preview现面向全球用户开源,欢迎广大开发者与创作者下载体验并提供反馈和建议。官方开源渠道包括:

从U1到U1.5的开源,代表了团队在底层创新上的持续进展。同时,面向专业用户的交付级创作模型U1 Pro正在紧密邀测,将在近期对公众开放服务。

以上内容不代表本平台立场,仅供读者参考