商汤开源8B轻量4K多模态AI U1.5-Lite-Preview指哪改哪

近日推出的一款国产开源生图模型,凭借多项贴合真实创作需求的核心能力引发关注:它不仅支持4K直出画质,参数仅为轻量的8B级别,同时具备开源开放的特性,更能实现精准的指哪儿改哪儿式编辑。这款模型便是商汤面向社区开源的SenseNova U1.5-Lite-Preview,作为轻量级原生统一多模态模型的早期预览版本,它延续了商汤自研的NEO-Unify架构,将语言、视觉语义和像素生成整合在同一套模型中,覆盖视觉理解、推理、生成与编辑全流程。
原生4K直出只是这款模型的亮点之一,在仅8B-MoT参数的轻量体量下,它同时实现了三项核心能力:
- 复杂Prompt适配能力出色:支持长篇、多约束、层次化和结构化的视觉指令,能够处理复杂的创作需求;
- 文字与版式表现优异:专门针对海报、信息图、品牌视觉等高信息密度内容优化,细节和排版都能精准呈现;
- 支持精细化编辑能力:可以基于参考图进行二次创作,支持多图组合、局部文字修改,还能通过红框、坐标和marker实现精准的局部编辑。
在真实创作场景中,“会画图”只是第一步,真正决定模型能否融入创作流程的,恰恰是复杂任务处理和精细化编辑的能力。
首先可以看到它在高信息密度信息图创作上的表现:以银盐摄影主题的拆解图为例,模型不仅还原了被拆分的复古相机的镜头、快门、胶片仓等细节结构,还通过一束橙色的成像光线强化了视觉中心。这类图表的难点从来不是绘制单个物体,而是同时整合时间线、知识模块、结构拆解、流程说明等多层信息,让读者一眼就能理清视觉层级和内容逻辑。最终生成的作品保持了统一的黑白蚀刻风格,主视觉醒目且细节饱满,整体排版清晰有序,经得起放大细看。
如果说第一张图测试的是从零构建复杂信息图的能力,那接下来的案例则验证了模型复刻设计逻辑并重构主题的实力。输入的原图是一张名为《Modern Pop Culture Film & TV Milestone Journey》的信息图,以弯曲的路径串联多部流行影视作品,节点、卡片和插画统一采用手绘水彩风格,整体氛围轻松亲切。当将主题替换为《The Journey of Postal Mail》(邮政邮件的旅程)后,模型并没有完全推翻原有设计,而是保留了弯曲的路径框架、节点式的排版节奏和左中右的版式关系,仅将影视相关的内容替换为投递、分拣、运输、派送四个邮政环节,将原本的剧集卡片、电影海报模块换成邮筒、分拣中心、运输车和邮差上门等贴合新主题的元素。这说明模型不仅能模仿画风,更能理解整套设计的组织逻辑。
在实际的内容生产流程中,从头绘图的时间往往只占一小部分,更多的工作集中在改稿和迭代上。以博物馆文创开发流程的信息图为例,当客户要求保留原有框架但更换核心视觉元素时,模型的表现尤为亮眼。它完整保留了原图的整体结构:左侧竖排标题、中间的“MUSE”字样、右侧从“研究与挖掘”到“反馈与迭代”的六步流程,以及底部的价值模块和米棕色调性,仅替换了最核心的主视觉元素,完美适配了调整后的主题方向,完全符合真实工作中“保留框架、更换视觉”的改稿需求。
还有一项更具挑战性的测试:将由船体和浪花组成的艺术化“迎”字,修改为“命”字。最终的输出结果中,原有船体被保留作为“命”字的最后一竖,周围的浪花重新组合成其余笔画,新的字体仿佛从海面自然生长而出,没有出现生硬的平面拼接感,充分展现了模型对局部细节和整体视觉逻辑的理解能力。
除了单图编辑和重构,模型还支持同时读取多张参考图。比如在韩式双拼炸鸡的食谱图创作中,一张手绘食谱的参考图提供了版式和画风,另一张真实照片提供了食物内容,模型将原味炸鸡、甜辣炸鸡和可乐融入米色网格笔记本的手绘模板中,同时保留了螺旋装订、手写标题、卡通小猪等细节,最终生成的成品可以直接用于社交媒体传播,插画和照片的风格过渡自然,没有明显割裂。
在办公场景中,这项能力同样实用:只需一张普通的人物照片,模型就能将其转换为单栏简历,将头像放在顶部,保留原图中的三角梅作为封面视觉元素,搭配玫粉与米白的配色,自动排布姓名、职位、联系方式、工作经历和技能条等简历内容。
模型的“指哪儿改哪儿”能力体现在两类编辑场景中:一类是精准的局部文字修改,比如圈出信息图中的“35+MIN”,要求修改为“25MIN”,模型可以在保持原有字体、字号和排版的前提下完成修改,同时自动移除用于定位的红框;另一类则是整体氛围的调整,比如将帆船驶过金色满月的暖色场景,通过marker标记和修改要求,将满月替换为深红色血月,在水面添加浓雾,并将整体光影调整为暗调夜景,同时保留帆船、船上人物和背景树林的原有位置,仅修改指定区域的视觉效果。这两类编辑分别对应了精准微调与整体风格调整的真实创作需求。
这些看似多样的能力,都基于SenseNova U系列的NEO-Unify原生统一多模态架构。该架构将语言理解、视觉语义分析和像素生成整合在同一个模型中,从读懂指令、分析参考图到判断修改逻辑、最终生成像素内容,都可以在一套系统内完成,这也是图像编辑功能能够精准实现的核心基础。比如在“迎”改“命”的测试中,模型需要先理解文字造型由船体和浪花组成,定位需要重构的区域,同时保留飞鸟、海面和原有文字的位置;在血月修改案例中,模型需要调整整体光影和氛围,同时稳定保留主体结构。
为了实现4K直出的画质,团队重新设计了生成头,减弱了视觉Token网格对最终画面的影响,并将训练数据扩展到4K分辨率,这让放大后的画面纹理、材质和光影都更加细腻,减少了常见的网格感、拼接痕迹和纹理断裂问题。
对于复杂的创作任务,模型还通过Prompt Enhance功能强化了长Prompt的控制能力:日常生图只需一句自然语言即可完成,而在海报、信息图等复杂场景中,用户可以逐层明确布局、风格、文字、比例和禁止项等要求,获得更高的创作控制上限,并不会因为使用长Prompt而增加使用门槛。
从第三方评测榜单来看,相较于上一代U1模型,U1.5-Lite-Preview的表现有了显著提升:在Qwen-Image-Bench榜单中,开启Prompt Enhance后的得分从47.14提升至55.20;ImgEdit-Bench得分从3.90升至4.37;GEdit-Bench的英文项从7.47提升至8.17,中文项从7.42升至8.05;在WeEdit榜单中,Overall Average得分达到了6.44,作为一款轻量级开源模型,这样的表现相当优秀。
回顾这款模型的升级亮点,4K直出的画质固然亮眼,但真正让它能够融入真实创作流程的,还是其强大的理解和编辑能力。在传统的AI生图场景中,出图只是第一步,后续的改稿、调整往往需要重新生成或回到专业软件中处理,而U1.5-Lite-Preview能够理解现有图片的主体、版式、风格和空间关系,顺着用户的反馈进行多轮修改,让AI生图真正贴近内容生产和设计的工作流。
当然,U1.5-Lite-Preview仍属于早期预览版本,在短Prompt理解、小字与人像细节、整体美学一致性以及复杂场景编辑的稳定性上,还有进一步提升的空间。据了解,U1.5的正式版本很快就会开源,届时这些问题都将得到更好的解决。此次商汤将轻量版面向社区开源,也让这些能力和待优化的问题能够更早地进入开发者与创作者的真实工作流中接受检验。
总而言之,如果说4K画质决定了一张图能被放大展示的上限,那么AI的图像理解和编辑能力,则决定了它能在创作流程中走多远。
开源地址:
GitHub:
https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face:
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
魔搭社区:
https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview


