轻量级多模态!商汤8B参数SenseNova U1.5 Lite开源

近期,一款轻量级原生统一多模态大模型正式对外开源,凭借8B参数量实现了媲美超大规模模型的视觉创作交付能力。这款模型围绕真实视觉创作场景完成了全面优化,从指令解析、图像生成到精细编辑全链路提升了落地实用性。
相较于此前的预览版本,该正式版更聚焦于能力的真实落地:团队针对实际视觉任务重新完善了训练数据、任务设计与后训练流程,强化了视觉质量、复杂指令遵从、文字与布局处理、原生4K输出、高精度图像编辑以及精细视觉控制等核心能力,为创作者提供了更可控、更高清且更具性价比的创作工具,推动AI视觉生成从“可用”迈向“稳定交付”的新阶段。目前该模型已面向全球开源,开发者与创作者可直接部署体验。
很多创作者都曾遇到过这样的困扰:精心撰写的长prompt被模型截断,不得不反复删减细节;想要修改图中的局部元素,却被AI误改了背景或主体。过往行业多聚焦于提升画面的美感与写实度,但在实际生产流程中,模型能否精准执行完整创作意图才是核心痛点。
- 超长复杂指令遵从:打破多数开源模型在处理超过1000字符的指令时易崩溃、遗漏细节的瓶颈,该模型原生支持3000-4000字符的上下文长度,可同时处理主体、数量、空间关系、文字、布局、风格等多重约束,提升复杂视觉任务的执行稳定性。
- 高质量视觉生成:优化整体构图、色彩、材质、光影与局部细节,减少“局部正确但整体完成度不足”的问题,让生成内容更符合创作预期。
- 可靠原生图像编辑:增强对主体身份、空间结构、版式关系与非编辑区域的保留能力,同时提升局部修改、元素替换、文字精修与多参考图编辑的效果。
- 优秀文字与复杂布局:强化中英文文字、海报、信息图、品牌视觉与多文本排版能力,实现从“生成零散内容”到“组织完整视觉表达”的升级。
- 精细视觉控制:支持边界框、视觉标记以及单图、多图参考等多种方式,可对指定区域和对象进行精准编辑。
- 原生4K高分辨率输出:在高分辨率生成时兼顾整体构图与极精细的肌理、微小文字与光影折射效果,满足专业创作的细节需求。
真实场景落地验证
以下通过多个典型创作场景,展示该模型在实际交付中的表现:
复杂视觉创作
在创意海报与封面生成场景中,模型展现出极佳的美学完成度与高对比度质感,具备高精度的复杂布局能力,可精准掌控文字与留白节奏;在处理文字与物体的空间遮挡时,能够维持光影的自然连贯,充分展现了原生多模态对三维空间叠加关系的深刻理解。
在高密度信息图生成场景中,模型可保证中英文、数据等丰富细节的准确无误;通过多层级结构化空间映射,完美串联各类标签和信息,实现复杂信息可视化图表的高质量一次性交付。
在高清细节与艺术质感创作场景中,针对建筑结构、人像肌理、艺术画作笔触等复杂场景,模型可生成媲美摄影与大师画作的细腻质感作品。
原生图像编辑
模型的图像编辑能力覆盖多种场景:
- 布局与风格可控编辑:比如将手绘草图转换为复古暖色漫画时,可精准遵循超长复杂指令,保留线稿分镜与人物轮廓,上色与材质补充自然细腻;同时可深度理解原海报的版式框架,在切换主题后仍能保持完美的视觉结构。
- 多参考图融合生成:可提取多张参考图的核心特征,在全新空间中自然重组元素,比如将不同场景的主体、风格与光影结合,生成比例协调、光影自然的新作品;也可将多张美食素材融合为一张完整海报,自动匹配一致的背景、餐盘质感与环境光,并完美植入排版文案。
- 信息图编辑:可在保持主体与信息布局不变的前提下,更换整体风格,比如将海报改为蓝银色高科技工业风;也可精准修改局部属性,比如调整特定标签的颜色与文字样式。
- 文字编辑:支持黑板菜单等场景的局部文字替换,保持原有笔触风格与整体视觉效果;也可实现多处精准文字重写,在不破坏原有背景与布局的前提下完成文本替换。
- 指定区域与局部精细编辑:可按照定位标记对特定区域进行精准修改,比如将指定模块翻译为目标语言并保留原有图标、层级与排版,或对场景进行创意风格转换并移除原有标注。
8B参数架构的突破
作为8B参数量的轻量化模型,该模型在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模商业模型的交付水平。
传统的多视觉任务处理方案通常采用显式路由或多专家协同机制,将渲染、美学、编辑等能力分发给不同模型,但这会大幅增加系统开销与推理时延。该模型基于NEO-unify统一架构,打破了这一传统定式:
- 解耦训练与交付:训练阶段针对文字、美学、编辑独立训练专家模型;交付阶段通过多专家在线策略蒸馏技术,将多专家能力无损融合至单体8B模型中。
- 理解与生成双向反哺:视觉语义理解与空间建模形成的认知直接反哺生成能力,使其可自然消化多层级指令,同时在多模态理解榜单上保持强劲表现。
- 极致性价比:8B参数量支持单卡流畅运行,无需频繁切换路由模型,单次推理即可兼顾语义理解与像素生成,极大降低调用成本与推理延迟。
此外,正式版还强化了任务导向的强化学习后训练,聚焦优化三大关键维度:指令遵循,可轻松解析超长prompt并精准执行严苛的多重复杂限制;视觉偏好,全面优化构图、材质与光影,提升画面质感与视觉完成度;编辑保持,实现像素级局部修改,完美保留非目标区域的内容与结构。
这种复杂指令跟随与精细编辑能力,使得该模型可以无缝支持多轮迭代修改而不偏离创作方向,真正打破了单次生成的局限,让轻量级模型参与长流程的持续创作与二次改造成为可能。
获取与体验方式
多模态AI是迈向物理世界与真实生产力的必经之路,该模型开源的初衷,是为全球开发者与创作者提供一个轻量、统一、极具性价比且高可控的生产力工具。
开发者可通过以下链接获取模型与相关资源:
- 官方代码仓库:https://github.com/OpenSenseNova/SenseNova-U1
- 模型部署平台:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
- 在线体验地址:https://unify.light-ai.top/

