商汤U1 Pro:多模态设计大模型的突破与AGI探索

在2026年世界人工智能大会前夕,一场关于AI未来赛道的深度对话在商汤科技办公室展开。当被问及大语言模型已经发展到成熟阶段后,下一个决胜战场究竟在哪里时,商汤首席科学家林达华没有罗列复杂的性能基准,而是指着桌上的矮脚绿植反问:“你能用语言精准描述这盆盆景每一片叶子的精确位置吗?”
这个看似简单的“盆景之问”,恰恰点破了纯文本AI的固有边界:人类通过视觉感知到的海量细节,无法被语言完全穷尽。从高端设计的审美表达,到城市空间的三维布局,再到自动驾驶、具身智能与现实世界的交互,所有需要理解物理空间的场景,都离不开真正的“视觉”能力。而人类大脑本身,正是语言与视觉深度融合的产物——这正是商汤押注多模态赛道的底层逻辑。
过去一年间,从国际巨头到国内厂商纷纷入局多模态领域,但商汤选择了一条更难也更接近本质的硬核路径:从底层实现语言与视觉基座的原生融合。今年3月,商汤正式推出原生统一多模态架构NEO-unify,并于4月开源基于该架构的多模态模型SenseNova U1,率先切入设计赛道。而在2026WAIC大会期间,商汤推出了可交付级别的旗舰模型SenseNova U1 Pro,这款全球首个以“理解、生成、行动”原生统一为内核的多模态工具,具备内生的“图文交错思维”,能够直接输出8K顶级画质的成品,在设计领域直接对标全球顶尖的GPT-Image-2。
原生统一架构的技术突围
长期以来,多模态大模型的主流技术路线都是“拼接式架构”:在成熟的语言大模型之外外挂独立的视觉编码器,本质上是先将图像“翻译”为文本,再交由语言模型处理。这种方案工程门槛低、训练速度快,但技术天花板明显——翻译过程会损耗大量精细化的空间和感知细节,导致视觉与语言的融合效率低下,并非真正的“看见”。
林达华带领的商汤团队很早就意识到了拼接架构的局限,他们认为多模态的终极形态,应该是让不同的AI模态拥有共同的语言和统一表征,能够像人类大脑一样顺畅无阻地深度沟通。2025年中,团队联合南洋理工大学S-Lab在小规模数据上验证了原生融合的设想;同年9月,团队发表学术论文首次系统阐述了彻底移除视觉编码器、建立深层融合的原生多模态NEO架构;2026年3月,商汤进一步发布升级后的NEO-unify架构及相关论文,系统提出了端到端原生统一模型的宏大构想。
在NEO-unify架构中,商汤彻底移除了主流大模型普遍依赖的视觉编码器和变分自编码器,让模型无需“翻译器”,直接从像素和文字中学习。支撑这套架构的是自研的Mixture-of-Transformers(MoT)架构,让语言和视觉信息在模型的每一层计算中完成深度交融。这种从架构层面的重构,意义堪比Transformer之于大语言模型。
令人惊喜的是,这套架构的训练效率极高:仅需3.9亿图像文本示例,仅为业界同等性能模型数据量的1/10,就涌现出了顶尖的视觉感知和推理能力。开源版本的SenseNova U1拥有真正的“图文交错思维链”,可以在同一个上下文里边写字边插图,确保图像和文字在风格与内在逻辑上具备极高的一致性。在同量级开源模型中,仅8B体量起步的U1直接斩获SOTA性能,部分表现甚至跨代直逼主流大型闭源模型。
针对信息图这一极具商业价值的场景,SenseNova系列进行了高频迭代:infographic-V1重构底层算力架构,提升信息密度与排版质感;infographic-V2攻克了“字数一多画面就糊、错字频发”的行业顽疾,大幅提升小字清晰度与排版精度;infographic-V3则重磅引入可编辑功能,让用户可以随时点选修改画面。
从实验室到商用:U1 Pro的交付级突破
在当前的AI热潮中,能生成漂亮图片的AI比比皆是,但一旦进入真实的商业设计场景,这些工具往往就会露出破绽:复杂排版、密集信息、长需求描述的任务中,它们很容易出现图不达意、细节缺失的问题。这是因为“画画”依靠的是审美概率,而“设计”需要的是精准的逻辑与控制。
林达华将U1 Pro定位为一款在审美和设计能力上都达到专业级别的产品,这背后是漫长且严苛的专业化淬炼。整个模型的训练过程,就像一位顶尖设计师的成长史:团队构建了规模过亿甚至逼近数十亿级别的超大型“多模态题库”,单张设计图对应的文字描述和需求说明往往长达上千字。这些天然现实中稀缺的高质量数据,依靠人工与算法精准创造,支撑起了U1 Pro的专业能力。
U1 Pro的训练流分为三个阶段:预训练阶段吞吐数十亿级的图文原生交错数据,打下深厚的认知地基;持续预训练阶段以高比例的合成数据为主力,在数亿量级的数据海中高强度拉升模型的专业设计能力;最终的后训练阶段则百里挑一,精选千万量级的黄金数据进行精雕细琢,让模型的审美沉淀出成品级的交付质感。支撑这套庞大合成数据体系的,是商汤内部一套由超级Agent驱动的复杂自动化数据合成管线。
为了打磨“审美的最后一公里”,商汤还组建了一支由200名美院学生和专业设计师组成的“人类审美团”,他们每天的工作就是对着U1 Pro生成的作品反复找茬、打分,让模型在真实的商业反馈中不断精进。
聚焦信息图:解决商业化的最后一公里
商汤为多模态战略选择的核心赛道是设计方向,尤其是信息图,这是一个商业化价值极强的场景,电商、广告、游戏、出海贸易等B端领域都有大量设计需求。根据相关行业报告,2026年全球设计领域的生成式AI市场规模约为13.3亿美元,大型企业和企业级客户贡献了超过47%的市场份额,是AI设计工具最大的买单方。
长期以来,AI生图走向高端商业化始终面临难以逾越的瓶颈:比如无法准确理解需求导致图不达意,模板拼接方案存在的割裂感,无法建立元素间的设计因果,只是简单堆砌图形文字,完全不理解版式排布、元素搭配与品牌表达的内在关联。一旦客户提出局部微调需求,往往会牵一发而动全身,修改成本甚至超过重新原创。
林达华用一句话点破行业痛点:“学术界生成一张图,100个字错1个,论文里可以打99分。但真实商业世界里,一张客户的海报错一个字,这张图就是废纸,只能打0分。”
U1 Pro依托原生统一多模态架构,从底层理解到图像生成系统性解决了上述难题。在评判模型优劣的标准上,林达华认为只有一个:交付率,也就是生成内容无需大幅修改,可直接交付商用,达到付费专业设计师的出品标准。他公布U1 Pro的最新交付率数据稳定在70%,这个数字放在真实商业场景中足以改变设计赛道的供需关系。60%是商业可交付的基准线,放眼全球,仅有两个多模态模型超越这一基准:商汤U1 Pro和OpenAI的GPT-Image-2,后者被称为多模态行业的御用标尺。
70%的交付率背后是严苛的全维度品控:文字错误率控制在千分级,整张图上千文字仅极低概率出现错字;图形元素、空间布局、色彩搭配等细节错误同样控制在千分级。这意味着U1 Pro真正具备了人类主观的“高级审美”,能够做出让客户心甘情愿买单的设计。
U1 Pro的核心技术在于商汤设计的“视觉拆解思维链”学习模式,将模型训练成了“会思考的设计师”。在训练过程中,当模型拿到一张高质量海报,会先自动拆解图像全部视觉组件,再逆向推理设计师的版式布局逻辑、色彩搭配思路,生成完整的设计思维链进行学习,不只是学形似,而是抓思路、抓神韵。
在生成图片时,U1 Pro不像传统模型那样“一次性盲盒出图”,而是采用多轮智能体生成闭环:第一步基于文本需求拆解信息、规划版式,形成完整的设计方案;第二步依靠内生能力完成全图生成;第三步启动全局自检,识别文字错误、布局瑕疵与审美问题,不断反向迭代修改,直到完全符合交付标准才会输出最终成品。
从设计到世界模型:长期主义的技术布局
在采访中,林达华透露了一个有趣的细节:U1 Pro已经具备了一定的空间推演能力,甚至能够玩魔方。这意味着这款被定位为“设计师”的模型,已经开始隐隐触摸到三维世界的边缘。
在商汤的技术版图中,世界模型并非与多模态底座平行的另一条线,而是视觉与语言深度融合基座上的自然分支,就像Transformer底座可以长出各种大语言模型一样。当下大热的具身智能,同样是这个底座上的成熟分支。以商汤“1+X”战略下孵化的生态企业大晓机器人为例,其推出的“开悟”世界模型,核心就是理解、生成、预测的统一,其底层技术依然是视觉与语言结合的多模态底座,只是在训练中具身数据占比更高。
值得一提的是,就在7月13日,商汤还发布了另一款理解与生成统一的视觉大模型SenseNova-Vision,其核心战略是让视觉成为通用基础模型的原生能力,这种原生视觉能力在多个维度上超越了专用视觉模型,过去需要大量定制化的目标检测、图像分割、深度预测、3D重建等经典视觉任务,现在仅用一个模型就能完成。
终极目标:物理世界的AGI
林达华透露,下一代模型U2将真正走向三维。如果说U1还是在二维平面上的设计,那么U2将融入视频的理解和生成,把感知、理解、生成、行动全部一体化。“也许再下一个版本,你给它一张设计草图,它能把整个建筑造出来。”
而更远处的终极形态,是将模态从视觉、语言扩展到几十种传感器信号,“那个时候,才是大家认为的最完整的世界模型。”
通往终极世界模型的道路并非坦途,物理规则的复杂性超乎想象。在林达华看来,未来不仅要纳入物理规则,还要加入人类社会学等更多维度。“今天机器人能准确拿起一杯水,明天它可能会区分一杯沸水和一杯温水,并做出不同的动作反应。”
每新增一个物理属性维度,数据组合的量级就会指数级暴涨,算力和存储会成为无法突破的瓶颈。林达华对此给出了独到的解题思路:或许未来的解法是对世界属性进行解耦,拆分出不同属性的专用子模型,让它们有机组合、协同推理,而不是穷尽所有数据组合。
在这场充满未知与瓶颈的科学马拉松中,林达华眼中没有疲惫,只有拓荒者的兴奋。采访临近尾声时,当被问到最想带领团队攻克的下一个技术山头是什么,他没有任何犹豫地回答:“物理世界的AGI。”
或许,在AI与人类之间,那些说不出的细节与感知,恰恰是智能最坚硬的部分。


