文章摘要
2026年7月18日,商汤科技在世界人工智能大会发布旗舰级多模态大模型SenseNovaU1Pro。该模型是交付级原生多模态智能体基座,实现理解、生成与行动统一,支持8K超清输出。它具备四大核心能力,经多场景实战验证。目前预览版已开启邀测,8月正式上线。其发布推动多模态AI迈向“系统级交付”,提升国产模型全球竞争力。

2026年7月18日,商汤科技在世界人工智能大会(WAIC)上正式发布旗舰级多模态大模型SenseNova U1 Pro。作为面向长程任务的交付级原生多模态智能体基座,SenseNova U1 Pro实现了理解、生成与行动的深度统一。该模型支持原生8K超清输出,围绕“一个复杂目标”持续完成理解、规划、执行、检查和修正的完整闭环。SenseNova U1 Pro的发布标志着多模态AI正式从“内容生成”迈向“系统级交付”的新时代。

商汤发布SenseNova U1 Pro多模态大模型

SenseNova U1 Pro:多模态大模型的范式跃迁

商汤科技此次发布的SenseNova U1 Pro,并非传统意义上的图像生成模型的简单升级,而是对整个多模态大模型技术路线的一次重新定义。从产品定位来看,SenseNova U1 Pro被定义为“交付级原生多模态智能体基座”——这意味着它不再只是一个“生成工具”,而是一个能够独立完成复杂任务的智能体。

从“内容生成”到“系统级交付”的演进逻辑

理解SenseNova U1 Pro的价值,需要先看清多模态AI的发展脉络。商汤科技董事长兼CEO徐立在WAIC演讲中指出,多模态AI正沿着一条清晰的长程路径演进:从最初解决“生成美”的单点创作,到可交互的可控生成,再到今天的系统级交付。

商汤科技联合创始人、首席科学家林达华对此做了更细致的划分:第一阶段解决“真实感生成”的问题;第二阶段能够以自然语言交互并持续修改,实现多模态创作进阶;第三阶段则是在真实场景中直接完成“交付级”创作,完美兼顾设计美感和内容精准。按照这个划分标准,市面上绝大多数多模态大模型仍停留在第二阶段,而SenseNova U1 Pro的目标是率先跨入第三阶段。

这一演进路径在代码领域已经得到了验证——从Copilot辅助专业开发者,到Vibe Coding通过自然语言表达意图,再到Agentic Coding围绕目标完成规划、执行、检查和交付。商汤科技正是借鉴了这一逻辑,将多模态大模型从“抽卡式生成”推向“确定性交付”。

NEO-unify:打破理解与生成割裂的核心架构

SenseNova U1 Pro之所以能够突破“生成”边界、走向“稳定交付”,其底层核心得益于NEO-unify内核架构。这一架构在原生多模态体系中实现了语言和视觉的统一表征,打破了传统多模态大模型中理解与生成相互割裂的壁垒。

传统多模态大模型往往采用“多专家模型拼凑”的方式——一个模块负责理解、另一个负责生成,再通过复杂的拼接逻辑将它们组合起来。这种架构的先天缺陷在于:理解与生成之间缺乏统一的表征空间,导致信息在传递过程中不断损耗和失真。而SenseNova U1 Pro所采用的NEO-unify架构,从底层实现了语言和视觉信息的统一表征与高效协同,让理解与生成在同一个模型框架内完成深度统一。

商汤在视觉AI领域十余年的技术沉淀,也为SenseNova U1 Pro的多模态长程智能体能力提供了坚实底座。2026年3月,商汤进一步发布了升级版的NEO-unify架构及配套论文;同年4月,商汤正式发布并开源了基于NEO-unify架构的基础模型SenseNova U1。从SenseNova U1实现理解与生成的原生统一,到SenseNova-Vision完成经典视觉能力的原生融合,商汤在多模态技术路线上持续沉淀、迭代进化,最终推出了SenseNova U1 Pro这一旗舰产品。

SenseNova U1 Pro四大核心交付能力

围绕“一个复杂目标,持续理解、规划、执行、检查和修正”的产品理念,SenseNova U1 Pro带来了四大核心交付能力。

巅峰设计美感,告别“AI味”

SenseNova U1 Pro将图像生成从“细节逼真”推进到“专业设计美感”的全新阶段。其生成的作品具备极强的构图、色彩与排版美学,直接实现专业交付品质。在商汤内部的评审机制中,一支由200位专业设计师组成的团队对SenseNova U1 Pro的每张生成图片进行评判——只有当60%以上的图片达到“愿意直接交给客户”的标准时,才算达到交付级。据林达华透露,普通多模态大模型的交付率仅为个位数,即使是近期更偏商业化的模型,交付率也低于五成。

原生8K超清输出

SenseNova U1 Pro最高可支持8K原生分辨率输出,轻松驾驭高信息密度的超长、超大图创作。画幅放大后,文字、线条、图标和模块关系仍然清晰稳定,经得起印刷、展览级的细节检验。值得注意的是,当前全球顶尖的多模态大模型如GPT-Image-2等,原生直出分辨率上限为4K。SenseNova U1 Pro在分辨率这一维度上实现了对国际顶尖产品的超越。

极致的图文与细节控制

SenseNova U1 Pro大幅加强了图文信息整合分析能力。在极高信息密度下,它仍能维持整体版式与内容表达,文字渲染出错率极低。这一能力直接回应了设计行业中长期存在的痛点——传统多模态大模型在处理包含大量文字的信息图、海报等场景时,中文排版几乎必然出错,一张信息图只要错几个字,整张图就失去了商业价值。

长程Agentic闭环思维

基于统一基座内生的理解、生成和行动能力,SenseNova U1 Pro支持长程图文交错思维,能够围绕复杂目标进行数十轮的Agentic Generation Loop(智能体生成循环)。在最新版本中,SenseNova U1 Pro进一步实现了整体风格与局部文本的同步精准可控编辑,让交付结果可被持续修改与使用。这意味着设计师可以对SenseNova U1 Pro生成的图片进行“手术刀式”的精准修改,而非推翻重来。

横向对比:SenseNova U1 Pro vs 主流多模态大模型

对比维度 SenseNova U1 Pro GPT-Image-2 国内主流多模态模型
原生输出分辨率 8K 4K 通常为2K-4K
核心架构 NEO-unify原生统一架构 未公开 多专家模型拼凑为主
理解-生成关系 原生统一 未公开 通常分离
长程任务能力 Agentic闭环,数十轮自主迭代 有限 有限
图文交错思维 原生支持 部分支持 有限支持
交付级标准 60%以上专业设计师认可 同等水平 普遍低于20%
中文排版能力 极低错误率 一般 普遍较差
商业化进度 2026年8月正式开放 已商用 部分商用

SenseNova U1 Pro的“交付级”实战验证

在WAIC 2026现场,商汤科技通过多个高难度案例展示了SenseNova U1 Pro面向复杂多模态任务的“系统级交付”实力。这些案例覆盖了美学叙事、逻辑控制以及硬核数据推理三大高难度场景。

九周年水墨长卷:美学叙事的极致考验

SenseNova U1 Pro生成了一幅4:1超宽画幅的宣纸水墨风东方美学长卷。这幅名为《智会世图》的长卷串联了WAIC从2018年到2026年九年的发展历程,图中包含丰富的河流、山脉、城市地标与高密度小字信息。远看具备统一的视觉叙事,放大后大量文字、图标等设计细节完美支撑。据量子位的实测报道,这张原图大小达51M,放大后字迹依然清晰。这一案例充分验证了SenseNova U1 Pro在超大画幅、超高信息密度场景下的稳定输出能力。

体育战术可视化:数据推理的完整闭环

在硬核数据推理场景中,SenseNova U1 Pro展现了极强的“数据向视觉转化”能力。它能将复杂的体育战术及数据——如世界杯决赛双方的晋级路径、核心球员对位、战术体系、传球网络及触球热力图等高密度推理结果融会贯通,自主生成一张高清的可视化图表报告。这一过程完整闭环了“信息搜集-分析推理-复杂视觉交付”的全流程,证明了SenseNova U1 Pro不仅是一个“画图工具”,更是一个具备深度理解和推理能力的多模态智能体。

影视级分镜创作:从世界观到成片的一站式交付

在视频创作前端,SenseNova U1 Pro可以完成世界观搭建、角色设定、镜头规划、分镜统一等完整视觉规划。在《沙影之刃》创作案例中,SenseNova U1 Pro完成了故事背景、人物和场景设定,并一次性生成了22个逻辑一致的连续分镜。在此基础上,配合商汤的视频工具,实现了人物、剧情和视觉语言的高度可控交付。这意味着SenseNova U1 Pro的能力不止于静态图像,它可以为后续视频生成提供稳定的视觉蓝图。

SenseNova U1 Pro的商业化落地与生态布局

从开源到旗舰:用户需求的爆发式增长

SenseNova U1 Pro的发布并非凭空而来。2026年4月,商汤科技开源了基础模型SenseNova U1。开源两个多月以来,在真实高强度工作流实践中,SenseNova U1迎来了爆发式增长。2026年6月,SenseNova U1的用户人均日生图量相比5月提升近3倍,表明模型已深度切入真实应用工作流。截至7月中旬,SenseNova U1以及集成了U1能力的SenseNova-Skills代码库在GitHub的总Star数突破8000。

这一数据释放了两个关键信号:第一,市场对高质量多模态大模型存在真实且迫切的需求;第二,SenseNova U1系列模型已经在实际工作流中获得了用户的深度认可。SenseNova U1 Pro正是在这一基础上,针对“交付级”这一更高标准进行的旗舰级升级。

多场景渗透:重塑办公、电商与教育

作为一个通用性的多模态基座,SenseNova U1 Pro正在重塑办公、电商、教育等生产单元。在商业与办公场景中,SenseNova U1 Pro可以胜任企业信息图、高品质商业演示文稿的自动化与精准交付。在电商领域,它可以高效生成宣传海报、商品展示图等商业视觉内容。在教育出版领域,SenseNova U1 Pro的科普图解、教学演示能力已经打开了多种应用可能。

SenseNova U1 Pro已经在商汤旗下的产业级AI“小浣熊”及视频创作工具“Seko”中得到深度验证。数以千万计的个人用户、接近一万家企业用户,以及大批AI原生组织,正在将自己的经验、兴趣和创意转化为可规模化复用的真实交付成果。

开放节奏与定价预期

据商汤科技披露,SenseNova U1 Pro的预览版本已正式开启邀请测试,并将随着推理服务资源扩大逐步放开邀测范围。模型的正式版本将在2026年8月正式上线对公众开放服务,届时相应的定价和API服务也将同步推出。

SenseNova U1 Pro的行业意义与未来展望

多模态大模型的“交付级”标准之争

SenseNova U1 Pro的发布,实际上是在为整个多模态大模型行业划定一个新的竞争维度——“交付级”。在“真实感生成”和“可控生成”之后,行业需要回答一个更本质的问题:AI生成的内容,到底能不能直接用?

商汤科技首席科学家林达华给出了一个明确的标尺:一个多模态大模型是否达到“交付级”,要看专业设计师愿不愿意把AI生成的图片直接交给客户。按照这个标准,绝大多数多模态大模型连及格线都达不到。而SenseNova U1 Pro通过与GPT-Image-2并肩站在“交付级”的阵营中,实际上是在倒逼整个行业从“拼参数、拼画质”的低水平竞争,升级到“拼交付、拼可用”的高维度竞争。

设计成为多模态大模型的下一个主战场

林达华在与媒体对话时明确指出,“设计”正在成为顶级多模态大模型的下一个主要赛场。城市设计、平面设计、工业设计等赛道具有巨大的商业价值,但以往的AI模型始终无法真正打入这些领域。SenseNova U1 Pro把“交付级”设计作为模型应用的重要赛道,可以实现设计、生成、评审的长程循环,输出可以直接交付的“成品级”结果。

从更宏观的视角来看,SenseNova U1 Pro的发布标志着多模态大模型的竞争正在从“模型能力”转向“任务交付能力”。正如代码领域已经从“AI辅助编程”演进到“AI独立完成系统交付”,多模态领域也将经历同样的范式转变。

国产多模态大模型的全球竞争力

在国际竞争格局中,SenseNova U1 Pro直接将GPT-Image-2作为对标对象。在原生分辨率这一关键指标上,SenseNova U1 Pro的8K输出已经超越了GPT-Image-2的4K上限。在中文排版、图文交错等针对中文场景的优化上,SenseNova U1 Pro更是具备了先天优势。

商汤科技是目前国内多模态布局最为全面的厂商之一,其日日新大模型系列以多个子模型覆盖文本、图像、视频、3D四大模态。SenseNova U1 Pro的发布,不仅丰富了商汤的多模态大模型产品矩阵,也为国产多模态大模型在全球竞争中赢得了更多话语权。

FAQ

问:SenseNova U1 Pro和SenseNova U1有什么区别?

SenseNova U1是商汤科技于2026年4月开源的基础模型,实现了理解与生成的原生统一。而SenseNova U1 Pro是商汤科技于2026年7月18日发布的旗舰版本,在U1的基础上进一步实现了理解、生成与行动的深度统一,定位为面向长程任务的“交付级”原生多模态智能体基座。简单来说,U1是“能理解能生成”,U1 Pro是“能理解、能生成、能行动、能交付”。

问:SenseNova U1 Pro的8K输出意味着什么?

SenseNova U1 Pro最高支持原生8K分辨率输出。这意味着它可以生成超高信息密度的超长、超大图,画幅放大后文字、线条、图标依然清晰稳定,经得起印刷和展览级的细节检验。作为对比,当前全球顶尖的多模态大模型如GPT-Image-2的原生直出分辨率上限为4K。

问:SenseNova U1 Pro什么时候可以正式使用?

SenseNova U1 Pro的预览版本已于2026年7月开启邀请测试。正式版本计划于2026年8月向公众开放,届时将公布定价并提供API服务。

问:SenseNova U1 Pro主要面向哪些应用场景?

SenseNova U1 Pro可广泛胜任信息图、演示文稿、宣传海报、科普图解、影视分镜、数字艺术等各类图像内容创作。它正在重塑办公、电商、教育等生产单元,并在商汤旗下的“小浣熊”及视频创作工具“Seko”中得到了深度验证。

问:SenseNova U1 Pro的“交付级”是什么意思?

“交付级”是指模型生成的内容可以直接用于商业交付,无需人工二次修改。商汤内部由200位专业设计师组成的评审团队对生成图片进行评判,只有当60%以上的图片达到“愿意直接交给客户”的标准时,才认定为“交付级”。

以上内容不代表本平台立场,仅供读者参考