文章摘要
2026年6月,商汤科技披露下一代旗舰多模态基座模型SenseNova - U1Pro,对标GPT - Image - 2,以“交付级”设计为核心赛道。它升级NEO - unify架构,实现“理解·生成·行动”一体,支持8K分辨率。展示的预览图凸显其“交付级”实力。该模型预计7月测试,有望商业化,但也面临挑战,或推动AI设计赛道变革。

2026年6月,商汤科技披露下一代旗舰多模态基座模型SenseNova - U1Pro,对标GPT - Image - 2,以“交付级”设计为核心赛道。它升级NEO - unify架构,实现“理解·生成·行动”一体,支持8K分辨率。展示的预览图凸显其“交付级”实力。该模型预计7月测试,有望商业化,但也面临挑战,或推动AI设计赛道变革。

商汤新模型SenseNova-U1Pro

一、商汤新模型SenseNova-U1Pro:AI设计赛道的重磅入局者

2026年6月,商汤科技在年度股东大会上首次对外披露其下一代旗舰多模态基座模型——商汤新模型SenseNova-U1Pro。这款定位为业界首个以“理解·生成·行动”原生统一为内核的多模态智能体基座,明确将OpenAI旗下的GPT-Image-2作为对标对象,并将“交付级”设计作为核心应用赛道。商汤新模型SenseNova-U1Pro率先支持原生8K分辨率输出,而GPT-Image-2等当前全球领先的生成模型原生直出分辨率上限仅为4K。这一分辨率上的代际差距,标志着中国AI企业正以硬核技术实力切入全球顶级多模态模型的竞争腹地。

二、技术架构:NEO-unify原生统一架构的全面升级

2.1 从SenseNova U1到U1 Pro的技术演进

要理解商汤新模型SenseNova-U1Pro的技术底蕴,需要回溯其前身——2026年4月28日商汤全面开源的SenseNova U1系列模型。SenseNova U1基于商汤自主研发的NEO-unify架构,在单一模型架构上统一了多模态理解、推理与生成,能够将语言与视觉信息作为统一的复合体直接建模,实现信息高效协同。

NEO-unify架构的核心突破在于:它彻底摒弃了主流的拼接式设计,去除了视觉编码器(VE)和变分自编码器(VAE),重新构建了统一的表征空间,并深入融入每一层计算中,从而实现从模态集成向原生统一的范式跨越。凭借这一架构优势,SenseNova U1在业内率先实现了连续性的图文创作输出——只需单次单模型调用,就能输出高质量作品。SenseNova U1-8B-MoT作为该系列的轻量高效版本,理解端8B参数、总权重约18B,以较小规格达到了开源模型的SOTA水平。

商汤新模型SenseNova-U1Pro正是在这一技术基座上的旗舰级升级。如果说SenseNova U1证明了“理解与生成统一”这一技术路线的可行性,那么U1 Pro则是在此基础上将能力推向商用级、交付级的新高度。

2.2 “理解·生成·行动”三位一体的内核设计

商汤新模型SenseNova-U1Pro最核心的技术特征,是其在同一内核内打通了多模态理解、生成与行动三个维度。传统图像生成模型往往将理解与生成分离——一个模块负责“看懂”提示词,另一个模块负责“画出”图像。而U1 Pro将这两者融于一体,基于内在的图文交错思维能力,面对复杂需求时像一个“会思考的设计师”一样,实现设计、生成、评审的长程循环。

这一“三位一体”的设计哲学,在生成城市规划图的场景中体现得尤为充分:模型会先对整个城市布局进行智能评估,尝试部署不同的规划与生成策略,在内部评估生成效果并不断自主调整,最终输出可以直接交付的“成品级”结果。正如商汤联合创始人、首席科学家林达华所言:“思考、理解和创作在一个大脑里面统一,就像编剧和导演融为一体。”

2.3 原生8K分辨率:对GPT-Image-2的降维打击

在分辨率这一硬指标上,商汤新模型SenseNova-U1Pro实现了对GPT-Image-2的显著超越。据公开信息,GPT-Image-2等当前全球领先的生成模型原生直出分辨率上限为4K,而U1 Pro率先支持原生8K分辨率输出,可以直接满足商用交付需求。

8K分辨率(约7680×4320像素)意味着单张图像的信息量是4K的四倍。对于商业设计、出版印刷、影视制作等对画质有严苛要求的专业场景,这一差距意味着质的飞跃。以电影分镜为例:基于同一段提示词,商汤新模型SenseNova-U1Pro可以输出16000×24000+像素、含40至60格的导演级分镜稿,每格附景别、机位与情绪标注;而GPT-Image-2仅输出1024×1536像素,放大后存在细节失真。分辨率上百倍的差距,对专业创作场景的影响是决定性的。

三、核心能力:五组预览图揭示的“交付级”实力

在2026年股东大会上,商汤展示了五组由商汤新模型SenseNova-U1Pro生成的预览图,覆盖从传统文化图鉴到专业影视创作的多类高难度场景。尤为值得注意的是,此次股东大会使用的全套20余页演示PPT,也是由U1 Pro一次性生成——模型自主进行了规划、思考、制作、评估的全过程,“保证信息传达的逻辑、每个数字的准确、每个页面的美观,所有东西都浑然一体”。这是商汤首次在正式对外公告中全程采用日日新大模型完成制作。

3.1 知识信息图:信息密度的碾压

在同一国画风“二十四节气”提示词下,商汤新模型SenseNova-U1Pro完整呈现全部24个节气、逐一标注日期与序号、四季分区清晰;而GPT-Image-2生成内容相对缺失。这一对比直观揭示了U1 Pro在信息图生成领域的能力优势——不仅“画得好看”,更要“信息准确、完整”。

3.2 国画长卷:连续性创作的能力验证

同一主题切换为横版长卷形式后,商汤新模型SenseNova-U1Pro一句提示词直出,24个节气完整有序,每格配以独立国画插图与气候描述,顺时而生、四季有序。这验证了U1 Pro在长篇幅、连续性图文创作中的稳定性——这正是其前身SenseNova U1就已奠定的技术优势的延续与放大。

3.3 杂志跨页:复杂版式的商业级还原

商汤新模型SenseNova-U1Pro以一句提示词生成GQ风格“007·阿斯顿·马丁DB5座驾档案”横版跨页,涵盖车辆详细规格参数表、多角度实拍图集、车主历史时间轴、电影片场注记等,版式还原度达到商业出版可用水准。如此包含了复杂多栏混排与长文本段落控制的出版与品牌设计场景,是目前图像生成模型最难实现的能力维度之一。

3.4 学术海报:高密度信息的精准呈现

在学术海报生成任务中,商汤新模型SenseNova-U1Pro一键输出的论文海报信息密度极高,包含架构图、基准表格与可识别二维码;而GPT-Image-2版本留白偏多、密度偏低。这一对比表明,U1 Pro在处理需要高信息承载量的专业场景时具有明显优势。

3.5 电影分镜:专业创作场景的代际差距

基于同一段深夜暗巷追逐戏的提示词,商汤新模型SenseNova-U1Pro可以输出16000×24000+像素、含40至60格的导演级分镜稿,每格附景别、机位与情绪标注。而GPT-Image-2仅输出1024×1536,分镜形式简单,情绪表现力偏弱。林达华对此表示:“思考、理解和创作在一个大脑里面统一,就像编剧和导演融为一体。”

四、对标GPT-Image-2:一场精心策划的技术正面战

4.1 GPT-Image-2:OpenAI的图像生成新王

2026年4月21日,OpenAI正式推出ChatGPT Images 2.0,将GPT-Image-2定位为推理驱动图像生成与编辑的重大进展。这是OpenAI继DALL·E系列之后的全新一代原生图像生成模型,强调极致的写实表现和精细的指令跟随能力。GPT-Image-2是OpenAI首个具备“思考能力”的图像模型,内置了网络搜索和自我检查功能。该模型上线数小时内便在LMSYS Chatbot Arena文生图排行榜以碾压级分差拿下全榜第一。在设计行业,GPT-Image-2在文生图质量、文字渲染和指令遵循上大幅领先谷歌旗下的Nano Banana 2,引发了广泛追捧。

4.2 为什么是“设计”赛道?

商汤新模型SenseNova-U1Pro将“交付级”设计作为核心应用方向,这一战略选择背后有着深刻的产业逻辑。

从竞争格局看,Anthropic、智谱等顶尖AI企业在编程领域已展开激烈角逐。而“设计”正在成为顶级多模态模型的下一个主要赛场——业内普遍预测,OpenAI近期也将发布聚焦“设计”方向的新一代AI生图模型。商汤选择在这一时间节点推出U1 Pro,实质上是在OpenAI尚未完全占据的设计赛道上提前卡位。

从技术可行性看,商汤新模型SenseNova-U1Pro基于NEO-unify架构的“理解-生成”统一能力,天然适合设计场景。设计本身就是一个“理解需求→构思方案→生成输出→评审迭代”的循环过程,与U1 Pro“设计—生成—评审”的长程循环高度契合。

从商业价值看,“交付级”设计意味着U1 Pro的输出可以直接用于商业出版、品牌物料、影视制作等付费场景,而非仅仅停留在“好看但不可用”的娱乐层面。这正是GPT-Image-2等模型尚未完全攻克的领域。

4.3 横向对比:SenseNova-U1 Pro vs GPT-Image-2

对比维度 SenseNova-U1 Pro GPT-Image-2
发布时间 预计2026年7月启动邀请测试 2026年4月21日正式发布
核心定位 “理解·生成·行动”原生统一的多模态智能体基座 推理驱动的图像生成与编辑模型
原生分辨率 8K(率先支持) 4K(上限)
知识信息图 24节气完整呈现,逐一标注 内容相对缺失
学术海报 信息密度极高,含架构图、表格、二维码 留白偏多、密度偏低
电影分镜 16000×24000+像素,40-60格,附专业标注 1024×1536,分镜简单
技术架构 NEO-unify原生统一架构 推理驱动,LLM主导语义规划
核心团队 商汤联合创始人林达华牵头 加州大学戴维斯校友Gabriel Goh领导
应用场景 交付级设计、出版、影视分镜、品牌设计 广告设计、论文海报等生产力场景

数据来源:综合自IT之家、雷锋网、科创板日报等公开报道

五、行业影响:AI设计赛道的新格局

5.1 从“娱乐”到“生产力”的范式转移

商汤新模型SenseNova-U1Pro的曝光释放了一个明确信号:多模态大模型的竞争焦点正加速从“单纯娱乐”向“专业生产力工具”转移。过去几年,AI图像生成主要停留在社交媒体分享、个人创作等非商用场景。而U1 Pro瞄准的“交付级”设计——杂志跨页、学术海报、电影分镜——全部指向了真实的商业应用场景。

这一转变意味着AI图像生成技术的价值评估标准正在发生根本变化:不再只看“画得像不像”“美不美”,更要看“能不能直接用”“信息准不准”“分辨率够不够”。商汤新模型SenseNova-U1Pro在信息密度、版式还原、分辨率等维度的突破,恰恰回应了这一新的价值标准。

5.2 对中国AI产业的意义

商汤新模型SenseNova-U1Pro是中国AI企业在全球顶级多模态模型竞争中一次具有标志意义的正面对垒。长期以来,在图像生成这一核心赛道,OpenAI、Google等美国科技巨头占据着技术制高点。U1 Pro不仅在对标GPT-Image-2时展现出部分维度的优势(尤其是分辨率),更在“交付级”设计这一细分方向上提前布局。

商汤将U1 Pro定位为“业界首个以’理解·生成·行动’原生统一为内核的多模态智能体基座”——这一表述本身就暗含了技术路线上的差异化竞争。OpenAI的GPT-Image-2走的是“推理驱动”路线,而商汤走的是“原生统一”路线。两条技术路径孰优孰劣尚需时间检验,但至少证明中国AI企业有能力在底层技术架构层面参与全球竞争。

5.3 对设计行业的深远影响

商汤新模型SenseNova-U1Pro的“交付级”设计能力,将对设计行业的工作流程产生深远影响。杂志跨页、学术海报、电影分镜等原本需要专业设计师团队数天完成的工作,现在可能在一句提示词、数十秒内生成初稿。这并不意味着设计师将被取代——恰恰相反,AI将成为设计师的“超级助手”,将设计师从重复性的排版、制图工作中解放出来,专注于创意构思和策略把控。

正如林达华所言,“思考、理解和创作在一个大脑里面统一”——这一理念同样适用于人机协作:人类设计师负责“思考”与“理解”(需求、品牌、用户),AI负责“创作”(生成、迭代、输出)。商汤新模型SenseNova-U1Pro正在让这一协作模式成为现实。

六、未来展望与挑战

6.1 7月邀请测试的市场期待

商汤新模型SenseNova-U1Pro预计将于2026年7月正式启动邀请测试。这将是外界首次有机会实际体验U1 Pro的“交付级”设计能力。市场普遍关注以下几个核心问题:U1 Pro在实际使用中能否复现演示案例中的效果?其对标GPT-Image-2的承诺能否在第三方评测中得到验证?8K原生分辨率在实际工作流中能带来多大的效率提升?这些问题的答案将在7月的测试中逐步揭晓。

6.2 商业化路径的探索

商汤透露,U1 Pro有望成为商汤大模型商业化加速的下一阶段增长动力。在此之前,商汤已通过SenseNova 6.7 Flash-Lite轻量化模型实现了Token消耗成本直降60%的突破,并将日日新系列模型的核心能力封装为SenseNova-Skills,涵盖信息图生成、PPT创作、数据分析及深度调研等高频办公场景。U1 Pro作为旗舰级模型,其商业化路径可能采取“高端订阅+企业私有化部署”的双轨模式,直接面向设计机构、出版集团、影视公司等B端客户。

6.3 面临的挑战

商汤新模型SenseNova-U1Pro在走向市场的过程中仍需应对多重挑战。首先,GPT-Image-2已在LMSYS Chatbot Arena等权威评测中建立了显著的领先优势,U1 Pro需要在真实场景中证明自己的实力。其次,“交付级”设计对模型的稳定性、一致性和可靠性提出了极高要求——商业出版容不得半点差错。最后,8K分辨率带来的计算成本如何控制,将直接影响U1 Pro的商业可行性和市场接受度。

常见问题(FAQ)

Q1:SenseNova-U1 Pro是什么?

SenseNova-U1 Pro是商汤科技正在研发的下一代旗舰多模态基座模型,定位为业界首个以“理解·生成·行动”原生统一为内核的多模态智能体基座,预计将于2026年7月启动邀请测试。

Q2:SenseNova-U1 Pro对标的是哪个模型?

商汤明确将OpenAI的GPT-Image-2作为对标对象。GPT-Image-2是OpenAI于2026年4月推出的推理驱动图像生成模型,在LMSYS Chatbot Arena文生图排行榜上位居前列。

Q3:SenseNova-U1 Pro的分辨率是多少?

SenseNova-U1 Pro率先支持原生8K分辨率输出,而GPT-Image-2等当前全球领先的生成模型原生直出分辨率上限为4K。

Q4:SenseNova-U1 Pro主要应用于什么场景?

商汤将“交付级”设计作为SenseNova-U1 Pro的核心应用赛道,覆盖知识信息图、国画长卷、杂志跨页、学术海报、电影分镜等专业设计场景。

Q5:SenseNova-U1 Pro什么时候可以测试?

SenseNova-U1 Pro预计将于2026年7月正式启动邀请测试。

Q6:SenseNova-U1 Pro和之前开源的SenseNova U1有什么关系?

SenseNova U1是商汤于2026年4月开源的轻量高效原生统一多模态模型,基于NEO-unify架构。SenseNova-U1 Pro是在此技术基座上的旗舰级升级,将能力推向了商用级、交付级的新高度。

Q7:NEO-unify架构是什么?

NEO-unify是商汤自主研发的原生统一架构,摒弃了传统的拼接式设计,去除了视觉编码器(VE)和变分自编码器(VAE),重新构建统一的表征空间,实现从模态集成向原生统一的范式跨越。

Q8:SenseNova-U1 Pro能用于商业用途吗?

SenseNova-U1 Pro主打“交付级”设计能力,其输出可以直接用于商业出版、品牌设计、影视制作等专业场景。

Q9:SenseNova-U1 Pro由谁主导研发?

SenseNova-U1 Pro由商汤科技联合创始人、首席科学家林达华牵头负责。

Q10:SenseNova-U1 Pro对设计行业有什么影响?

SenseNova-U1 Pro的“交付级”设计能力有望将设计师从重复性的排版、制图工作中解放出来,让AI成为设计师的“超级助手”,加速设计行业从“手工制作”向“人机协作”的范式转变。

以上内容不代表本平台立场,仅供读者参考