文章摘要
商汤联合创始人、首席科学家林达华在行业专访中表示,原生多模态并非伪需求,是人工智能进入真实行业与物理世界的核心基础。商汤坚持该技术路线,已推出多款相关模型与产品,目前商汤实现盈利可为长期研发提供支撑,他预测1-2年内多模态将跨过商业化落地关键节点,称商业化核心是解决问题而非单纯比拼参数规模。

当代码智能体已经跑出清晰的商业化路径时,多模态人工智能的下一个认知跃迁点正在被行业反复讨论。商汤联合创始人、首席科学家林达华在近期的行业专访中,分享了其团队对原生多模态技术路线的长期思考,以及商汤在该领域的落地进展。

林达华用一个比喻阐述了团队的核心立场:“没有电脑的年代,也有爱因斯坦和牛顿。我们不会因为他们不写代码,就认为他们不够聪明。”他用这句话解释了为什么商汤始终将原生多模态作为长期技术方向,而非将其视为语言模型的附属组件。

当前代码智能体已经较早跑通商业闭环,公开数据显示,截至7月底,某头部AI公司的年化收入已超过650亿美元,约为两年前的7倍。但林达华强调,AI和通用人工智能的空间远远不止代码开发,多模态融合才是进入真实行业和物理世界的基础。

对于多模态的定位,行业内存在不同观点,比如有从业者认为多模态最终只是一个类似搜索的功能组件,而非提升智能上限的核心方向。林达华表示,这种选择源于不同企业的任务、资源和长期愿景差异,并无绝对对错:“DeepSeek希望把语言和代码能力做到业内前列,同时优化模型架构,这种选择非常合理。但商汤面对的场景不同,办公、医疗、零售、机器人和世界模型,都不可能缺少视觉信号。”

商汤的技术路线围绕原生多模态和空间智能展开,其模型矩阵包括负责长程任务规划、多智能体协作的SenseNova 6.8系列,聚焦视觉理解、生成、编辑并延伸至视频和三维领域的U系列原生理解生成统一模型。在应用层,Seko是AI短片创作智能体,串联故事、分镜和视频生成;小浣熊则是面向办公和数据分析的AI办公智能体。

今年4月,商汤发布并开源了日日新SenseNova U1原生理解生成统一模型。与常见的视觉语言模型不同,U1拿掉了独立视觉编码器和变分自编码器,在一套自回归架构中联合处理语言、视觉语义和像素生成。近四个月后,商汤又推出U1.5 Lite,将这套架构的能力从理解和生成扩展到连续编辑,同时加强了高分辨率生成和复杂指令控制能力。

根据商汤最新发布的2026年中期业绩,公司上半年营收29.1亿元,同比增长23.4%;其中生成式AI收入23.3亿元,占比接近八成。在AI业务增长的带动下,商汤首次实现国际财务报告准则下盈利,这也为多模态领域的长期技术投入提供了更充足的空间。

多模态的核心:长程思考而非代码能力

在专访中,林达华明确表示,代码能力强是智能水平提升的结果,但智能的核心本质并非代码开发这种工作形态,而是汇聚复杂信息,进行长程思考、推演、执行和修正。

对于“长程智能进入现实世界是否需要原生多模态”的问题,林达华认为,如果模型仅用于代码开发,多模态未必是必要条件,但一旦任务拓展到更广泛的行业和真实物理场景,视觉能力就不可或缺。他举例说,即使是前端开发,模型写完代码后也需要渲染页面,检查视觉效果是否符合要求,这同样需要视觉能力。

代码是目前数据条件最成熟的体现长程思考能力的载体,GitHub上有大量过程数据,代码可以运行、测试用例能提供确定反馈,背后还有成熟的软件工程市场,因此它最早跑通了训练和商业闭环。但人工智能不会只停留在代码领域,多模态的落地场景要广阔得多。

谈及原生多模态模型的训练难度和成本,林达华表示,若只是在语言模型上接入视觉编码器,推理端额外增加的计算量相对于百亿甚至万亿参数的语言主干而言微不足道,真正的难点在于训练阶段。首先是数据配比问题,加入视觉数据的同时需要避免原有语言、数学和推理能力退化,也就是所谓的对齐代价,这需要大量对照实验,且每次模型升级都可能需要重新调整配比。其次是强化学习环节,引入新模态后训练目标和技术方案会变得更复杂,而为视觉相关任务建立反馈信号本身也是尚未完全解决的开放问题。

“对模型公司来说,问题未必是付不起算力成本,而是多做一轮实验,模型就可能比竞争对手慢一个月。”林达华透露,商汤选择先用8B参数的轻量模型进行迭代,先把架构、数据配比和训练方案跑稳,再扩大模型规模,这样反而能获得更高的研发效率。

从生图到智能体生成:不止于“抽卡”

U1和U1.5目前的核心能力集中在图像生成领域,但这套不依赖传统视觉编码器的统一架构,带来了和专用模型不同的用户体验。林达华解释,最直接的变化是模型会先理解内容,再决定如何生成,面对复杂信息时,它会先判断哪些内容重要,再安排结构、版式和视觉表达,这也是团队先从信息图场景切入的原因。

U系列的长期目标是空间智能和物理智能,但团队最初选择先专注于生图场景,因为每增加一种新能力都会大幅提升训练复杂度。先让U1跑通理解和生成的统一路径,建立语言和视觉元素在同一表征空间融合的技术认知,再逐步拓展到更复杂的空间智能,这样既能阶段性交付用户可感知的成果,也符合上市公司的业务节奏。

U1.5重点提升了文字生成、审美和连续编辑能力,改变了过去类似“抽卡”的生图流程。林达华介绍,U1推出后,团队发现文字生成和局部细节还有提升空间,经过连续迭代优化后,文字准确性得到解决,但又发现即使文字全部正确,生成的画面也可能缺乏设计感,因此团队邀请专业设计师参与,补充了模型的审美能力。

“文字准确、画面好看,解决的仍然只是单次生成质量。”林达华表示,真实的设计工作不会只生成一次就完成,完整的构图和修改需求可能多达数千字,模型需要理解这些约束,同时只修改指定区域,尽量保留其他正确内容。持续编辑能力让用户可以保留已经完成的正确部分,针对性修改问题区域,这正是智能体式生成的核心,围绕同一份作品持续迭代直到交付。

针对用户的不同需求,商汤推出了两款定位不同的产品:U1.5 Lite是8B参数的开源模型,更注重效率和性价比,适合大量日常任务;U1 Pro则追求能力上限,成本更高,但目标是交付专业级效果,这就像轻便相机和专业单反的区别,不同用户可以根据需求选择。

在真实工作流中,企业既可以用通用大模型包办所有任务,也可以让智能体调度多个专业模型。林达华认为,模型首先需要具备完整的基础能力,再走向术业有专攻,这里存在一个不可能三角:能力广度、专业深度和成本。一个又广又深的超级模型虽然可行,但必然体量庞大、成本高昂,现实中更合理的选择是让不同专业的模型组成团队,每个模型都具备健全的基本智能。

以商汤的产品矩阵为例,SenseNova 6.8更像“管理者”,负责长程任务和多个专业智能体的协作,同时需要具备“视觉感知能力”来理解图像并决策下一步行动;而U系列则像视觉领域的专业人士,将精细视觉感知、可控生成和空间智能做到较高水平,两者各司其职,共同完成复杂任务。

对于AI视频创作平台Seko,林达华表示,其核心价值在于交付完整的视频创作流程,而非要求所有环节都由商汤自己的模型完成。最终的视频渲染可以调用专用模型,而故事构思、分镜生成以及后续的效果调整和迭代闭环,才是体现智能水平的关键,也是商汤重点掌握的部分。商汤更关注的是让模型理解创作意图,判断需要调整的部分,将理解、生成和修改连接成完整的闭环,这也是Seko和单一视频生成模型的核心区别。

空间智能:还在等待自己的GPT时刻

在资源有限的情况下,商汤选择聚焦的核心标准是两个关系:语言智能能否影响视觉想象和生成,以及视觉生成和想象能否反过来影响推理。生图、视频和三维虽然方向不同,但底层都围绕这两个关系展开,因此商汤不会在所有指标上都追求极致,比如不会将电影级画质作为视频业务的核心竞争点,人像生成也会持续优化,但不会成为最核心的方向。

选择信息图作为生图场景的突破口,是因为它需要真正的智能来判断如何在有限画面中有效组织和传达信息;在办公场景中,团队则重点关注数据分析和预测,这类任务对智能水平的要求很高,可以牵引智能上限的提升。

谈及空间智能的泛化进展,林达华表示,当前特定场景下的视觉语言动作模型或世界动作模型已经可以做得很专业,但换一个场景,模型往往就失去了基本的判断能力。真正的通用智能时刻,需要同时做到广度和深度:广度是能在众多场景中实现理解,深度是能够持续完成长程思考和行动,空间能力还需要和复杂逻辑结合,否则任务进行到一半就出现逻辑断裂,依然难以实现商业化。

“如果要看到具备一定泛化能力的空间智能系统,我觉得还需要1到2年的时间。模型的能力会逐步提升,不会在某一天突然完成切换。”林达华说。

对于空间智能的数据瓶颈,林达华认为,至少从公开视频和第一人称视频的总量来看,数据并不稀缺,生态伙伴也在持续采集第一人称数据。真正的问题在于这些数据没有被充分利用,比如当前大家主要用视频训练生成模型,学习画面的外观和帧变化,但没有充分利用视频提升智能——比如电影中人物看到某件事后露出惊恐表情,模型不仅要看到这个表情,还要理解背后的原因以及和正在发生的事件的关联,这才是真正的理解。

因此,空间智能的发展需要两方面推进:一方面继续采集适合的视频数据,另一方面围绕视频提出正确的问题、建立事件之间的关联,后者正是当前尚未规模化解决的环节。

对于U1.5的连续编辑思路如何延伸到视频和三维领域,林达华表示,从空间智能的目标来看,三维的优先级甚至高于视频,因为空间智能的本质是理解三维世界并在其中行动和交互。连续编辑和反馈循环的基本原理是相通的,但进入视频和三维领域后,数据形态更复杂,也会遇到新的技术问题。商汤下一代U系列模型会加入更多空间智能元素,对三维空间的建模和理解会进一步加强,不会只是将静态图片简单延长为视频。

商业化的本质:解决问题而非卷参数

当代码智能体已经带来明确的收入和估值反馈时,多模态的回报周期看起来更长,商汤如何平衡长期路线和阶段性成果?林达华表示,商汤并非不做代码能力,只是没有将复杂软件工程作为主要方向,团队始终坚定认准长期愿景,并将资源投入到关键优先事项上。

市场最终会验证路线的商业价值,商汤需要通过小浣熊等产品的用户增长、复购和付费,证明多模态在商业上的可行性,而非仅仅发布更大参数的模型。团队内部也曾讨论过是否要推出万亿参数的模型,但最终结论是,要基于技术规律稳步推进,在合适的时机推出更大参数的模型,但一定是基于革新性的架构和技术,而非简单扩大规模进行同质化竞争。

“我们不希望为了尽快做大模型规模,延缓对真正问题的探索。当前大模型竞争异常激烈,模型公司的认知是否领先、迭代速度是否足够快,是决定成败的关键。对我们而言,参数大小只是具体的技术选择,更重要的是在认定的方向上走得足够快,让自身的认知保持领先。”林达华说。

具体到参数规模的选择,取决于技术路径的成熟度。对于前沿探索,如果技术路径尚未充分验证,过早采用超大参数规模反而会拖慢迭代速度;当路径逐渐成熟后,再通过扩大模型规模探索能力上限。目前商汤的多模态智能体模型已经进入扩大规模的阶段,但理解与生成统一的架构和训练范式,仍有一系列问题需要探索。

在被问及设计和空间智能的“拐点”分别是什么时,林达华表示,代码智能体的爆发并非因为能力突然提升了几个数量级,而是能力积累到一定阶段后,大家开始觉得它真正好用了。设计领域的拐点已经不远,随着模型可控性和视觉质量的不断提升,下一步将进入真实工作流,比如直接生成可在专业设计工具中继续使用的内容,从“好看”到“好用”的转变可以通过优化数据和产品功能实现,这个过程可能按月计算。

而空间和视觉推理的拐点则会来得更晚,影响也会更深。“没有具备空间智能的大脑,机器人只能在固定场景中完成固定动作,很难在复杂物理空间中独立完成长程任务。”

当前生图和视频的调用价格持续下降,但专业客户更看重最终交付的质量。对于多模态是否会陷入价格战的问题,林达华认为,如果所有企业都处于同一能力水平,用户自然会选择更便宜的模型,但如果仅围绕Token数量竞争,利润会被大幅压缩,模型最终会像水电煤一样成为基础资源。

“人工智能会成为水电煤,但水电煤不是这个时代最赚钱的行业。真正有价值的部分,是你最终为用户解决了什么问题。”林达华举例,律师不会按判决书的字数收费,医生也不会按病历字数收费,用户愿意为解决问题的结果付费,智能服务也不应只按Token计量,未来的收费模式可能会按任务、按最终交付结果收费,甚至由AI和客户共同完成工作后按结果分成,用户并不关心模型消耗了多少Token,只关心事情是否做成。

当被问及代码智能体率先跑出商业回报后,部分多模态方向的研究者出现的方向焦虑时,林达华表示能够理解,代码领域的热潮推高了相关人才的价格,从业者难免受到影响,但不同方向的商业化进程本就有先后之分。2022年以前,自然语言处理也没有如今的商业价值,当时做智能客服需要大量定制,不少从业者选择转向计算机视觉,因为人脸识别等场景已经实现了规模化商用,如今只是代码领域先走到了商业前景明确的位置。

“这就像买股票,现在代码是涨得最快的一只,但不代表每个人都要把所有资金甚至人生都押在上面。人工智能改变的不会只有代码领域,每个人都应该根据自己的积累和判断,选择真正相信的方向。”林达华提醒,选择多模态领域也不能重复过去的路线,传统视觉语言模型的基本范式已经走到尽头,如果今天的多模态研究还停留在视觉问答这类简单任务上,无论技术价值还是商业价值都十分有限。

当被问及是否会鼓励更多公司投入原生多模态领域时,林达华表示,大家应该对多模态的长期前景保持信心,很多行业对视觉能力的需求是刚性的,多模态并非伪需求,但一定要找准方向,不能继续停留在简单的视觉问答层面。至于选择代码还是多模态方向,并没有天然的优劣之分,重要的是根据自身积累和判断,选择真正相信的赛道,而非盲目跟风。

最后,在被问及未来一两年多模态是否会迎来类似代码智能体爆发的关键节点时,林达华表示,现阶段代码智能体的意义已经超越了代码本身,它让行业看到人工智能真的能够落地创造商业价值,这给整个行业带来了巨大信心。他认为未来1到2年,多模态也会跨过类似的节点,最终形态未必只是生图或视频工具,但内核仍然是视觉、语言、推理和行动的结合,随着数据和应用的不断成熟,多模态会迎来能力涌现的时刻,商汤也希望能率先走到这一步。

以上内容不代表本平台立场,仅供读者参考