文章摘要
原深耕AI视频、AI短剧业务的智象未来、生数科技、爱诗科技三家企业,近期同时官宣转型世界模型赛道,三家采取差异化技术路线。该转型具备多重天然优势,但仍面临物理认知偏差、数据闭环不完善等挑战,行业竞争核心在于系统闭环能力,未来发展仍存悬念。

过去两年间,当被问及AI视频服务商的核心业务时,多数答案都会指向AI短剧全链路服务:从剧本创作、分镜设计、角色生成、口型对齐到成片剪辑,整套外包流程的本质就是“AI导演部门”。抖音上的几分钟短剧、品牌定制短视频、小红书上的互动剧情,背后都有这类团队的身影。

但到了2026年,这类“导演部门”却纷纷停止接单,不是因为市场需求萎缩——抖音AI短剧的流量还在增长,品牌方的投放仍在增加,平台的流量扶持也没停止——而是这批从业者找到了更广阔的赛道:世界模型。

智象未来、生数科技、爱诗科技,这三家起家于AI视频生成的企业,近期同时公布了全新的业务方向。不再是“帮你剪出一条片子”,而是“帮你运行一个世界”,从生成画面到推演状态,从内容工具到决策引擎,从售卖生成次数到售卖模拟能力。

三家的差异化技术路径

智象未来推出的HiDream-O1-Embodied,走的是“具身感知与抗扰动”路线。基于全模态基座,它将图像、视频、3D模型、动作数据统一建模,核心解决的问题是:真实环境中光线变化、视角偏移、物体遮挡、手部晃动时,模型能否稳定运行。该产品在RoboColiseum的抗扰动适配任务中拿下第一,技术方案采用多视角冗余(一个摄像头失效后其他摄像头可以补位)和生成式数据扩增(以动捕数据为基础,批量生成不同光线、材质、背景的训练样本)。

生数科技的Motus2,则聚焦“机器人操作”方向。它不做虚拟世界,直接面向真实物理操作开发。其架构同时运行三项功能:输出动作建议、预测执行动作后的画面变化、评估当前任务的进展程度。这三项功能共享同一套模型参数,基于约13万小时的第一视角操作视频训练,覆盖从单眼到双眼、从人类操作到机器人轨迹的全量数据。根据公开资料,在灵巧操作任务中,预训练后成功率从接近0提升至51%,加入中间训练和强化学习后成功率达到75%;在两项触觉相关任务中,成功率提升至72.5%。

爱诗科技的PixVerse R2,主打“实时交互虚拟世界”路线。它的核心卖点并非画面质量,而是“边生成、边控制”。可以将其理解为一个游戏引擎,但并非通过代码和素材搭建,而是由模型实时演算生成。用户按下WASD按键即可控制角色移动,说出指令就能触发场景变化,插入一段音频就能让角色口型和情绪同步调整。它会维持一个持续更新的世界状态——角色会记住自己的身份、位置和手中的物品,不会因为下一帧的生成而“失忆”。

用一句话概括三家的新方向:智象未来让机器人在杂乱的真实环境中不再慌乱,生数科技让机器人自主规划动作,爱诗科技让用户在虚拟世界中实现实时互动。

AI视频企业转型世界模型的天然优势

早期AI视频产品大多从影视分镜、广告短片、短视频素材起步,商业模式接近“按条/按分钟/按订阅售卖生成次数”。这类需求已经跑出了可盈利的案例,但整体仍处于平台化竞争的早期:头部企业已经实现盈利,新玩家的融资规模比语言模型低一个数量级,市场红利正在消退。

在此背景下,视频厂商继续卷画质、卷时长的想象空间有限;转向世界模型,相当于把“出片能力”升级为“状态推演能力”,同时还能覆盖游戏交互、机器人训练、工业仿真等多个领域。其中具身智能方向的上限被普遍看好:真实的机器人操作数据极度稀缺,世界模型可以在虚拟环境中无限试错,再用少量真机数据微调;而单纯的视频生成只是渲染工具,优化的是“看起来正确”,具身智能的模拟器/规划器还要解决“物理正确、动作正确”的问题。

根据相关团队对世界模型的分类,AI视频大多归为渲染器,具身智能/自动驾驶更接近模拟器和规划器,二者并非替代关系,而是从像素到物理、从观察到执行的递进关系。

对视频厂商来说,转向世界模型未必意味着放弃短视频业务,而是为原有时空能力找到了更大的出口:短视频业务可以继续存在,世界模型则指向长期的增长空间。

将三家企业放在一起观察,可以发现一条共性逻辑:视频生成模型在“观察世界”这件事上,已经积累了远超传统方法的视觉经验。

传统机器人训练需要从零开始理解“杯子放在桌子上”的含义——位置、姿态、碰撞关系、光线变化,每一个细节都需要单独建模。但视频模型已经在互联网级别的视觉数据中学过这些常识:它知道杯子是圆柱体,放在桌面上会保持稳定,被碰撞后会滑动,被手抓住时手指会产生形变。

这些知识并非被显式写入,而是从海量视频数据中“看”出来的。

这就是AI视频厂商切入世界模型的第一张底牌:视觉经验的复用。他们不需要从零开始教模型理解三维空间,模型已经具备相关能力,只需要将这种理解从“生成画面”转向“推演状态”。

第二张底牌是多模态控制能力。AI视频模型天生擅长处理文本、图像、音频的组合输入,现在只需要再加入动作信号、本体状态、触觉反馈,就能从“按提示生成片子”升级为“按指令运行世界”。智象未来接入语言、多视角和动作信号,生数科技接入语言、本体和触觉数据,爱诗科技支持WASD控制,都是这套思路的自然延伸。

第三张底牌是数据扩增能力。机器人领域有一个公开难题:高质量的真实交互数据极度稀缺。据行业估算,全球高质量物理交互数据仅有约50万小时,通用具身智能需要千万小时级别的数据,高阶目标甚至需要亿小时级别的数据。视频生成模型恰好可以填补这个缺口:通过合成数据批量生成不同光线、不同背景、不同物体形态的训练样本。智象未来用动捕+生成扩增实现了百倍级的数据扩展,生数科技则将人类第一视角数据迁移到机器人场景,都是这套逻辑的实践。

还有一个容易被忽略的前提:AI视频厂商在过去几年已经搭建了大规模视频清洗、时空建模、算力调度和多模态对齐的底层管线,转向世界模型并非从零开始“招兵买马”,而是对原有能力的重新组合。

因此无论是做实时虚拟交互、机器人操作还是具身感知,他们都能快速将“出片能力”扩展为“接收指令、给出反馈、支持回滚”的能力,再逐步补充物理知识和数据回流流程。

“看起来正确”和“摸得到正确”之间的巨大鸿沟

到这里,整件事听起来十分美好,但必须澄清一个核心差异:视频生成模型理解的“物理”,和真实物理世界有着本质区别。

视频模型学到的是“视觉上的合理性”——画面里的杯子看起来放在桌子上,没有穿模,运动轨迹平滑。但这并不等于它真正理解了重力、摩擦力、碰撞力。它不知道杯子是陶瓷还是泡沫,不知道桌面上的水渍会让杯子滑动,不知道多大的抓握力度会让杯子碎裂。

这个问题在虚拟世界中影响不大——游戏画面“看起来正确”就足够了。但一旦要与真实物理世界交互,“看起来正确”就远远不够。

三家企业都在用各自的方式弥补这个短板:智象未来通过多视角冗余解决问题,生数科技补充了触觉感知,爱诗科技目前更偏向虚拟交互。但公开资料中,没有任何一家宣称已经解决了“用视觉模型替代物理引擎”的核心问题。

具体来说,有三个工程层面的挑战是所有从业者都无法回避的:

第一,长期运行的状态漂移。世界模型需要持续运行,而非生成30秒视频就结束。但自回归模型存在天然缺陷:错误会不断累积。前一秒的微小偏差,十秒后可能导致整个场景崩溃。智象未来用多视角冗余降低单一路径失效的风险,生数科技对比了全局自回归和混合记忆的效果差异,爱诗科技则用分层记忆和错误回收机制缓解这个问题。这些都只是工程补丁,并非根本解决方案。

第二,力觉和触觉的跨硬件迁移。生数科技的公开资料中多次提到,触觉手套在不同人手、不同机器人手上的信号存在差异,因为手套本身的形变会产生噪声。这意味着在一台机器人上训练好的“手感”,换到另一台机器人上可能就不再适用。视觉可以跨域迁移,但力觉数据牢牢绑定在硬件上。这个问题不解决,操作类世界模型就只能停留在“看得懂”的层面,无法做到“抓得稳”。

第三,也是最关键的一点:数据回流管线。世界模型并非训练一次就结束的产品,它需要持续从真实使用场景中学习。用户交互产生了哪些新行为?机器人执行任务时哪里出现了失败?失败后该如何恢复?这些“部署后数据”能否稳定回流到训练流程中?目前三家企业的公开资料仅展示了训练数据和方法,但“部署后如何持续回流数据”这件事,整个行业都还处于早期阶段。智象未来需要回收多视角标注和现场回放数据,生数科技需要回收真机失败和触觉轨迹数据,爱诗科技则需要回收用户交互日志和状态冲突数据。

没有这条数据回流管线,世界模型就只能是“演示demo里的世界模型”,而非“能跟随真实世界一起进化的世界模型”。

世界模型的竞争,拼的不是模型,而是闭环

将智象未来、生数科技、爱诗科技的公开动作放在一起观察,可以看到一个清晰的趋势:AI视频领域的下一站不是“更好的画质”,而是“更深的嵌入”——嵌入游戏引擎、嵌入机器人系统、嵌入工业仿真场景。

这个转型拥有天然优势:视觉经验、多模态控制、数据扩增能力,都是视频生成厂商已经具备的能力。但真正的门槛并不在模型侧,而在系统侧:物理交互信号能否形成闭环、长期状态是否有显式校正、部署数据能否稳定回流。

视频生成提供的是接口和经验,仿真器提供的是力学和规则,机器人控制提供的是执行和反馈,数据管线将三者串联起来。未来3到5年,世界模型的产业形态大概率不会是单家通吃,而是这条链条上不同环节的协作。谁能把“demo里的世界模型”做成“可审计、可回流、可部署的产业系统”,谁才能真正跨过世界模型的门槛。

还有一个更长远的悬念留在这里:当世界模型真正跨过门槛,这些起家于AI视频的企业,大概率会成为软件服务商——售卖模型能力、售卖模拟次数、售卖数据扩增服务。但世界模型要深度嵌入物理产业,仅靠软件足够吗?

看看他们已经迈出的脚步:智象未来的具身版本绑定了多视角相机硬件来实现抗扰动,生数科技直接让模型输出机器人动作并接入触觉感知,爱诗科技的实时世界虽然目前偏向虚拟交互,但底层架构已经在处理动作信号和状态维持。

从算法到硬件,中间只隔着一层窗户纸。

未来,他们会不会从软件服务商变成软硬一体的企业?会不会投资机器人本体、收购硬件团队,甚至亲自下场制造搭载自己世界模型的机器?这个问题目前还没有标准答案。

但历史告诉我们,凡是想要“运行世界”的玩家,最终都会忍不住想要“拥有世界”。

以上内容不代表本平台立场,仅供读者参考