AI短剧厂商集体转型 三家玩家押注世界模型

AI短剧的导演部业务正在集体收缩,行业玩家们正在转向全新的赛道,新的机会在哪里?
智象未来HiDream、生数科技Motus2、爱数科技PixVerse,这三家头部文生视频厂商,几乎同时亮出了全新的业务方向。
过去两年间,这类文生视频公司的核心业务几乎都是为客户提供AI短剧的全链路制作:从剧本撰写、分镜设计,到角色生成、口型对齐再到成片剪辑,打包交付的整套服务本质上就是一个"AI导演团队"。不管是短视频平台上的分钟级短剧、品牌方定制的宣传短片,还是小红书上的互动悬疑内容,背后都有大量这类厂商的参与。
而如今,这个曾经火爆的赛道正在悄悄降温,不是因为市场需求消失——短视频平台的AI短剧流量仍在持续增长,品牌方的投放预算也没有收缩,平台的分成政策依然在倾斜——而是因为这批从业者找到了天花板更高的新赛道:世界模型。
这三家从文生视频起家的企业,新的业务核心已经不再是"帮客户产出单条视频",而是"帮助用户运行一个完整的虚拟世界"。业务覆盖范围从单一的画面生成,延伸到状态推演、内容创作乃至决策支持,盈利模式也从按生成次数收费,转向售卖模拟能力的授权。
新的业务方向究竟长什么样?
把这三家的技术布局摊开来看,答案就清晰了。
三家同时亮牌,技术路径却截然不同
智象未来推出的HiDream-O1-Embodied,主打具身感知与抗扰动技术路线。该方案基于全模态底层模型,将图像、视频、3D数据与动作信息统一整合建模,核心解决的是真实场景下的稳定性问题:在实际环境中,光线变化、视角偏移、物体晃动、手部抖动都是常态,模型能否在这类干扰下保持可靠的输出?在国际机器人赛事RoboColiseum的扰动适应子赛事中,该方案拿下了第一名,其核心技术路径是通过多视角冗余设计——即便单个摄像头失效,其他设备仍可补位——结合生成式数据扩增技术,以动捕数据为基础,批量生成不同光线条件、材质属性与背景环境的训练样本,实现数据规模的百倍级扩展。
生数科技的Motus2则聚焦机器人操作赛道,没有选择搭建虚拟世界,而是直接基于真实物理交互场景进行研发。该系统的架构同时集成了三项核心功能:为操作者提供动作规划建议、提前预测执行动作后的画面变化、实时评估当前任务的推进进度。这三项功能共享同一套模型参数,训练数据来自约13万小时的第一视角操作视频,覆盖了从单目到双目视觉、从人类操作到机器人运动轨迹的全维度数据。根据公开的研究论文,在灵巧操作任务中,仅经过预训练的模型成功率从接近零提升至51%,加入中间训练与强化学习流程后,成功率进一步达到75%;在触觉相关的任务中,两项核心指标的成功率均提升至72.5%。
爱数科技的PixVerse R2则主打实时交互虚拟世界方向,其核心竞争力并非画面画质,而是"边生成、边控制"的动态交互能力。用户可以将其理解为一个动态生成的游戏引擎:并非通过预先编写的代码与固定素材搭建场景,而是通过大模型实时计算生成完整的虚拟世界。用户通过WASD按键控制角色移动,通过语音指令调整场景变化,插入音频后角色的口型与情绪也会同步匹配。该系统能够持续维护世界的状态更新,角色会记住自身身份、所在位置与手持物品,不会因为新一轮的内容生成而出现"失忆"式的状态丢失。
从更通俗的视角来看,这三家厂商都是将传统的视频生成技术向不同的垂直场景深度延伸:
智象未来通过多视角冗余设计对抗单路视觉遮挡,结合动捕数据实现光线、背景、物体形态的百倍级数据扩增,在RoboColiseum的78项仿真扰动任务中,其扰动适应子赛事得分达到0.692,位居行业第一;
生数科技将13万小时的单目、双目第一视角操作数据逐步迁移适配到机器人场景,同一套模型参数同时支撑动作生成、画面预测与任务进度判断,同时将操作失败与次优轨迹纳入训练数据,用于学习动力学模型与价值评估;
爱数科技则将大模型作为实时交互引擎,通过动态分块技术处理按键、语音、剧情等不同类型的时序信号,结合长程分层记忆与错误回收机制,有效减少角色动作、镜头调度与音画不同步的问题。
三家的核心业务可以用一句话概括:智象未来帮助机器人在复杂真实环境中稳定运行,生数科技让机器人自主规划操作动作,爱数科技则在虚拟世界中实现用户与场景的实时互动。
为什么文生视频公司做世界模型,天然有优势
文生视频厂商切入世界模型赛道,其实拥有天然的技术与业务优势。早期的文生视频产品大多起源于影视分镜、广告短片与短视频素材市场,商业模式以"按条、按分钟或按订阅次数售卖生成服务"为主。目前这类赛道已经跑出了多个实现稳定年度 recurring revenue 的案例,但整体仍处于平台化竞争的早期阶段:头部企业能够实现盈利,但新玩家的融资规模远低于大语言模型赛道,行业红利正在逐步消退。
在这样的背景下,视频厂商单纯比拼画质与生成时长的边际增长空间已经十分有限;转向世界模型赛道,相当于将原有的"单条视频产出能力"升级为"全状态推演能力",业务边界可以同时覆盖游戏交互、机器人训练、工业仿真等多个高价值领域。
其中具身智能方向被业内普遍认为拥有更高的行业天花板:机器人真实物理操作数据极度稀缺,而世界模型可以在虚拟环境中实现无限试错,再通过少量真机数据进行微调优化;而传统视频生成仅聚焦渲染效果,追求"视觉上的合理性",但具身智能所需的模拟器与规划器,还需要解决物理规则匹配与动作精度的核心问题。
根据行业专家的世界模型分类体系,文生视频模型大多被归为渲染器类,而具身智能、自动驾驶相关模型则更接近模拟器与规划器,二者并非替代关系,而是从像素识别到物理建模、从被动观察到主动执行的递进式技术路径。
对于视频厂商而言,布局世界模型并不意味着放弃短视频业务,而是为原有的时空建模能力找到了更广阔的变现渠道:短视频业务可以继续贡献短期收益,而世界模型则能够打开长期的增长天花板。
将三家厂商的技术路径放在一起分析,可以发现一个清晰的共性逻辑:视频生成模型在"视觉感知世界"的过程中,已经积累了远超传统机器人训练方法的视觉知识储备。
传统的机器人训练需要从零开始理解每一个物理交互场景,比如"杯子放在桌面上"需要拆解位置、姿态、遮挡关系、光线变化等数十个独立要素,每个要素都需要单独建模。但视频生成模型已经在互联网级别的海量视觉数据中学习过这些常识:它知道圆柱体的杯子放在平面上会保持稳定、受到碰撞会滑动、被手指抓住时表面会产生形变。
这些视觉常识并非通过显式编程写入模型,而是通过对海量视频数据的自主学习"感知"而来。这也是文生视频厂商切入世界模型的第一张核心底牌:视觉知识的复用。这类企业不需要从零开始训练模型理解三维空间,模型已经具备了基础的视觉认知能力,只需要将这种能力从"生成单帧画面"转向"推演全状态变化"。
第二张底牌是多模态控制能力。文生视频模型天生擅长处理文本、图像、音频的组合输入,现在只需要在此基础上增加动作信号、本体状态与触觉反馈,就可以将业务从"根据提示生成视频"升级为"按照用户指令运行完整虚拟世界"。智象未来的方案集成语言、多视角与动作信号,生数科技的Motus2整合语言、本体状态与触觉反馈,爱数科技的PixVerse支持WASD按键控制,都是这一技术思路的自然延伸。
第三张底牌是数据扩增能力。机器人领域长期面临的一个公开难题是高质量真实交互数据的稀缺性:据行业估算,全球范围内的高质量真实物理交互数据总量仅约50万小时,而通用具身智能模型需要千万小时级的训练数据,高端应用场景甚至需要亿小时级的数据集。视频生成模型恰好可以填补这一缺口:通过合成数据批量生成不同光线、背景与物体形态的训练样本。智象未来通过动捕数据结合生成式扩增实现了百倍级的数据扩展,生数科技则将人类第一视角操作数据迁移适配到机器人场景,都是这一逻辑的落地实践。
还有一个容易被忽视的前置优势:文生视频厂商在过去几年已经搭建完成大规模视频数据清洗、时空建模、算力调度与多模态对齐的底层技术管线,转向世界模型并非从零开始招募团队、采购算力,而是对原有技术能力的重新整合与升级。
因此无论是布局实时虚拟交互、机器人操作还是具身感知赛道,这类厂商都能够快速将原有的"视频生成能力"扩展为"接收指令、输出反馈、支持复盘"的完整系统,再逐步补充物理规则建模与数据回流机制。
但"看得到"和"摸得着"之间,隔着一条巨大的沟
尽管从技术路径来看,文生视频厂商转向世界模型的前景诱人,但必须明确一个核心差异:视频生成模型所理解的"物理规则",与真实物理世界的客观规律存在本质区别。
视频模型学习到的只是"视觉层面的合理性":画面中的杯子看起来放在桌面上、没有穿模问题、运动轨迹平滑自然,但这并不意味着模型真正理解了重力、摩擦力与碰撞力的物理本质。它无法分辨杯子是陶瓷材质还是泡沫材质,无法预判桌面上的水渍会导致杯子滑动,也无法计算出多大的抓握力度会导致杯子碎裂。
这类问题在虚拟交互场景中影响有限,只要游戏画面"看起来合理"就能满足用户需求,但一旦需要与真实物理世界进行交互,单纯的视觉合理性就远远不够了。
智象未来通过多视角冗余设计优化感知稳定性,生数科技通过触觉感知模块补充物理交互信息,爱数科技则聚焦虚拟实时交互场景——三家厂商都在通过各自的技术路径弥补这一短板,但目前公开的技术资料中,没有任何一家宣称已经解决了"用视觉模型替代专业物理引擎"的核心问题。
具体来看,当前世界模型赛道面临三个无法回避的工程挑战:
首先是长程运行的状态漂移问题。世界模型需要实现持续运行,而非仅生成30秒的短视频内容,但自回归模型天生存在错误累积的缺陷:前一秒的微小偏差,经过一段时间后可能演变为整个场景的逻辑崩塌。智象未来通过多视角冗余设计降低单路视觉失效的风险,生数科技对比了全局自回归与混合记忆机制的效果差异,爱数科技则通过分层记忆与错误回收机制缓解这一问题。这些方案都属于工程层面的优化补丁,并非根本性的解决方法。
其次是力觉与触觉的跨硬件迁移难题。生数科技的公开论文中多次提到,触觉手套在不同操作者、不同机器人平台上的信号存在差异,这是因为手套本身的形变会引入额外噪声。这意味着在一台机器人上训练完成的操作"手感",更换硬件平台后可能无法直接复用。视觉感知具备跨域迁移的能力,但力觉反馈却与硬件设备深度绑定。如果无法解决这一问题,操作类世界模型只能停留在"视觉上可理解"的层面,无法实现真正稳定的物理交互。
最后也是最关键的,是数据回流管线的搭建。世界模型并非一次性训练完成的产品,而是需要持续从真实使用场景中学习迭代。用户交互产生了哪些新的行为模式?机器人执行任务时在哪些环节出现了失败?失败后如何实现快速恢复?这些"部署后产生的真实数据"能否稳定回流到训练流程中,决定了模型的迭代效率。
目前三家厂商的公开资料仅展示了初始训练数据与技术方法,但关于"部署后如何实现持续数据回流"的完整方案,整个行业仍处于早期探索阶段。智象未来需要回收多视角标定与现场回放数据,生数科技需要收集真机操作失败数据与触觉轨迹信息,爱数科技则需要整理用户交互日志与状态冲突数据。
如果无法搭建起稳定的数据回流管线,世界模型就只能停留在"公开演示demo"的阶段,无法实现与真实世界同步进化的长期价值。
世界模型的竞争,拼的不是模型,是闭环
综合智象未来、生数科技与爱数科技的公开业务动作,可以清晰看到一个行业趋势:文生视频厂商的下一个发展方向,并非单纯提升视频画质,而是实现更深层次的场景嵌入——将技术能力融入游戏引擎、机器人操作系统与工业仿真平台。
这类厂商的转型具备天然优势:视觉知识储备、多模态控制能力与数据扩增技术,都是其在文生视频赛道中已经积累的核心能力。但真正的行业门槛并不在于模型本身的性能,而在于系统层面的落地能力:物理交互信号能否形成完整闭环、长程运行的状态能否实现显式校正、部署后产生的真实数据能否稳定回流至训练流程。
视频生成技术提供了场景入口与视觉知识,专业仿真器提供了力学规则与物理逻辑,机器人控制系统提供了动作执行与反馈机制,而数据管线则将这三者串联为完整的系统。未来3到5年内,世界模型赛道的产业形态大概率不会由单一企业通吃,而是由产业链上不同环节的企业协同完成。
只有能够将"演示阶段的世界模型"落地为"可审计、可回流、可规模化部署的产业系统"的玩家,才算真正跨过了世界模型赛道的核心门槛。
还有一个更长期的行业悬念:当世界模型技术真正实现规模化落地,这些起家于文生视频的厂商,大概率将转型为专业软件服务商,通过售卖模型能力、模拟次数授权与数据扩增服务实现盈利。
但世界模型要深度嵌入物理产业,仅靠软件技术是否足够?
从三家厂商已经迈出的技术布局来看,智象未来的具身版方案绑定了多视角相机硬件以提升抗扰动能力,生数科技的Motus2直接支持机器人动作输出与触觉反馈接收,爱数科技的实时世界系统虽然当前聚焦虚拟交互场景,但其底层架构已经开始处理动作信号与状态维持任务。
从算法到硬件的技术壁垒,其实仅隔着一层薄薄的窗户纸。
未来,这类厂商是否会从软件服务商转型为软硬一体化企业?是否会投资自研机器人本体、收购硬件研发团队,甚至亲自下场制造搭载自有世界模型的专用设备?
这个问题目前尚无明确答案。
但行业历史经验表明,凡是立志于"运行完整世界"的技术企业,最终往往都会走向"拥有核心硬件与场景"的发展路径。

