蚂蚁灵波发布LingBot-VA 2.0:全球首个具身原生预训练VA模型

对于机器人来说,这句用来提醒年轻人的话同样适用:眼光得放长远些。
一个可靠的机器人系统,不能仅停留在“看到什么就做什么”的反应式操作层面,如今更需要学会预判未来——就像人类观察运动的物体时,眼睛捕捉当下画面的同时,大脑已经在盘算接下来几步的走向。
在具身智能领域,这类需要预判的视频-动作控制模型有一个专门的称呼:VA(Video-Action)模型。
就在近期,相关技术迎来了全新的突破:全球首个具身原生的预训练VA基座模型LingBot-VA 2.0正式发布,该模型从架构设计、训练数据到优化目标,从诞生之初就完全针对机器人场景量身打造。
除了原生具身的核心优势外,该模型还有几项亮眼的技术特性:
- 双臂长程操作任务成功率达93.6%
- 单GPU环境下可实现150Hz的推理频率
- 采用因果DiT架构搭配稀疏MoE主干网络
和此前的系列开源发布一样,LingBot-VA 2.0一经推出就引发了行业广泛讨论,有评论指出:机器人技术正在迈入预判式控制的全新时代。
不少人好奇,这种基于预判的控制能力,能否应对更复杂的真实场景任务?对此,研发团队开展了三组不同维度的实测,所有测试都证明,该模型可以通过对物理动态的预判,将动作规划建立在提前推演的基础上。
任务一:桌面整理
该任务的场景是一张摆放杂乱的桌面,机器人需要先识别桌面上的各类物品,规划移动路径和归置位置。LingBot-VA 2.0的高维规划模块会首先对任务进行拆解:比如由左臂负责将垃圾投放至指定位置,右臂整理笔、鼠标等文具,同时协调双臂动作避免空间冲突。
得益于视频预测分支自带的时序状态记忆能力,模型可以始终掌握桌面每一步操作后的最新状态,不会出现中途“断片”返工的情况。自研的语义视觉-动作分词器让视觉隐向量同时对齐语义和动作信息,确保长序列操作中对物体类别和目标位置的理解保持稳定。最终机器人顺利完成全桌面整理,证明该模型可以有效应对贴近真实生活的长程操作任务。
任务二:传送带抓取
该场景更贴近工厂、仓储的实际作业环境:目标物体在传送带上持续移动,机器人需要抓取的并非静止目标,而是处于运动状态的物体。这要求机器人的动作节奏必须和物体的运动节奏严丝合缝,稍有偏差就会导致抓取失败。
传统工业抓取方案依赖光电开关、编码器等外部传感器实现触发同步,而纯视觉方案则需要模型自主计算时间差。LingBot-VA 2.0会将物体的运动状态直接纳入动作决策,不仅识别物体当前的位置,还会预测抓取动作完成瞬间物体的所在位置,提前将动作执行的时间开销纳入规划。实测中,搭载该模型的机器人成功完成了传送带抓取任务,实现了动作和移动目标的精准同步。
任务三:轻抓薯片
相较于前两项任务,该挑战的重点在于精细操作的力度控制。薯片薄而脆,机器人需要精准控制夹爪和薯片的相对位置,实现细粒度的视觉伺服,同时避免用力过度捏碎薯片。这对模型保留局部视觉细节的能力提出了很高要求。
实测结果显示,搭载LingBot-VA 2.0的机器人顺利完成了薄片物体的抓取,兼顾了视觉判断的精度和动作力度的控制。
这三项任务分别考验了模型的长程状态记忆、连续运动时间对齐和精细操作能力,但本质上都围绕同一个核心:基于对物理世界演化的预测,提前完成动作规划。
接下来我们可以从四个核心维度拆解LingBot-VA 2.0的技术亮点:
1. 新一代语义视觉-动作VAE
传统的视频生成VAE仅以像素还原为目标,和语义、动作的关联度较低。而LingBot-VA 2.0采用自研的语义视觉-动作分词器,不再满足于单纯的像素还原,而是要求视觉隐向量同时对齐语义和动作信息。
具体实现上,团队让视觉分词器在完成像素重建的同时,将特征对齐到冻结的视觉基础模型,将语义信息融入隐向量;随后通过逆动力学和正向动力学模型,从连续两帧的隐向量中反推中间发生的动作,无需额外的动作标签就能从无标注的网络视频中学习到动作相关的监督信号。
2. 因果预训练架构
初代VA模型需要将双向注意力的视频生成模型改造为单向因果模型,再使用有限的机器人数据进行微调,这种改造路径存在明显风险:机器人数据本身较为稀缺,改造过程很容易丢失预训练阶段学到的通用先验知识。
LingBot-VA 2.0则选择了更彻底的方案:从训练伊始就采用因果架构从零开始构建模型,让模型天然遵循“只能查看过去、无法预知未来”的时间线进行学习,完美匹配闭环控制中“当下无法预知未来”的物理现实。这种因果next-latent预测目标,既可以利用海量网络视频进行自监督学习,又天然适配机器人闭环控制的时间结构,避免了改造带来的能力损耗。
3. 稀疏MoE主干网络
模型容量越大理论性能越强,但如果每次推理都加载全部参数,会严重拖慢机器人的反应速度。LingBot-VA 2.0为视频预测支路采用了稀疏MoE架构:在提升总参数量的同时,每次推理仅激活少量专家网络。
具体参数来看,视频主干总参数量约13B,推理时仅激活约1.9B;加上动作解码和辅助训练模块,整个模型的训练参数量约15.3B,但每个token推理时实际激活的参数仅约2.5B。经过一致性蒸馏、低精度编译、长程注意力优化和运行时开销削减,LingBot-VA 2.0的推理延迟从基线的965ms/chunk降至142ms/chunk,异步控制频率从33Hz提升到225Hz——每142ms就能输出包含32个动作的动作块,大幅提升了实时性,满足机器人闭环控制的需求。
4. 异步推理执行机制
如果模型和机器人采用串行工作模式,即模型计算完一步后机器人才执行,执行完成后再等待模型计算下一步,那么模型的计算延迟会直接转化为机器人的动作延迟,无法保证闭环控制的实时性。
为此,LingBot-VA 2.0设计了名为Foresight Reasoning的异步推理机制:在机器人执行当前动作片段的同时,模型并行预判下一步的场景,提前准备好后续动作。但提前预判存在脱离真实物理世界的风险,因此模型会在每次获取真实观测画面时,用最新的真实数据重新校准预测结果,形成“预测-执行-纠偏”的闭环机制,避免预测漂移。
上述技术改进带来了立竿见影的效果。在RoboTwin 2.0仿真基准测试中,LingBot-VA 2.0在干净场景、域随机化场景和平均准确率分别达到93.8%、93.4%、93.6%,相比初代模型的92.9%、91.6%、92.2%有显著提升,同时全面超过π0.5、Motus等基线模型。
消融实验也验证了自研分词器的有效性:在50个任务的简单/困难平均准确率上,使用自研分词器的模型分别达到86.6%和83.1%,明显高于使用通用WAN2.2 VAE方案的78.0%和76.0%。多步预测(MCP)辅助训练目标同样带来了显著的训练效率提升:在50fps的随机化设置下,使用MCP的模型训练5000步后准确率比未使用的版本高出29.7个百分点,仅需20000步就能达到未使用MCP的模型训练45000步的准确率,训练速度提升2.3倍。
整体来看,LingBot-VA 2.0成功将“更懂物理变化”“更高频闭环控制”“更少样本适配新任务”这三大核心优势整合到了同一套系统中。
那么,LingBot-VA 2.0的发布到底意味着什么?
这次技术升级正式开启了“具身原生”的时代,让具身智能模型从基于数字世界模型的能力嫁接,转向面向物理世界需求的原生设计。机器人模型的训练目标,正在从理解指令、输出动作,转向学会预测动作对世界的改变。
如果将LingBot-VA 2.0放在研发团队的系列技术布局中来看,其定位和整体规划会更加清晰。从LingBot-Depth 2.0解决空间感知问题,到LingBot-VLA 2.0解决即时动作执行问题,再到LingBot-Video补齐视频生成模型的推理效率短板,最后到LingBot-VA 2.0聚焦预测式控制,研发团队正在逐步构建完整的“机器人大脑2.0”体系,形成了从“看清世界”“理解物理规律”到“在真实世界连续行动”的完整技术链条。
对于整个具身智能行业来说,这是一个值得关注的重要变化:当机器人本体的硬件性能越来越成熟,行业接下来的竞争将不再仅仅局限于手部灵巧度、腿部稳定性等硬件指标,更关键的是,机器人的“大脑”是否从诞生之初就为物理世界的真实需求量身设计。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。


