文章摘要
7月10日,蚂蚁灵波推出行业首个「具身原生」预训练大模型LingBot-VA 2.0,给机器人换上懂物理的大脑。它采用因果建模,有三大核心技术突破、四大技术支柱,推理效率提升6倍,单卡可部署,与VLA形成互补生态,开启具身智能「数据飞轮」。

今年北京亦庄的半马赛道上,一台人形机器人以50分26秒冲线夺冠,比人类世界纪录快了近7分钟,机器人的躯体第一次跑赢了全人类。但另一面的场景却让人担忧:成都商场里表演的机器人撞上围观老人致其送医,餐厅里失控狂舞的机器人甚至踢中了小孩——跑赢冠军的机械腿,配了一颗不知道下一秒会撞到谁的大脑。

机器人的大脑,什么时候才能跟上它的腿?7月10日,蚂蚁集团旗下具身智能公司蚂蚁灵波给出了答案:推出LingBot-VA 2.0,这是行业首个「具身原生」预训练大模型,要给机器人换上一颗真正懂物理的大脑。

什么是「具身原生」?

简单来说,这不是将现有数字世界的模型简单嫁接给机器人,而是从训练数据、目标函数到模型架构,每一层都为「机器人在物理世界完成任务」量身打造——从零开始,构建一颗专属于机器人生理的原生大脑。

这颗大脑能做什么?

从演示效果来看,这颗大脑的表现远超预期:它可以稳稳夹起一片薄薯片,既不会捏碎也不会滑落,要知道没有触觉反馈的情况下,精准控制夹持力度本身就是极大的挑战;它还能完整整理桌面,记住每件物品的位置,按顺序码放整齐,而不是盲目抓挠;更可以和人实时对战小球,预判球的轨迹、即时挥杆反击,反应速度丝毫不输人类玩家。

LingBot-VA 2.0发布后迅速引发海外科技社区热议,大V Shabnam Parveen评价其是「迈向真正具身化AI的重要一步」,不少网友也对其「具身原生」的设计思路给出了高度认可。

为什么要从零开始训练?

当前主流的AI模型路线大多基于「下一帧预测」,学习的是画面的相关性变化,这类模型适合生成视频内容,但无法支撑机器人的真实物理交互。比如用类似生成视频的模型生成一段「推杯子」的内容,杯子可能流畅滑动,但也可能出现穿模、凭空消失的问题。如果机器人用这类模型指导行动,会误以为手可以穿过物体,杯子可以无故复原,完全不符合物理规则。

而LingBot-VA 2.0采用的是因果建模路线:模型学习的不是「画面会如何变化」,而是「我的动作会让世界产生怎样的改变」。推动物体时,它会遵循惯性运动规律;抓取动作和物体状态的变化严格对应,这是机器人从被动反应转向自主决策的核心基础。

三大核心技术突破

首先,模型解决了机器人长期存在的「翻译鸿沟」问题:视觉感知和动作控制原本是两套独立的系统,彼此间的信息转换存在壁垒。LingBot-VA 2.0配备了语义视觉-动作分词器,将视觉画面和动作指令统一翻译成同一种表达语言,让模型既能理解场景,也能精准控制动作。这意味着模型可以直接从互联网上的普通视频中学习动作逻辑,不需要依赖昂贵的真机采集数据,先通过海量网络视频建立物理直觉,再用少量真机数据完成对齐即可。

其次,模型采用了Foresight Reasoning前瞻推理技术,打破了传统机器人「看一眼、做一次、再修正」的滞后模式。就像经验丰富的老司机,在过弯的同时已经在预判下一个路口的路况,提前在脑中推演后续变化,实际执行时一边根据实时观测调整动作,一边持续预判未来几秒的场景,永远贴合现实节奏。配合异步推理架构,视觉感知、逻辑思考和动作执行三件事并行推进,不会因为等待思考而错过抓取时机。

「想完才动」和「边想边动」,本质上是两种完全不同的机器人智能水平。

四大技术支柱支撑「具身原生」

LingBot-VA 2.0的技术底座由四大核心模块构成:

  • 全自主从头预训练:没有基于现有视频生成模型或大模型微调,而是基于自回归视频模型从零开始训练,避免了将双向注意力架构改为因果架构时出现的「灾难性遗忘」,完整保留了从海量数据中学到的物理世界知识。
  • MoE稀疏架构:沿用LingBot-Video验证过的混合专家架构,视频骨干总参数约130亿,但推理时每个token仅激活约19亿参数,按需激活专家模块大幅降低了高频推理的成本。经过四重加速优化后,单chunk推理从927毫秒降到142毫秒,异步控制频率从35Hz飙升到225Hz。
  • 新一代语义VAE:传统VAE仅负责画面的压缩还原,无法关联语义和动作。LingBot-VA 2.0的分词器在压缩视觉数据的同时,将视觉潜表示对齐到预训练视觉基础模型的语义空间,让模型不仅能「看见」物体,更能「理解」物体的属性和用途,补上了「听懂指令但动作匹配失误」的老短板。
  • 异步Foresight推理:也就是前文提到的边执行边思考架构,将预测延迟隐藏在动作执行的过程中,让机器人可以在动态场景中保持流畅的响应速度。

效率拉满,单卡即可部署

机器人的实时性要求极高,哪怕慢一拍都可能错过抓取时机。LingBot-VA 2.0将推理效率做到了极致,单次推理效率提升6倍以上,单卡即可稳定运行,这让它可以胜任传送带上的连续抓取任务。

在RoboTwin 2.0仿真基准测试中,LingBot-VA 2.0的平均成功率达到93.6%,优于同类模型的79.8%,也超过了前代LingBot-VA的92.2%。更值得关注的是,模型在干净环境和随机化环境的表现差距仅为0.4个百分点,说明它可以很好地适配光照变化、杂物干扰、高度扰动等真实世界的复杂场景。

VA与VLA:1+1>2的互补生态

需要明确的是,LingBot-VA 2.0并非要取代VLA(视觉语言动作模型),而是形成互补的生态。VLA基于多模态大模型发展而来,成熟度高、落地性强,当前全球大部分「进厂干活」的机器人都基于VLA技术。

LingBot-VLA 2.0已经用同一套权重适配了20种以上的机器人构型,横跨17个主流品牌,预训练数据量达到6万小时,在主流消费级显卡上推理仅需130毫秒。团队采用的是「投产一代,预研一代」的路线:一线落地的VLA沉淀的数据和场景反馈,会持续反哺VA技术的迭代升级。

本次发布的六大模型共同构成了全栈智能大脑:从传感器原生空间智能模块,到原生架构的视频动作模型,再到产业落地驱动的落地版模型,完整覆盖了具身智能的全技术栈。从另一个角度来说,本次发布的LingBot 2.0,才是真正意义上的初代成熟产品。

大脑的竞争,才刚刚开始

当前行业已经用脚投票认可了这条技术路线:LingBot-VLA 2.0已经和十余家厂商的多款机器人构型完成适配验证,物流分拣、零售分拣、工业上下料等真实场景已经稳步落地试点。

相比商业化落地,更重要的价值是开启了具身智能的「数据飞轮」。回顾大语言模型的崛起早期,选择躺平微调的玩家最终没能走到行业前沿,真正的赢家都是直面预训练、探索模型上限的团队。具身原生预训练的意义正在于此:机器人大脑第一次拥有了属于自己的基础模型。

当下机器人硬件的喧嚣正在退潮,真正的竞争才刚刚在机器人大脑的赛道上拉开序幕。


塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/

AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

以上内容不代表本平台立场,仅供读者参考