文章摘要
内部代号为MVP(直译为“做个人吧”)的具身智能机器人流出多支无剪辑演示视频后爆火,引发全网及业内广泛关注,被从业者认为是具身智能的“ChatGPT时刻”。该模型实现多项核心技术突破,表现远超现有主流模型,团队后续计划在开放真实街道开展公开演示。

最近具身智能领域出现了一组引发全网讨论的演示视频,一段10分钟的一镜到底内容刚流出就被网友惊呼“像天外来物”,甚至有人猜测是不是AI生成的。不少行业从业者都在打听背后的团队,甚至有头部企业专门开会研究相关技术,相关咨询几乎刷爆了后台。

不少从业者认为,这或许是具身智能的ChatGPT时刻,是行业的重要里程碑,其创新的架构展现出三个核心突破:机器人具备真正的认知能力而非概率预测、能理解人类行为逻辑而非简单拟合训练数据、拥有持续自主进化的潜力,还有大量令人惊艳的临场表现。

当然,由于机器人的表现过于科幻,也有声音质疑是不是远程操控实现的,不过团队回应称,在狭小的演示空间里几乎无法完成远程操作。为了打消疑虑,团队又陆续放出了多个新的演示Demo,依然是无剪辑的一镜到底,仿佛在直白地宣告:智能时代的浪潮,已经到来。

通过相关报道,我们得以和这个神秘团队取得联系,询问他们为何不直接公开认领项目,团队的回答很有意思:模型就像人,应该让它自己说话。

这个神秘模型的内部代号是MVP,全称是Make Veritable People,直译过来就是“做个人吧”。从这次放出的Demo来看,搭载这个模型的机器人确实已经“活”了起来,能够像人类一样自主思考、做出决策,动作流畅自然且逻辑自洽。团队还透露,接下来他们将让机器人进入开放的真实街道环境进行演示,直接面向公众展示真实表现。

比如端水应对干扰的场景:当机器人左手端着水杯时,有人用木棍戳它的胳膊,它能立刻侧身避让,随后平稳回到原位,全程水杯里的水没有洒出一滴;如果同时还有人推倒了旁边的易拉罐,它甚至能在左臂还未恢复姿态时,用右手及时扶住即将倾倒的易拉罐,整套动作行云流水,像太极宗师一样精准化解力道又拿捏住分寸。很多人都表示,这种双手同时处理两个突发任务的能力,甚至超越了不少普通人。

当前主流的VLA和WAM模型存在明显短板,面对遮挡、物理接触、形变这类需要推理的场景时很容易失效,因为它们只是模仿动作表象,并没有真正理解背后的物理规律。而“做个人吧”模型为机器人装上了“物理大脑”,通过统一的动力学预测和长期状态管理,让机器人的动作轨迹天然符合物理可行性。从动作流畅度和反应速度来看,机器人不再是靠拟合数据“猜”出动作,而是像人类一样通过理解物理规则学习技能,这和“照葫芦画瓢”的模仿式模型有着本质区别。

第二个演示视频中,人形机器人完成了全套家务整理工作。团队表示,这是机器人在零样本学习(zero-shot)的情况下独立完成的,其零样本成功率已经达到了80%,如果属实,这种泛化能力堪称突破性进展。我们可以称之为“强迫症机器人的客厅整理”:机器人先将手中的小玩偶放回玄关置物台,遵循“物归原位”的逻辑;接着拖来装满杂物的收纳篮,微微下蹲后依次拿出黑色帽子和紫色健身环,稳稳挂到衣帽架上;最后拿出一个大尺寸花朵坐垫,明明可以弯腰摆放,却选择随手扔到沙发上,动作虽然不算麻利,但全程都透着一种“尽在掌握”的从容。

这个过程里,机器人对空间和物体属性的理解已经和人类高度相似:知道光滑地板上可以拖拽物品、环状物体可以悬挂、平整坐垫会自然展开,甚至还会“偷懒”——能直接放置就绝不额外弯腰,完美契合了“懒人驱动科技进步”的梗。主流模型目前还难以达到这种泛化能力:VLA靠大规模数据硬堆,遇到陌生场景就容易出错;WAM则像拼接积木一样固定动作流程,稍微调整场景就无法适配。而搭载“做个人吧”模型的机器人则能将物理空间认知、物体属性理解和人类行为习惯融为一体,稳定完成长程任务。

还有一段演示里出现了两台不同型号的机器人,它们的训练数据全部来自人类行为视频,实现了“一脑多形”的跨本体协作。两台机器人分别拉住刚从烘干机取出的床单的对角,较矮的机器人跨步弯腰将床单扯平,较高的机器人随后轻轻抖动床单,整个流程和人类晾晒床单的逻辑完全一致。虽然机器人的动作姿态还有些生硬,但行为逻辑已经非常贴近人类日常操作。

主流模型的另一个致命缺陷是无法真正自主进化,VLA只能做小幅调整,无法从根本上改变决策逻辑;WAM则过于僵化,无法适配新环境。而MVP模型则将物理世界认知和人类行为逻辑完美统一。

还有一段1分钟的收纳视频,机器人展现出了更贴近人类的自主决策思维:它懂得一次性携带更多物品来减少往返次数,比单次搬运更省力。它先抽出黑色围巾搭在脖子上,又拎起紫色圆环绕在小臂上,还会调整位置让圆环滑到肘关节处,把自己变成了移动衣架;接着又收纳了拖鞋和耳机,短短一分钟就整理了四件物品,不仅展现了长程任务处理能力,还能精准理解每个物品的属性,并匹配自身的操作能力。

反观主流模型,在同类任务中往往只会单件搬运,因为它们本质上是基于统计拟合的猜测,缺乏对世界的真正理解和自主意图。如果主流模型看到这个机器人的操作,恐怕都会疑惑:“怎么不多带点?一次搞定不是更省劲吗?”“做个人吧”模型的机器人做决策时,不需要刻意思考下一步动作,而是像水往低处流一样顺着能量最优的方向自然推进,思考、探索和行动一气呵成,这或许才是真正拥有自主意图、理解世界的智能。

看完这四个Demo,终于明白“做个人吧”这个名字的由来——机器人的每一个动作都像人类的决策过程,在长程任务、干扰环境和跨本体协作中,持续学习进化,真正理解物理世界、人类行为逻辑和自身能力边界。它不仅能像人类一样理解空间和物体属性,家务操作的思维和习惯都和人类高度相似,还能自主驱动、持续进化。

除此之外,这款机器人还展现出三个核心特质:

  • 动作一致性:就像成熟的人类一样,逻辑自洽、动作流畅、理解物理规则且手眼协调
  • 思考持续性:不会半途而废,且随着任务推进表现越来越稳定,长时序任务环环相扣
  • 独特个性:搭载模型的机器人仿佛有自己的做事风格,展现出类似人类的性格特点

种种表现都让人相信,具身智能真正落地为人所用的时刻已经不远了,智能的涌现或许已经在我们看不见的地方悄然发生。你对这些Demo有什么看法?欢迎在评论区留言互动,一起推动技术团队公开更多细节。

以上内容不代表本平台立场,仅供读者参考