梅卡曼德具身智能“眼脑手”:通用能力支撑27000+套规模化部署

今年的世界人工智能大会现场,AI相关的热度如同上海盛夏的气温一样持续走高,展馆里的机器人也成了绝对的焦点。去年的展会上,机器人就已经能完成书法创作、舞龙击鼓、调酒按摩等多种任务,从货架取货、拆快递叠衣服更是不在话下;而到了今年,它们又解锁了更多新玩法:组队演奏乐队曲目、变魔术表演,两台机器人还能在擂台上进行综合格斗,在迷你球场上争夺赛事奖杯。现场的仿生人脸机器人可以眨眼微笑、转头对话,甚至能让观众和“复刻版”的历史人物打照面。
逛完整场展会能发现,不同的机器人正沿着各自的赛道加速进化:有的不断挑战奔跑、跳跃、格斗等高难度动作,拉高本体性能的上限;有的通过拟人外形、情绪反馈和长期互动能力,探索进入家庭的可能性;还有更多机器人走向产线、仓库和商超,接受真实生产环境下速度、精度、稳定性和连续作业能力的检验。今年的展会也出现了一个明显的变化:观众和从业者不再只关注机器人的外形,而是更关心它们到底能解决什么实际问题——消费级机器人要足够有趣让人愿意带回家,工业级机器人则要足够实用,能在复杂环境里稳定高效地完成任务。
梅卡曼德的展台就是这场展会的缩影,现场的机器人忙得热火朝天。展台一侧,人形机器人接到观众的订单后,会自主走向货架,在摆满饮料、零食和玩偶的货架中找到目标商品,再伸进有限的空间稳稳取出;另一边,两台人形机器人协同完成工件上下料、装配和料筐搬运等工业任务;再往里走的展区则还原了真实工业场景:机械臂能从杂乱堆叠的五角螺母筐里快速选中目标,单件抓取时间不到2.4秒;塑料包装、柔性线束插头和透明瓶体等多样物料,都在考验机器人的感知和操作能力;还有一张台面上散落着数百种日常物品,等待人形机器人完成识别和分类。
作为这套体系里负责执行操作的“手”,梅卡曼德新一代多指灵巧手也在本次展会首次公开亮相。官方数据显示,这款灵巧手的动作寿命超过百万次,兼顾灵活性、响应速度和工业级耐用性,可以完成复杂物体操作和精密装配任务。从理解任务到完成动作,系统还会根据执行结果持续调整,形成“感知—决策—规划—执行—反馈”的完整闭环。
这些现场演示,其实正在回应具身智能行业当下最关心的两个核心问题:一是当机器人更换本体形态、处理不同物体或是进入全新场景时,原有能力还能保留多少;二是当机器人真正走进工厂、仓库和商超后,能不能做到足够快、足够准,并持续拓展到更多行业和地区。
先别被机器人的外形吸引走注意力
人形机器人依然是展会的人气选手,类人的身体结构让它们更容易适配按照人类尺度设计的环境,比如靠近现有货架、工作台和工具,观众也能快速理解它们的伸手、转身、搬运等动作逻辑。但实际上,具身智能的本体形态远不止人形机器人,还包括工业机械臂、双臂轮式机器人、半身人形机器人等多种类型,不同的形态对应不同的工作空间、负载要求和效率标准,很难用一种身体包办所有任务。
工业生产线更看重速度、精度和长时间稳定运行的能力;物流场景需要机器人具备足够的移动范围和负载能力;商超货架空间有限,商品软硬不一,又对环境感知和精细操作提出了更高要求。机器人的形态,其实是根据具体应用场景量身定制的。
梅卡曼德提出了“智能大于形态”的理念,将关注点落到了机器人真正干活时调用的底层能力上。无论采用哪种本体结构,机器人在工作时都需要完成几件核心步骤:看清环境和物体、理解任务指令、判断下一步动作、规划移动和操作路径,最后驱动机械臂、夹具或灵巧手完成实际操作。
在展台上,无论是双人形机器人协同作业、货架取货,还是高速小零件上料,虽然本体形态和目标物体各不相同,但都调用了环境感知、任务理解、动作规划与执行控制等底层能力。这就是梅卡曼德提出的“一脑多形”:机器人的身体可以根据场景变化调整,而以通用具身大脑为核心的“眼脑手”体系,则通过标准化组件适配不同的机器人本体,让同一套智能能力可以适配多种形态的机器人。
换了身体还不够,换个场景也不能从头开始
适配不同的机器人本体只是第一步,当机器人真正进入物理世界后,还要面对源源不断的变化:物品可能更换包装和材质,摆放姿态没有固定规律;货架深度和隔层结构各不相同;任务指令也可能临时增加新的条件和分类规则。
在海量物体分拣单元中,数百种食品、日用品、文具、玩具和工具被随机摆放。人形机器人首先要从海量真实物体中识别出不同物品、理解它们的类别,再按照自然语言指令完成分类;当盒子标签临时更新后,还要能快速理解新的分类规则并继续完成分拣任务。这里考验的不只是能否理解一条分类指令,更是能否泛化识别海量真实物体,并把自然语言、物体类别和场景标签转化为可执行的分拣策略。
机器人面对的变化还包括一些更难感知的物体。在透明物体泛化抓取单元里,目标换成了透明瓶体、半透明包装等物品。玻璃和透明塑料在商超、医疗、实验室和日常生活中十分常见,但透明材质容易给视觉成像和目标定位带来困难。通过透明物体AI成像与泛化抓取算法,机器人可以识别高度透明的物体,判断其位置和姿态,并生成合适的抓取方案,适用对象包括盐水袋、透明试管、喷雾瓶和水瓶等形状、包装和透明程度各不相同的物品。
货架取货单元则加入了空间结构的变化。观众完成下单后,人形机器人Mech-Movix会自主移动至货架前。现场模拟了真实商超环境,货架和货柜类型多样,商品的摆放方式也不固定,涵盖饮料、零食和玩偶等不同品类。机器人首先需要理解订单,确认需要拿取的商品;到达货架后,通过3D视觉感知货架结构、商品位置和周围空间;具身大脑进一步规划取货路径与操作方式,再由灵巧手伸入有限的货架空间,完成精细操作和稳定拿取。一袋柔软的零食、一个玩偶和一瓶饮料,对手部姿态和抓取方式的要求各不相同;当货架隔层、商品朝向和周围障碍发生变化时,机器人的操作路径也要随之调整。
这三个演示单元分别从海量物体识别、复杂材质抓取和空间场景适配三个维度,把任务、物体和环境的变化摆在机器人面前。它们共同指向具身智能中的泛化能力:当更换一个物体、调整一种摆放方式或是改变一句指令时,机器人已有的能力还能不能继续生效。机器人进入新现场时,需要重新开发的部分越少,通用能力就越有机会转化为实际部署效率。
从会做到能用,还隔着工业硬指标
展台上的机器人演示总能引来一圈观众围观,但当它们进入工厂后,围观的人少了,严格的生产节拍表却会一直盯着它们。在高速小零件无序上料单元中,一筐五角螺母尺寸小、姿态随机,彼此堆叠遮挡。机器人需要从杂乱料筐中识别每一个零件,判断哪些目标适合当前抓取,再自主规划抓取姿态和运动路径。选定目标后,系统还要控制机械臂准确到达抓取位置,稳定取出零件并放到指定位置,整个流程包括视觉感知、目标选择、抓取规划、运动执行和放置,单件时间小于2.4秒。
现场演示用的是五角螺母,但实际应用中还会涉及螺栓、螺钉、金属圆环等不同工业零件。当工件尺寸、形状和堆叠状态发生变化时,机器人仍要在高节拍下持续稳定工作。梅卡曼德表示,这类应用已经在汽车零部件、工程机械、家电和新能源等行业批量部署。
另一处演示单元则针对多规格超薄钣金件,这类工件极薄、结构精密,系统既要完成精准定位和稳定抓取,还要针对不同规格调整操作方式,在满足效率要求的同时,实现亚毫米级的装配精度。
线束插头柔性抓取与精密装配单元则考验的是另一套技术难点。线束属于柔性物料,在料框中的形态不固定,被机器人抓起后还会继续下垂、弯曲和变形;而插头插接又要求机器人准确对位,并严格控制接触过程中的力度。如果位置出现偏差,插头可能无法顺利插入;如果施力过大,还可能损伤元器件。演示过程中,机器人需要完成线束抓取、插头对位和柔顺插接,高精度视觉持续提供位置数据,自适应运动控制则处理线束形变、对位偏差和接触力度等细微变化,最终实现亚毫米级的精准柔顺插接。相比单次抓取,这是一段更长的自动化闭环,前一步的执行结果会直接影响后一步,机器人需要在任务进行过程中持续感知和调整,直到完成插接。
据梅卡曼德透露,这套高精度柔性装配方案已在汽车电子、3C电子、半导体和家电等精密制造行业实现批量复制与规模化应用。开放场景和工业现场给出了两张不同的考卷:商超等开放环境中,商品、货架和指令持续变化,机器人需要处理物体泛化、空间适应和任务理解;工业现场则把这些能力放进明确的硬指标中,要求系统达到生产所需的速度、精度、稳定性和连续运行能力。两类场景共同检验“眼脑手”体系能否形成完整、可用的能力闭环。展台上的演示也因此有了两种观看视角:既可以看机器人会不会做,也可以看它能否在工业指标和环境变化中持续稳定完成任务。
27000+ 套产品,标准化要经过多少种现场检验
展台上的一次演示大多在几分钟内完成,但机器人进入真实工厂后,要面对的是以月和年计算的连续运行。工件批次、环境光、物料姿态、生产节奏和工艺流程都会发生变化,现场还会不断出现实验室中难以穷举的长尾问题。
梅卡曼德披露,其具身智能“眼脑手”相关产品已经在全球累计落地超过27000套,服务超过100家《财富》500强客户,覆盖汽车制造、物流快递、新能源锂电、3C、半导体、钢铁、工程机械和医药等数十个行业。公司还在美国、日本、韩国和德国等地设有子公司和团队,产品持续进入不同国家和地区的产业现场。
进入不同国家和地区,系统接受的检验不只是来自算法层面。不同市场的产品认证、生产工艺、设备接口、交付流程和服务要求各不相同。梅卡曼德的产品已进入近50个国家和地区,并在慕尼黑、东京、芝加哥、首尔等地建设本地团队,覆盖销售、交付、培训和售后服务全流程。对于标准化产品而言,全球化意味着同一套底层技术架构要在更多产业体系中接受认证、交付、运行和服务能力的综合检验:它既要能够完成工作任务,也要能够合规交付、快速部署并被长期维护。
当部署规模扩大后,现场遇到的问题也会迅速变多。汽车零部件可能存在金属反光、无序堆叠和规格变化;物流现场需要处理不同尺寸、材质和包装的物品;精密装配关注位置误差、接触力度和工艺节拍;重工业环境还可能伴随粉尘、高温等复杂条件。一套标准产品要在这些条件下反复接受检验,哪些能力可以直接跨客户、跨行业复用,哪些环节可以通过配置完成适配,哪些长尾问题还需要继续优化,都会在部署过程中逐渐清晰。
标准化正是在一次次真实应用中逐渐形成的:稳定、重复出现的能力被沉淀为产品组件,软硬件接口和交付方式逐步统一,一个现场积累的经验,也能被复用到下一次部署中。当更换客户或是进入新的行业时,团队可以从已有产品能力出发,快速处理新的工艺要求。这个过程既考验前沿技术研发能力,也考验产品量产、工程交付和全球服务能力。
规模化部署解决的是产品如何走进更多现场的问题;而要让这些现场反过来提升通用能力,还需要统一的模型底座和迭代机制。面向物理世界的具身原生通用基座模型,可以在统一底座上沉淀不同物体、任务、本体和行业之间的共性能力。在具体项目中,则可以从已有能力出发,通过配置和适配满足差异化需求,减少进入新场景时重复开发的成本。
基座模型解决的是能力如何复用的问题,而真实场景的数据飞轮则解决了能力如何持续变强的问题。部署规模越大,系统遇到的反光、遮挡、形变、油污和随机堆叠等长尾问题越丰富;这些现场反馈推动模型、算法和产品迭代,能力提升后又支撑产品进入更多场景。梅卡曼德将这一过程概括为数据飞轮:场景反馈推动AI模型和产品优化,产品能力提升后再支撑更多落地场景。
支撑这27000+套产品的,是统一的“眼脑手”底层技术架构和标准化产品体系;而它们在不同国家、行业和工艺环境中的长期运行,也持续为这套体系提供现场检验。它的通用边界,正是在这些真实场景中被一遍遍测试和拓宽的。
结语:身体各不相同,但智能正在走向通用
人形机器人、轮式机器人、工业机械臂和其他形态的机器人,还会继续进入各自适合的场景,工厂、仓库、商店和家庭提出的任务,也不会变得完全一致。具身智能规模化发展面对的关键问题也逐渐清晰:当机器人更换本体形态、处理不同物体或是进入全新的环境和任务时,感知、理解、决策、规划和操作能力能够保留多少。
一次展会演示可以呈现机器人学会了什么,但大规模部署更关心的是,这些能力能否被沉淀为标准产品,进入新现场后继续使用,并在真实的效率和精度要求下稳定运行。当需要重新开发、重新调试和重新积累的部分不断缩小时,机器人进入更多行业的速度才有机会不断加快。今年的世界人工智能大会上,梅卡曼德展示的正是这样一条路径:以一套通用的“眼脑手”能力体系,赋能多种机器人形态进入不同的应用场景。


