文章摘要
优必选在展会上1:1复刻客户工厂真实作业场景,展示工业、商用、家庭消费三条产品线。其工业人形机器人在多场景稳定作业,展现自主智能水平。该企业具身大脑技术体系分三层,采用端侧部署和「1+N」模式。其重视真机数据,已搭建数据闭环。2025年营收可观,还拓展产业链伙伴,未来竞争聚焦机器人留厂创造价值能力。

在当下的人形机器人行业,评判一家企业是否具备真正的落地实力,有个简洁直观的标准:是否敢于将客户工厂的真实作业场景完整复刻到公开展台上。毕竟宣传片可以后期剪辑,演示环节可以提前彩排,但真实的产线不会配合“演员走位”,任何细微的现场偏差都会让机器人陷入卡顿,触发异常停机。

某企业此次就将客户工厂中攻克的各类作业难题1:1搬到了展会上,涵盖汽车钣金件、机加件上下料的尺寸误差与节拍压力,物流小件的随机堆叠、连续作业的定位移动等真实场景,这些都是此前实验室演示中难以完全复现的挑战。

展台上,工业人形机器人Cruzr Y1正持续开展拆垛码垛作业,搬运纸箱与料箱;Cruzr S2则负责汽车机加件、钣金件的上下料,在工作台上实现亚毫米级的精准定位。除此之外,Cruzr S2还能从混杂料箱中抓取不同规格的护肤品包装盒,逐一投入自动播种墙供包台完成分拣,经估算其平均抓取节拍最高接近1100件/小时。整个作业过程没有人工干预,也没有预设的固定程序,从环境识别、自主移动到抓取放置,全由机器人独立完成;即便出现抓取失败的情况,机器人也能自主识别问题、调整策略,重新发起抓取尝试。

这一展示背后,也传递出行业头部企业对2026年人形机器人竞争格局的判断:能获得客户买单的场景,才是真正有价值的场景。

客户在筛选机器人厂商时,首先关注的并非企业在某一基准测试中的表现有多亮眼,而是硬件运行是否稳定、厂商是否真正理解场景需求、解决方案能否在真实环境中稳定落地。

在实验室环境中完成单次任务,考验的更多是算法的上限表现;而当机器人进入工厂,需要连续完成成千上万次作业时,检验的就不只是算法能力,还包括硬件可靠性、任务成功率、作业节拍效率、采购与运维成本,以及厂商对整套生产流程的理解深度。

此次在展会上展示的这些方案,已经走过了实训阶段,进入小规模交付环节,目前正根据客户现场的运行效果逐步扩大应用规模。

在真实场景中积累了大量作业经验后,该企业也搭建起了自己的产业生态网络。相关负责人坦言,当人形机器人真正进入客户现场后,单靠一家企业很难覆盖整条产业链路,从芯片、核心零部件、整机制造,到场景交付、数据回流,每一个环节都决定着机器人能否从几台试用设备,走向成百上千台的规模化复制。

此次展会上,该企业并非只推出单款明星机器人,而是同时展示了工业、商用、家庭消费三条完整的产品线。

工业端,展台1:1复刻了客户的真实作业产线,近十台Cruzr S2与Cruzr Y1在汽车上下料、物料搬运、拆码垛、小件分拣等简单重复的工位上,从开馆到闭馆持续不间断作业,全程保持稳定运行。

商用端,该企业带来了全新的商用服务人形机器人Walker C1,主打迎宾导览、文娱展演、科研开发与智能助教等场景。

家庭消费端,搭载「Resonance-LM」情感大模型的超仿生人形机器人「U1」同步亮相,核心功能聚焦情绪支持与情感陪伴。

将三条产品线同时展出,并非只是简单扩充产品SKU。展台上最具视觉冲击力的并非机器人整齐排列,而是Cruzr S2、Cruzr Y1持续处于不间断作业状态,全程自主完成识别→抓取→移动→定位→放置→检测→回流的完整工作流,完全符合工业场景中最严苛的要求:高强度、长时间的稳定连续作业。

拆解这些作业场景的细节可以发现,这绝非精心编排的展台表演,而是完全复刻了客户日常的生产逻辑。以汽车机加件上下料为例,需要双机协同搬运超过1米的大尺寸工件,同时处理来料偏差、标定漂移、工件变形与现场扰动等问题,最终实现定位精度小于1mm;在汽车钣金件上下料环节,机器人需要在皮带线与机台之间循环完成上料、定位、检测、下料,依托端侧运行的VLA模型,同样实现了小于1mm的定位精度。而在物流电商小件分拣场景中,机器人需要面对不同规格、颜色、堆叠状态的纸盒持续抓取,平均抓取节拍近1100件/小时。

真实工厂的作业场景,对人形机器人提出了与实验室演示完全不同的能力要求。这类机器人不再局限于动作流畅、能跑能跳的表演属性,而是需要读懂复杂的现实环境、自主拆解任务目标,在存在不确定干扰的情况下稳定完成抓取、装配、放置等操作,遇到失败后还能自主纠错并重新尝试。

这也造成了作业型“打工机器人”与表演向“跳舞机器人”在硬件选型、算力配置上的巨大鸿沟。表演型机器人优先追求动作的爆发力与灵动性,侧重跑动、空翻、舞蹈特技等视觉效果,硬件上偏向轻量化设计,身高大多在1.2米左右,一般不配置视觉、力觉传感器,也无需灵巧手这类末端执行器;关节多选用灵活性高、成本可控的行星减速器,足以支撑大动态的肢体表演;算力端仅需要瑞芯微RK3588这类芯片即可满足底层运动控制需求,只需执行预编排的轨迹,无需运行复杂的具身大模型。

而作业型“打工机器人”的身高普遍超过1.7米,面向的是持续受力、长时间连续运转、频繁与物体接触交互的真实作业工况。这类机器人的关节需要承受持续负载,兼顾抗疲劳特性与接触力矩的精准控制,因此会选用成本更高、刚度与稳定性更出色的谐波减速器。同时,为了完成环境感知、力觉反馈、任务拆解规划、失败后自主重试等操作,机器人需要在本地运行具身大模型与世界模型进行实时推理,这就离不开英伟达Thor这类高算力芯片作为算力底座。

简单来说,表演型机器人比拼的是动态表演能力,整套硬件配置服务于舞台展示效果;而作业型机器人比拼的是整机可靠性与自主智能水平,本体硬件与算力架构全部围绕实际生产作业设计,两套硬件体系无法直接互通复用。

该企业将如此严苛的真实产线搬上展台,显然不只是为了展示技术实力。硬件决定了机器人能否“动起来”,而具身智能大脑,才决定机器人能否真正“干成事”。

该企业的“具身大脑”,本质是一套包含理解、预测、执行的三层技术体系。

第一层是Thinker基座大模型,负责让机器人“看懂”世界。机器人只有先明确自身所处的环境、眼前的物体类型以及用户下达了什么任务,才能开展后续的规划与操作。Thinker通过机器人的第一视角数据,建立对视觉、语言、空间环境的理解能力。公开资料显示,Thinker在10B以下具身智能大脑模型的权威基准评测中获得9项第一,最大的基座模型参数规模达到100B,验证了模型在感知与理解层面的基础能力。

但当机器人进入生产环节后,还需要面对持续变化的物理世界,这就需要第二层能力:预测。基于Thinker基座模型,该企业自研了「Thinker-WM世界模型」,用于回答“我这样做,接下来会发生什么”这类问题:比如拿起一个物体后会不会掉落,移动到某个位置会不会发生碰撞,下一步动作是否符合物理规律等。为实现这一目标,Thinker-WM沿用了Thinker在数据管线、模型调试与训练基础设施上的积累,同时对模型架构进行了升级,引入Diffusion Transformer、Flow Matching等技术,将视频表征、Action表征与Prediction纳入统一表征空间进行训练,让动作规划更加贴合物理世界的运行规律。目前,Thinker-WM已经在具身智能评测基准LIBERO中登顶。

最后一层,是Thinker-VLA,负责“执行”。在此次展会展示的工业工位场景中,Thinker-VLA需要将任务理解转换为连续的控制信号,实时决定机械臂轨迹、末端姿态、抓取力度与放置位置。当遇到工件偏移或抓取失败的情况时,模型还能根据反馈调整动作,让机器人继续完成任务。相关负责人表示,理解、预测、执行三层能力结合起来,机器人才能从“会看、会想”走向“会干”。据悉,该企业下一步计划探索三个模型向统一端到端架构融合的路径,包括主干网络与参数共享。

但对于真正进入工厂的机器人来说,模型能力只是第一关,下一个核心问题是:这颗大脑能否在机器人本体上实时运行?如果机器人的每一次动作都依赖云端反馈,那么网络延迟、通信稳定性、部署成本与功耗都会成为工业落地的阻碍。

该企业的技术路线非常明确:将高实时性的能力下沉到端侧。数据显示,经过端侧优化后,Thinker-VLA的推理效率提升176%,存储用量降低60%,端侧全功能模块的GPU存储需求从64GB降至32GB。相关负责人介绍,团队将大量算法从x86平台迁移到低功耗ARM平台,同时优化底层软件、算子与域控,目标是让整套软件系统在一块嵌入式板卡上运行。“搭载的电路板越多,空间、续航与可靠性都会成为问题,所以我们一直坚持将所有软件算法放在端侧处理。”该负责人补充道,云端可以承担慢推理、多机调度与模型管理等任务,而端侧负责机器人的实时感知与动作执行。这也意味着,模型、算力、功耗、通信、运动控制与硬件可靠性,需要从产品设计之初就协同考量。

端侧部署解决了具身大脑能否“装进”机器人本体的问题,那么同一个“大脑”如何快速适配工业、商用与家庭三类不同的机器人?该企业给出的答案是「1+N」模式。

「1」是一套共性技术基座,「N」则是面向不同场景定义的机器人产品。相关负责人表示,在具身技术尚未实现真正泛化的当下,只能通过不同场景的需求反向定义产品。工业机器人需要关注负载能力、定位精度与连续工作能力,商用机器人需要侧重高动态交互能力,家庭机器人则需要具备理解表情、情绪与记忆的能力。“同一套智能基座可以复用,但不同机器人的硬件本体仍需要围绕具体场景进行工程优化。”

目前,该企业的这种技术复用能力已经显现出价值。商用服务人形机器人Walker C1基于现有的工业机器人技术底座开发,沿用了部分软件系统与自研的舵机技术,从产品定义到样机完成仅需约4~5个月,而如果完全从头开发同类产品,通常需要6~9个月的时间。

将具身大脑装进机器人本体、完成端侧部署,只是解决了机器人“能干活”的第一步。具身智能的竞争最终会回归到数据层面。与依赖互联网数据规模的传统AI不同,具身智能机器人面对的是充满不确定性的物理世界,同一个抓取动作可能因为物体重量差异、摆放位置变化、机械误差累积等因素产生完全不同的结果,这类真实环境中的交互反馈,很难仅靠仿真模拟获得。因此,机器人必须进入真实场景,在一次次任务执行、失败修正与环境交互中积累经验。

据悉,该企业训练模型的数据构成中,真机数据占比高达60%~70%,第一视角(Ego)数据约占20%,剩余10%才是仿真数据。这种数据结构背后,也体现了该企业对具身智能演进路径的判断:“世界模型可以提升数据利用效率,仿真也能补充极端场景,但机器人真正需要面对的摩擦力、负载形变、物理接触与随机扰动,只有在真实交互中才能学深学透。”

为了让真实反馈形成完整闭环,该企业搭建了一套自建的数据闭环系统:机器人进入生产环境后会持续产生任务数据,这些数据经过上传解析、清洗标注、模型训练、部署验证后,再反馈到下一轮的数据采集环节。在这个过程中,机器人每完成一次任务,都不仅是一次商业交付,更是在为具身大脑积累新的经验。目前,该企业日均可产生千小时级的原始数据,经过清洗后,每8小时的数据大约能留下1.5~2小时的有效数据。这些数据并非仅服务于该企业自身的模型训练,目前已有头部具身模型客户采购该企业的真机数据。

财报数据显示,2025年该企业全年营收超过20亿元,人形机器人总销量为13838台。其中,全尺寸具身智能人形机器人的收入达到8.2亿元,销量为1079台,超过80%的产品应用于汽车制造、智慧物流、3C电子、半导体、航空制造、工业数据采集等严苛的工业场景。

单纯的数字并非最关键的指标,真正重要的是这些机器人能否进入高价值的生产现场。在这些场景中,机器人遇到的问题越复杂,产生的数据就越丰富,模型迭代的速度也就越快,下一次的交付能力也就越强。这也是为什么,具身智能的核心壁垒从来不是简单的出货量,而是能否建立「机器人部署→真实数据→模型优化→能力提升→更多场景部署」的正向循环。

但要让这套循环持续扩大,仅靠一家机器人企业是远远不够的。具身智能最终是一场涵盖产品场景理解、数据闭环搭建、软硬协同与规模化制造的系统工程竞争。据相关负责人介绍,该企业正在拓展覆盖芯片、核心零部件、整机制造与场景交付各环节的合作伙伴网络。

在芯片层面,该企业与沐曦股份成立了「曦选创智」,布局具身智能端侧芯片的研发与量产,计划2027年流片、2028年实现量产;在核心零部件层面,该企业收购了A股上市公司锋龙股份,合作推进灵巧手、伺服驱动器等核心零部件的研发与制造;在制造端,该企业与西门子合作建设的万台产能人形机器人超级智慧工厂,已于今年8月份正式投产。

在应用端,该企业已经覆盖了日立中国、富士康、三一重能、基本半导体、珠城科技等智能制造合作伙伴,以及比亚迪、吉利、东风柳汽、本田贸易、富奥股份、永茂泰等汽车产业伙伴,还有德马科技等智慧物流合作伙伴。今年上半年,该企业还与申昊科技、Terra Robotics、德山JMR、永达机器人、波士集团、麦迪科技等国内外的应用集成商达成合作,持续推进人形机器人在更多产业场景中的落地应用。

这些合作伙伴共同构成了一条完整的产业链路:上游提供更稳定、更低成本的机器人基础能力;中游提升机器人的规模化交付能力;下游的真实生产现场则不断产生新的任务需求与交互数据。最终,这些数据会回到具身大脑中,推动模型迭代,反过来提升机器人进入更多场景的能力。

当前的人形机器人行业,并不缺少会走、会跳、能完成单次抓取动作的产品。未来的行业差距,会越来越集中到一个更现实的问题:谁的机器人能够被客户留下来,第二天继续工作。因为进入真实场景后,机器人面对的不再是一次性的展示任务,而是每天数小时、数百次甚至数万次的重复作业,这考验的并非单点能力,而是一整套系统能力:硬件可靠性、模型泛化能力、数据闭环效率,以及厂商对真实业务的理解深度。

从这个角度来看,客户订单不仅代表商业收入,更成为验证技术路线的最直接标准。客户愿意部署机器人,机器人才能获得真实反馈;真实反馈推动模型迭代,模型能力提升又帮助机器人进入更多场景。商业化与技术进化,在这里逐渐融合为同一条增长曲线。

回到此次展会的展台复刻场景,该企业真正想传递的信号是:在人形机器人从实验室走向物理世界的过程中,行业的竞争规则已经发生改变。未来的行业赢家,未必是谁最擅长展示机器人的表演能力,而是谁能让机器人真正留在生产现场,持续创造真实价值。

以上内容不代表本平台立场,仅供读者参考