宇树科技UnifoLM-WLA-1.0开源,来真的

2026年9月10日,宇树科技宣布完全开源新一代通用人形机器人基础模型UnifoLM-WLA-1.0,代码、模型权重、数据集同步开放。该模型参数量6B,基于约2500小时真机数据训练,单模型统筹64项任务,具身推理斩获7项开源SOTA。宇树科技UnifoLM-WLA-1.0的完全开源,标志着人形机器人基础模型从“封闭竞赛”走向“生态共建”的转折点。

一、一个6B模型,凭什么让整个行业侧目
2026年9月10日,宇树科技在官网和项目主页同步发布了一条消息:新一代通用人形机器人基础模型UnifoLM-WLA-1.0完全开源,代码、模型权重、数据集一并开放。
消息不长,分量不轻。
6B参数量,约2500小时高质量真机数据,500万+具身推理训练样本。这套数字放在大语言模型动辄千亿参数的语境里似乎不算惊人,但在具身智能领域,它意味着另一件事:一个足够轻量、可以被学术界和中小团队真正跑起来的“人形机器人大脑”。
更关键的是“完全开源”四个字。宇树科技UnifoLM-WLA-1.0的代码、模型、数据集同步开放,这不是“论文开源”或“部分权重开放”,而是把一套经过真机验证的完整模型体系摆到了桌面上。
为什么这件事值得关注?因为过去两年,具身智能领域的竞争逻辑一直围绕“谁的本体更强、谁的Demo更炫”展开。但王兴兴在2026世界机器人大会上的判断很直接:当前行业最大的瓶颈是具身智能泛化能力不够,大量AI模型在特定固定场景下表现优异,换个环境就失灵。泛化能力,才是人形机器人从实验室走向真实场景的命门。
UnifoLM-WLA-1.0要回答的,恰恰是这个命门问题。
二、UnifoLM-WLA-1.0到底是什么
2.1 参数量与架构设计
UnifoLM-WLA-1.0的核心参数为6B(约60亿参数),这在具身基座模型中属于“中等规模、高效推理”的定位。模型基于UnifoLM-ER-Flow多模态主干网络搭建,搭配MMDiT动作专家模块,训练数据包含宇树自有开源数据与BitRobot-HIW-500等公开资源。
WLA三个字母对应的是World-Language-Action,即“世界-语言-动作”。这个命名本身就透露了宇树的技术路线选择:不是单纯做VLA(视觉-语言-动作),而是在VLA之上融入了“世界模型”维度——让模型不仅要理解当前看到什么、听懂指令是什么,还要预测“如果我这样做,世界会变成什么样”。
2.2 技术架构拆解
理解UnifoLM-WLA-1.0的架构,需要抓住三个关键设计。
第一层:具身推理底座。 模型的推理能力来自UnifoLM-ER-1-4B,这是一个基于Qwen3-VL-4B训练的具身推理模块,使用了超过500万条具身推理样本。它的任务不是“聊天”,而是理解空间关系——物体在哪、怎么摆放、下一步会发生什么。
第二层:动态区域预测。 这是UnifoLM-WLA-1.0最独特的设计之一。传统VLA模型的工作方式是“看到画面→生成动作”,但真实世界中,一个动作往往会改变环境本身。宇树的解法是先预测“哪里会变”:利用光流从前后视频帧中提取发生变化的区域,通过VQ-VAE压缩成离散Token,让模型在执行动作前先判断未来场景中哪些区域可能发生变化。
第三层:统一动作空间。 人形机器人的动作涉及手臂、手指、腰部、腿部等多个身体部位。UnifoLM-WLA-1.0建立了一套统一动作空间,将机器人动作拆解为末端执行器位姿、末端执行器关节和下半身关节三部分,分别通过RVQ(残差向量量化)转化为离散Token,再按照共享时间步对齐送入模型学习。
这套设计的关键价值在于:它让“桌面操作”和“全身移动操作”不再需要两套模型。一台机器人可以用同一个“大脑”完成叠毛巾和铺床,用同一套参数驱动二指夹爪和五指灵巧手。
三、64项任务的真机答卷
3.1 任务覆盖范围
UnifoLM-WLA-1.0在真机评测中实现了单模型统筹64项任务,其中54项桌面操作、10项全身操作。
桌面任务包括:叠衣服、收纳餐盘、电池充电、整理铅笔盒、包装手机等。全身任务则覆盖倒垃圾、铺床、整理鞋子、把衣服放进洗衣机、收拾浴室和厨房、取蔬菜、整理沙发等场景。
这些任务看起来“日常”,但恰恰是机器人走入真实场景必须跨过的门槛。叠一件衣服涉及柔性物体的形变预测,倒垃圾需要全身协调移动和双臂配合,收拾厨房则要求在非结构化环境中连续完成多个操作步骤。
3.2 具身推理评测表现
UnifoLM-ER-1-4B在16项多模态感知与理解基准中,有7项领先表中参评的开源模型,整体结果与多款闭源模型处于相近水平。
具体来看,在Where2Place基准中,UnifoLM-ER-1-4B得分82.0,GPT-6 Astra得分69.0;在EmbSpatial上,两者分别为88.9和83.3。Where2Place和EmbSpatial考察的是空间推理和具身空间理解能力——简单说,就是机器人能不能判断“东西放在哪里最合适”“这个物体在三维空间中处于什么位置”。
空间理解能力之所以关键,是因为它直接决定动作的合理性。看得懂东西在哪、怎么摆,才谈得上做得对。
四、与主流具身模型的横向对比
为了更清晰地理解UnifoLM-WLA-1.0的定位,有必要将它与当前具身智能领域的代表性模型进行横向对比。
| 对比维度 | UnifoLM-WLA-1.0 | UnifoLM-ER-1-4B | RoboBrain2.0-7B | Qwen3-VL-4B | GPT-6 Astra |
|---|---|---|---|---|---|
| 参数量 | 6B | 4B | 7B | 4B | 未公开 |
| 核心架构 | ER-Flow + MMDiT | Qwen3-VL-4B基座 | 多模态推理 | 通用多模态 | 闭源架构 |
| 开源状态 | 完全开源 | 完全开源 | 开源 | 开源 | 闭源 |
| Where2Place | — | 82.0 | 63.6 | 63.0 | 69.0 |
| EmbSpatial | — | 88.9 | 76.3 | 79.6 | 83.3 |
| BLINK | — | 93.4 | 83.9 | 85.0 | — |
| 真机任务数 | 64项 | — | — | — | — |
| 全身操作 | 10项 | — | — | — | — |
| 末端泛化 | 平行夹爪+2类灵巧手 | — | — | — | — |
数据来源:
从对比中可以读出几个关键信息。
参数量与能力的非线性关系。 UnifoLM-WLA-1.0以6B参数实现了对部分7B甚至更大规模开源模型的性能反超。这说明在具身智能领域,数据的“质量密度”——2500小时真机数据、500万+具身推理样本——比单纯堆参数更有效。
“全身协同”的差异化。 表中多数竞品聚焦于桌面操作或机械臂控制,UnifoLM-WLA-1.0的64项任务中包含了10项全身移动操作,这在当前开源模型中并不常见。它意味着模型需要同时协调移动底盘、腰部姿态、双臂和末端执行器,复杂度显著高于纯桌面操作。
末端执行器的泛化能力。 支持平行夹爪和两类灵巧手,意味着同一套模型不需要针对不同硬件重新训练。这对生态建设至关重要——开发者用不同构型的机器人,都能跑同一套“大脑”。
五、宇树的开源逻辑:为什么是“完全开源”
5.1 从VLA-0到WLA-1.0的路径
宇树在具身模型上的开源并非一蹴而就。2025年9月,宇树开源了UnifoLM-WMA-0世界模型;2026年1月,开源UnifoLM-VLA-0操作大模型;2026年9月,UnifoLM-WLA-1.0将世界模型与动作模型的能力整合到同一体系。
这条路径的逻辑是清晰的:先验证世界模型能否预测交互后果,再验证VLA能否生成有效动作,最后将两者融合。UnifoLM-WLA-1.0不是一次“突然发布”,而是近一年技术积累的整合输出。
5.2 开源策略的行业含义
宇树招股书显示,公司研发投入中AI模型是资金与人力投入最大的板块,2024年初即启动基于视频生成的世界模型研发。将这样一个战略级投入的成果完全开源,背后的考量值得深思。
一种解读是:宇树在赌“生态大于闭环”。如果未来的具身智能生态需要一套像安卓之于手机那样的开源基础模型,那么率先占据这个位置的公司,将获得远超模型本身价值的行业影响力。王兴兴在2026世界机器人大会上提到“具身智能的ChatGPT时刻”,并预判机器人产业爆发临界点可能在2-3年后。在这个时间窗口内,谁能建立开发者生态,谁就掌握了定义行业标准的主动权。
另一种解读更务实:开源是加速数据飞轮的策略。当更多开发者基于UnifoLM-WLA-1.0做适配和微调,产生的反馈数据和场景多样性会反过来推动宇树自身模型的迭代。这是一种“开放换速度”的博弈。
六、对行业格局的深层影响
6.1 从“本体竞赛”到“大脑竞赛”
过去几年,人形机器人行业的竞争焦点集中在硬件层面:自由度多少、扭矩多大、续航多久。宇树自身也是从四足机器人和人形本体起家,G1系列在硬件参数上一直处于领先位置。
但UnifoLM-WLA-1.0的发布传递了一个明确信号:竞争维度正在迁移。谷歌Gemini Robotics 2提出“一个大脑,适用于任何机器人”,英伟达Jim Fan抛出“VLA已死,世界动作模型当立”的观点。具身智能的竞争,正在从“谁的机器人更强”转向“谁的模型更通用”。
宇树在这个转折点上选择完全开源,本质上是在争夺“具身智能大脑”的定义权。这与安卓早期通过开源建立移动操作系统生态的逻辑有相似之处,但挑战也更大——具身智能的硬件碎片化程度远高于手机。
6.2 对中小团队和学术界的意义
一个6B参数、完全开源的具身基座模型,对资源有限的团队意味着什么?
意味着一个实验室可以用几张消费级GPU跑起一套经过真机验证的模型,在其基础上做特定场景的微调。意味着一个初创团队不需要从零开始采集2500小时真机数据,就可以站在一个可靠的起点上。意味着具身智能的研究不再是大公司的专属游戏。
这或许才是“完全开源”最深远的影响:它降低了整个行业的创新门槛。
七、FAQ
Q1:UnifoLM-WLA-1.0和UnifoLM-VLA-0有什么区别?
UnifoLM-VLA-0是2026年1月开源的视觉-语言-动作模型,主要面向桌面操作任务。UnifoLM-WLA-1.0在VLA基础上加入了World模型维度,将“世界-语言-动作”三者整合,并扩展了全身移动操作能力,真机任务从VLA-0的12类扩展到64项。
Q2:6B参数够用吗?会不会太小?
在具身智能领域,参数量不是唯一指标。UnifoLM-WLA-1.0的6B参数配合2500小时真机数据和500万+具身推理样本,在多项评测中领先7B甚至更大的开源模型。轻量化的优势在于推理效率更高,更适合部署在机器人本体上。
Q3:完全开源是指什么?代码、权重、数据都开放吗?
根据官方信息,代码、模型权重和数据集同步开放。不过截至发布初期,项目主页上的Code、Models和Datasets显示为“Coming soon”,实际下载可能需要等待正式上线。
Q4:这套模型能跑在其他品牌的机器人上吗?
UnifoLM-WLA-1.0支持平行夹爪和两类灵巧手,并建立了统一动作空间。理论上具备跨本体迁移的潜力,但实际适配效果取决于目标机器人的硬件构型和动作空间兼容性。
Q5:具身智能的“ChatGPT时刻”什么时候到来?
王兴兴在2026世界机器人大会上表示,机器人产业爆发的临界点可能在2-3年后。当前最大的瓶颈是泛化能力——模型在固定场景下表现良好,但换个环境就难以复用。UnifoLM-WLA-1.0的64项任务验证,正是对泛化能力的一次系统性检验。
Q6:宇树为什么要完全开源而不是商业化闭源?
从招股书信息看,宇树的AI模型投入是战略级板块。完全开源可能是生态占位策略——在具身智能生态尚未定型的窗口期,通过开源建立开发者基础和行业标准。这与安卓早期策略有相似之处,但具身智能的硬件碎片化带来更大挑战。

