文章摘要
Aether AI发布了因果驱动的CRIS-0机器人智能系统,其因果智能可弥补传统基于相关性预测的AI在动态物理场景中的短板,采用分层智能架构,经测试,它在应对突发干扰、完成长程复杂任务方面鲁棒性优于端到端模型,该技术思路未来还可拓展至生物制药、新材料研发等领域。

一段七分钟的演示视频里,机械臂遭遇了一连串突发干扰:眼看就要抓住咖啡袋时,旁边的人突然挪走了袋子;操作咖啡机时,有人用灯光晃动改变了按钮周围的光照环境;靠近微波炉时,有人往原本放蛋糕的盘子里塞进了饮料罐;最惊险的是,当机械臂准备关上微波炉门时,一只手突然探到了门边。

令人惊讶的是,面对这些层出不穷的意外,这套机器人系统都顺利化解了。咖啡袋被挪走的瞬间,机械臂没有再扑向原位置,而是顺着袋子移动的方向调整轨迹重新抓取;灯光晃动时,它按按钮的动作没有丝毫变形;盘子里多了的饮料罐,它会先夹到一旁,确认剩余物品可以安全加热后再继续操作;关门时察觉到门边的人手,机械臂立刻缩回,安静等待人手撤走后才完成关门动作。

这些细节恰恰凸显了真实物理场景下机器人的核心需求:当身处和人类共享的空间时,意外状况随时可能出现,要完成既定任务,机器人必须时刻判断:眼前的变化是否会影响原定计划,是否需要及时调整策略。这正是Aether AI此次发布的CRIS-0的核心优势所在——这款因果驱动的机器人智能系统,可以在每次受到干扰时及时识别并调整行动策略,其中关门场景的反应速度达到了0.1秒级。

CRIS-0的设计初衷就是为了适配现实世界的动态变化。面对每一次突发意外,它都会先厘清变化的本质:哪些因素发生了改变?这些变化会对后续行动产生什么影响?是否需要退回上一步重新规划?这种理解变化、推演影响并据此调整行动的能力,就是所谓的“因果智能”。这种模式和人类的行动逻辑非常接近,也让CRIS-0不仅具备更强的抗干扰能力,在完成长程任务和个性化任务时也表现更出色。

事实上,任何需要在动态环境中行动和决策的领域,都能从这种因果智能路线中获益,机器人只是最典型的应用场景,也是Aether AI将因果智能落地到真实世界的第一个落脚点。

为什么仅靠“预测下一步”无法适配物理世界?

过去几年里,基于“从海量数据中寻找规律并预测下一步”的大语言模型,在数字世界取得了巨大成功,但这种成功有其特殊性。语言是一种离散的模态,人类数千年总结的规律都体现在文本表面,模型通过相关性拟合就能很好地掌握。但物理世界完全不同:其内在规律不会直接显现在表面,很多影响结果的条件只有在实际交互中才能显现;更关键的是,机器人的每一个动作都会真实改变世界,一旦预测出错,无法像聊天那样撤回重来。

在这样的环境中,仅靠统计规律“预测下一步”会遇到诸多问题:无法分辨哪些变量才是真正决定结果的关键因素,哪些只是背景噪声,执行任务时极易被干扰;遇到训练数据中未出现过的干预场景时,无法进行合理外推;任务失败后,无法追溯失败的根本原因;环境发生变化时,无法判断原本学到的关联关系是否仍然成立。

因果智能恰好弥补了这些短板。它首先将世界抽象为与任务相关的因果变量,梳理出变量之间的影响关系,再将机器人的动作视为一种干预,建模“如果执行这个动作,世界会发生怎样的变化”。这样一来,模型不再只是预测下一帧画面,而是可以推演不同干预措施的后果,也能在任务失败时追溯根本原因。

因此,因果智能有望解决一系列棘手的问题:分布外泛化、长尾场景适配、跨本体迁移、长程任务中的错误恢复,以及更主动的数据收集。机器人是最典型的测试场景,因为每一次机器人动作都是一次实际干预,相关性拟合的局限会立刻显现,但任何需要在变化环境中做决策的领域,都有类似的需求。因果智能解决的根本问题不是“预测得更准确”,而是“在变化的环境中识别真正影响结果的因素,并通过干预和反事实推理来行动”,这也是它可以拓展到多个领域的核心原因。

因果驱动的CRIS-0:分层智能架构

CRIS-0没有采用单一大模型包办所有任务的模式,而是将机器人智能拆分为两个层级:高层负责理解任务、进行推理规划,确定“接下来该做什么”;底层则负责理解具体的物理变化,预测“这个动作会让世界发生怎样的改变”。

这两个层级对应CRIS-0的两大核心组件:因果驱动的机器人Agent和因果世界模型。

Agent围绕“因果状态转移”来组织任务。它可以从新环境中识别出与任务相关的关键变量,将整体任务拆分为多个阶段,为每个阶段定义验证标准,并准备对应的执行工具。在执行过程中,它会不断更新当前状态、验证中间结果,决定是继续执行当前步骤、重试该步骤,还是退回上一阶段重新规划。比如对齐桌布角的任务中,它不会关注整张画面,而是只会跟踪桌布是否被抓住、角部距离目标位置还有多远、是否出现打滑等真正影响任务的变量,只有这些关键信息会进入决策流程。

这些能力通过统一的工具接口进行整合:规则函数、学习得到的策略模型、SLAM导航、世界模型、验证器等,都被包装为规划器可调用的工具。在自由空间移动时可以调用规则函数,在接触丰富的抓取任务中调用策略模型,需要预判未来状态时调用世界模型,需要确认执行结果时调用验证器。当任务发生变化时,只需要调整工具组合和调用顺序,不需要完全重构整套系统。

CRIS-0的执行过程遵循“结构化状态转移循环”:先评估当前状态,再执行对应的工具,然后验证执行结果,最后根据反馈更新任务图。任务图中的节点是可验证的执行阶段,边则是阶段之间的转移条件。执行成功则进入下一阶段,失败则重试该步骤,或者退回更早的阶段恢复执行条件。如果问题出在工具本身,CRIS-0还会根据错误反馈修正工具,并在成功执行后保留优化后的工具,这样局部错误不会持续累积,复杂任务也可以被拆解为适合对应工具的子问题。

因果世界模型负责预测动作带来的物理后果。它不会直接预测下一帧画面,而是先分析当前观察到的状态和候选动作会改变哪些因果变量,再通过这些变量的变化来刻画未来的场景。这样一来,智能体不仅能知道“画面会变成什么样”,还能判断“这个动作是否能将我推向目标状态”。在此基础上,CRIS-0额外添加了动作模块,让世界模型可以直接生成机器人动作,从单纯的预测器转变为策略模型。

实战优势:抗干扰与长程任务能力

理论设计需要通过实际测试验证。Aether AI将CRIS-0和端到端模型放在同一批任务中进行对比,使用相同的机器人、相同的场景,并且全程安排人员进行干扰。实验结果显示,面对各种突如其来的干扰,CRIS-0的鲁棒性明显更强,反应速度也更快。这是因为它从根本上理清了哪些变量与任务相关、哪些变化会影响任务结果,并且始终跟踪任务所处的阶段,因此可以在扰动后迅速回到受影响的阶段继续执行。

不过,应对突发干扰只是基础考验,更长的复杂任务才能真正体现系统的实力。在另一项演示中,用户只给出了两句模糊的指令:“帮我找蓝色小包”和“太乱了,帮我整理一下”。机器人需要自行拆解任务:先找到蓝色小包,再开始整理环境。整理过程中也不会盲目处理物品:拿起饮料瓶时,它会先检查内部是否还有剩余液体,空瓶丢入垃圾桶,未喝完的则放回指定位置;书本会随手放在茶几上,而涉及隐私的账单则会被收进更私密的抽屉中。

这类长程任务正是端到端模型的薄弱环节:误差会在各个步骤之间悄悄累积,往往到最后一步才发现出错,却已经无法追溯具体哪一步出现了问题、为什么会出错。而CRIS-0的做法是每完成一个阶段就验证一次状态,如果未达到标准就会在当前阶段进行调整,这样局部失败会被当场拦下,不会累积到任务后期才爆发。

模糊的用户指令则是另一项测试。比如“给我拿瓶饮料”这类请求,需要模型先理解用户的真实意图,再完成精细的抓取控制。让单一模型同时承担意图理解和精细操作两项任务,很难兼顾双方的要求。CRIS-0则将任务分配到不同层级:规划器负责选择正确的目标,比如结合用户晨跑后的场景和健身习惯,挑选出功能性饮料;规则函数负责将机械臂的夹爪精准送到目标位置;策略模型则专注于最后一步的精细抓取操作。

多轮对比测试后,CRIS-0这套分层架构的价值清晰显现:当任务执行到一半时,无论环境发生变化还是某一步骤执行不到位,系统都有机会及时发现并在对应环节进行调整。真实环境很难始终配合预先设定的计划,机器人能否完成任务,恰恰取决于途中的判断和修正能力,这也让Aether AI的因果智能路线有了可落地的实际落点。

不止于机器人:跨领域的应用潜力

在此次推出CRIS-0之前,Aether AI已经分别在两个方向进行了探索:让AI自主摸索陌生环境,以及让AI推演动作带来的变化。

其中一项工作是RSIAgent:当智能体进入不熟悉的软件环境后,会主动尝试操作,验证哪些操作有效、在什么条件下会失败,再将验证过的经验存入记忆,供后续任务使用。这项研究探索了一种无需更新模型参数,就能通过与环境交互积累经验的方法。

另一项工作是CausalWM,专注于物理变化的推演过程。比如机械臂推动杯子时,模型会先预测运动轨迹,再推演三维几何关系的变化,最后生成未来的画面。前一步的预测结果会参与后一步的计算,团队将这一过程称为“因果思维链”。

CRIS-0延续了这两条研究思路,将任务层的规划、验证与恢复,和物理变化的预测及动作控制结合在一起。此前分别研究的技术能力,终于进入实际操作阶段,接受真实执行结果的检验。

在这些工作背后,Aether AI规划了一条逐步深入模型内部的技术路线。最靠近任务的一层是因果驱动智能体,负责将关键条件用于规划、归因和恢复,比如判断哪些步骤可以继续执行、失败可能出现在哪里、验证过的经验如何复用。再往底层,则是让模型学习动作如何改变环境,推演接触、运动和位置关系的变化,为实际控制提供依据。此次CRIS-0主要验证的正是这两个层面。

团队还计划继续向模型内部推进,比如通过模块化神经架构将接触、摩擦等因素组织为可复用的模块,更底层的Causation Transformer则希望让变量之间的因果影响直接参与模型计算。不过这两层技术仍在推进和验证阶段。

正如该公司创始人、CEO所说,他们的目标是打造“能举一反三、适应真实环境的智能大脑”,而机器人就是最直接、最诚实的测试场。

事实上,生物制药、新材料研发等领域也有类似的需求:改变成分或实验条件会如何影响最终性能,干预某个生物过程能否带来预期的变化。因果方法可以帮助研究者提出更有依据的假设、选择值得验证的条件,再通过实验进行修正。这些领域无法直接照搬机器人的技术方案,但“找到影响结果的条件、施加干预、再检验后果”的思路可以延伸适用。Aether AI也计划在这些方向展开探索,未来能取得怎样的进展,值得我们拭目以待。

以上内容不代表本平台立场,仅供读者参考