拿GPT-6 Astra当机器人大脑 实测真的可行

近期,一台售价约150美元的SO-101机械臂在GPT-6 Astra的驱动下完成了一幅红蓝相间的金门大桥画作,整个过程没有预设轨迹:模型先自主规划落笔位置,再通过搭载的摄像头实时观察作画进度并调整动作,相关内容快速在网络上传播,OpenAI的Sam Altman甚至转发该视频并表示“我也想要一套”。
过去几年里,机器人行业始终在讨论一个核心议题:谁能成为机器人领域的OpenAI?如今来看,这个问题的答案或许正指向OpenAI自身。
Astra的实操能力究竟如何?
用机械臂画金门大桥的展示只是初步的惊艳效果,更能体现Astra潜力的是一系列学术与社区实验。卡内基梅隆大学机器人实验室的Wenli Xiao开展了一项直观测试:先录制人类完成全新任务的视频,将影像输入相关模型后,让GPT-6 Astra直接控制机械臂复刻同样的动作,最终实现了一次就成功运行的效果,Wenli Xiao将这种模式称为“physical ICL”——此前大模型仅能通过文本、代码示例在上下文学习新任务,而这一实验证明这种能力可以迁移到物理世界中。
还有团队将Astra当作“机器人工程师”来使用:Lingxiao Guo将真实机器人演示的多视角画面与动作数据输入模型,让其自主完成相机标定、场景重建与物理参数校准,最终将真实环境完整迁移到MuJoCo仿真平台中,得到的不仅是视觉相似的3D场景,更是一套支持接触仿真与动作回放的real2sim环境。
社交平台上还有开发者将Astra接入更复杂的机器人平台:Dmytro Hrybov在MuJoCo中为模型搭配了Kinova Gen3机械臂与Shadow Hand五指机械手,让其握住铅笔绘制毕加索著名的鸽子画作,为了让笔尖稳定落在纸上,机械手需要同时协调握笔姿态、手指与铅笔的摩擦系数,以及笔尖与纸面的接触力。
如果说以上实验还带有爱好者整活的性质,那么专业团队的测试则更能体现Astra的落地潜力。RoboCurve将GPT-6 Astra接入两台真实的I2RT YAM机械臂,模型可以获取顶部与双腕处的三个相机视角,以及机械臂自身的状态数据,直接输出双末端执行器的位置、姿态与夹爪状态,再由底层逆运动学系统转换为具体关节动作。在“将桌面红色积木抓取放入旁边碗中”的测试中,20次尝试成功了19次,成功率达到95%,而对比模型Fable 5.1仅成功8次。
没人能想到,一款并非针对机器人场景专门训练的通用AI模型,居然能达到如此出色的物理操作表现,这也恰好撞上了过去几年机器人行业最热门的研发路线——为机器人专门训练专属的“基础模型大脑”。
机器人大脑不必从头训练
过去几年,随着大模型能力向视觉、语音与智能体领域不断拓展,机器人行业一直在追问:如果语言领域已经诞生了GPT这类通用模型,那么机器人何时才能拥有属于自己的“GPT”?Physical Intelligence与Skild正是在这种期待中成为行业明星:前者希望训练跨任务、跨场景、跨机器人本体的通用机器人基础模型,将视觉、语言与动作整合到同一套模型中,让机器人像大模型理解文本一样,通过海量具身经验学习操作真实世界;后者的目标更为直接——“Any task, any robot, one brain”,试图用一套通用“大脑”适配四足机器人、人形机器人、桌面机械臂与移动操作平台等所有形态的机器人。
这两家公司代表了过去几年机器人基础模型的主流思路:既然语言领域有了通用基础模型,那么机器人也需要在海量机器人数据上训练出一套真正理解身体与动作的专属模型,因此“谁会成为机器人领域的OpenAI”始终是这条赛道的核心议题。
但Astra的出现让这个问题有了出人意料的答案。亚马逊Alexa首席科学家、Retrocausal联合创始人Zeeshan Zia曾表示:“机器人领域的OpenAI或许就是OpenAI本身,而非Physical Intelligence或Skild”。这句话看似具有争议,因为Astra并没有遵循机器人公司的传统研发路线:它没有先收集大量机器人轨迹数据,再专门训练一套从视觉到动作的基础模型,而是提出了另一种可能性:如果通用AI本身已经具备足够强的能力,是否还需要从头打造专属的机器人大脑?
这个问题放在OpenAI身上尤为微妙,因为该公司其实很早就涉足了机器人领域。2018年,OpenAI推出了Dactyl,让Shadow Dexterous Hand机械手在真实世界中旋转物体,后续还进一步让灵巧手完成了魔方操作,当时OpenAI就已经在研究如今机器人行业仍在攻克的难题:如何在仿真环境中训练模型并迁移到真实世界,如何处理摩擦、遮挡、传感器噪声以及复杂的多自由度控制。
但几年后,OpenAI关闭了机器人团队,当时Wojciech Zaremba提到了一个现实限制:机器人数据远不如互联网文本与图像那样容易大规模获取,机器人数据的采集成本高昂、速度缓慢,且很难覆盖足够丰富的真实场景。有趣的是,当年因为数据问题暂时离开机器人领域的OpenAI,如今正通过另一条路径回归。过去几年,OpenAI先将模型在语言、代码、视觉与智能体领域不断做大,让模型积累了关于物体、空间、因果关系与人类行为的大量知识,现在机器人领域需要解决的,正是如何将这些已有的知识稳定转化为身体动作。OpenAI本身也已经重新关注这一方向,Sam Altman近期明确表示,OpenAI将研发人形机器人与其他形态的机器人,而核心关键仍然是让机器人能够工作的“大脑”。
Astra如何控制机器人的“身体”?
目前Astra并没有直接控制每一台电机的方案。以RoboCurve的实机测试为例,模型会获取三个相机视角与机械臂自身的状态数据,直接输出末端执行器的目标位置、姿态(包括x、y、z坐标与yaw、pitch、roll角度)以及夹爪状态,再由底层的逆运动学系统将这些目标转换为各个关节的具体动作。这种模式是典型的分工协作:Astra负责判断“手应该去往何处”,而传统机器人控制栈则负责解决“每个关节具体如何运动”。
英伟达前研究科学家Yu Xiang也曾提出,机器人领域接下来值得关注的方向,就是如何将最先进的AI模型真正接入操作任务中,相比仅让大模型停留在上层、负责拆解任务与调用工具,Astra已经开始更直接地介入机器人的动作决策。
但随着探索的深入,问题也逐渐显现。有开发者尝试让Astra直接输出Unitree Go1四足机器人的关节目标值,试图像强化学习策略一样以50Hz的频率控制机器人行走,实验虽然成功启动,但由于Astra的推理速度无法跟上实时控制的要求,物理模拟必须在每次模型调用之间暂停,最终250次推理仅实现了约5秒的行走。
显然,Astra已经能够决定机器人“下一步该如何行动”,但要让它直接接管毫秒级的底层控制仍不现实。因此未来更现实的形态并非让单个大模型从头管控所有环节,而是延续分层分工的模式:Astra负责理解环境、推理与规划动作,低层策略与控制器则负责将这些意图快速、稳定地转化为实际动作。
最后一毫米的精度难题
能够规划动作并不代表能够完美完成动作,两者之间仍存在不小的差距。还是以RoboCurve的实机测试为例,在“将红色积木放入碗中”的任务中Astra的成功率达到95%,但当任务切换为将圆形拼图准确嵌入对应凹槽时,成功率直接跌至10%,20次尝试仅完成2次。
很多时候Astra已经能够找到目标物体、抓住旋钮并将其移动到目标凹槽附近,但却很难完成最后的精确插入动作。这最后几毫米的差距,展现了机器人领域最棘手的问题之一:位置与角度的细微偏差就会导致零件无法对准,而真实接触过程中受到的硬件误差干扰,也会让后续动作无法顺利完成。
这也是为何Physical Intelligence近期专门针对“最后一毫米”开展研究:在他们的实验中,让通用机器人模型拿起螺丝刀并不算困难,但想要快速、准确地对准一颗小型M3螺丝,仍需要通过在线强化学习进行优化;网线插入、电源线插接、扎带固定等任务,也都卡在类似的精细接触阶段。
Astra目前的优势主要集中在环境理解、目标判断与动作规划这类“大脑擅长的领域”,而一旦进入高频反馈、精细接触与力控制环节,机器人自身的物理操作经验仍然至关重要。这也为“机器人领域的OpenAI”之争留下了关键悬念:机器人当然可以用最强的通用模型作为“大脑”,但能够与之匹配的高性能物理机器人身体,目前仍未出现。

