文章摘要
作者在斯坦福行业交流活动中,聆听嘉宾对AI时代人的自主性思考。嘉宾指出机器人技术核心卡点在于物理世界与语言数据形态不同,缺真实操控数据和对世界运行逻辑理解,提出世界模型的三层框架。此外,嘉宾分享个人经历强调“无畏”,还称AI强大但人不能失自主权,企业AI变革需负责人亲自参与。

最近在斯坦福参加一场行业交流活动,现场聆听了一位嘉宾的深度访谈。原本我更期待听到关于前沿技术的判断,但整场下来,真正触动我的,却是她对人生选择、以及AI时代人的自主性的思考。

访谈中主持人抛出了一个极具代表性的问题:既然大语言模型可以通过海量文本数据训练出强大能力,为什么不能用同样的思路训练机器人?这个问题恰好点出了当前机器人技术的核心卡点。嘉宾的回答一针见血:语言和物理世界,本质上是完全不同的数据形态。

语言是一种相对规整的数字信息,经过二三十年的互联网积累,已经有了海量的文本资源,输入输出边界清晰,一串字符对应一串字符,天然适合数据驱动的训练模式。所以当大语言模型的训练数据和模型规模达到一定阈值后,能力会实现快速跃升。

但机器人面对的是三维物理世界,它需要在真实空间中移动、触碰、抓取,应对摩擦力、遮挡、环境变化等无数不可控的变量,目前人类通过机器人采集到的真实操控数据依然极为匮乏,没有现成的大规模数据库可以支撑。

自动驾驶算是目前落地最靠前的广义机器人形态,但本质上汽车只是在相对二维的路面上行驶,自由度有限,核心任务只是规避碰撞。即便如此,头部企业也投入了十几年时间,耗费大量资源收集驾驶数据。而人形机器人的难度要高得多,它的核心任务恰恰是主动与真实物体交互:拿杯子、倒水、开门、协助他人、整理空间,每一个动作都需要和实物产生接触,接收物理反馈并调整后续动作。所以当前机器人真正缺失的,不只是更多的采集数据,更是对真实世界运行逻辑的深度理解。

那么该如何破解这个难题?嘉宾提出世界模型是可行的方向,并拆解了三层清晰的框架:

第一层级是渲染

也就是能够基于想象生成符合人类认知的视觉画面,比如当前主流的视频生成工具,都属于这一层的应用,它可以把脑海中的构想转化为可视化内容,但更多还是面向人类的展示用途。

第二层级是模拟

这一层需要模型理解物理规律,比如水流的轨迹、物体碰撞后的运动轨迹,到了这个阶段,世界模型不再只是生成画面,而是真正开始理解世界的运行逻辑,这对机器人来说至关重要,因为机器人需要在行动前预判结果,行动后解读反馈。

第三层级是规划

模型不仅要理解世界运行规则,还要能预测下一步的变化,并自主规划行动路径。自动驾驶需要路径规划,人形机器人的任务规划要求更高,比如整理桌面物品时,需要决定先拿哪个物件、放置的位置,还要预判动作是否会干扰后续操作,这些都不是单纯的画面生成可以解决的。

技术层面的判断我十分认同,但整场访谈真正打动我的,还是嘉宾后续分享的个人成长经历。

她提到,移民、科研工作者和创业者其实有着共通之处——都是踏入完全未知的全新领域,共同面对的都是不确定性。陌生的语言文化、未知的科学难题、没有确定结果的创业征程,都像是在黑暗的隧道中前行,不知道尽头在哪里,也不知道光亮何时出现。在很长一段时间里,只能依靠自身的热情、韧性和信念支撑着走下去。

很多时候外界看到的只有光环、报道和成果,但真正身处其中的人都清楚,大多数时刻我们面对的是未知、摇摆和怀疑,不知道下一步会走向何方。当被问及如果给年轻时的自己一句建议,她的回答是“不要那么害怕”。

出身东亚家庭的人往往容易陷入过多的自我怀疑,但回头来看,很多顾虑其实并无必要。她用“无畏”来形容这种状态:当你足够在乎一件事,以至于不会因为可能的失败而退缩,这就是无畏,也是她在招聘时最看重的特质。

回到AI时代的讨论,我们很容易陷入两个极端:要么认为AI无所不能,人类很快会被替代;要么觉得AI还很稚嫩,只是个玩具。嘉宾强调,AI可以变得越来越强大,但人的选择绝对不能交给机器。

当下总有声音宣称某项技术可以帮你完成所有事,可以告诉你该如何行动,甚至替你做出决定,但技术的本质应该是增强人的创造力和生产力,而不是剥夺人的自主权。用年轻人的话来说,AI只是一个工具。这次访谈我的女儿也在场,结束后她对我说,自己很喜欢画画,AI虽然可以生成图片,但永远替代不了她对绘画的热爱,也替代不了她亲手创作的选择。

这个道理放到企业层面同样适用。很多企业负责人都在询问,AI到底该如何落地?企业要不要进行原生AI的转型?应该从哪里开始?这些问题没有统一的标准答案,也不可能指望别人替你做出决定。

如果真的想要推动企业的AI变革,最终还是需要一把手亲自参与,深入理解技术、判断方向、组织团队,带着团队穿过这条充满不确定性的黑暗隧道。如果您也在思考这件事,却不知道第一步该如何迈出,不妨一起交流探讨。

以上内容不代表本平台立场,仅供读者参考