文章摘要
本文是对24岁中科大少年班出身AI研究者的访谈,该研究者曾在多家机构深耕大模型,博士毕业后放弃成熟大模型赛道,创业深耕仍未收敛、更具探索空间的具智能。其团队已完成全链路研发布局,他围绕具身智能技术、行业竞争、评估等议题分享观点,认为三年内家用机器人完成洗碗任务概率达80%。

一位从大模型赛道转向具身智能的年轻研究者,用自己的经历诠释了“风浪越大鱼越贵”的创业逻辑。这位24岁的创业公司核心负责人,早年就读中科大少年班,曾在微软亚洲研究院、深度求索、字节跳动种子团队深耕大模型领域,在博士毕业之际,他没有选择延续大模型赛道的成熟路径,而是转向了更具挑战的具身智能方向。

他坦言,自己想要离开的并非大模型本身,而是大厂中只能严格遵循既定计划的工作状态。具身智能领域目前仍处于高度未收敛的阶段,技术路线、评估标准和产品形态都没有形成共识,虽然风险更高,但也给了年轻研究者足够的空间去定义问题、探索方向。

本次访谈围绕具身智能的多个核心议题展开,从近期引发广泛关注的GPT-6 Astra谈起,讨论了通用大模型是否会对垂直具身智能创企形成降维打击,以及具身智能的技术研发路径、评估体系等关键问题。

该创业公司从HiFi-UMI数据集、具身基础模型、Agentic操作系统一直延伸到机器人本体,形成了全链路的研发布局。目前已开源2000小时的高质量训练数据,内部积累的数据集规模已达数万小时;其研发的基础模型已展现出一定的零样本泛化能力;Agentic操作系统则承担了连接上层用户意图与底层机器人动作的核心作用。

针对GPT-6 Astra直接驱动机械臂完成任务的演示,该研究者认为其展示的能力令人震撼,但也存在明显的局限。通用大模型可以承担复杂场景的理解与长程规划任务,但在真实动态的物理环境中,当出现杯子滑落、物体偏移等突发情况时,机器人仍需要具备快速反应的动作模型,也就是类似人类小脑的底层控制能力。GPT-6 Astra的单次推理耗时较长,演示视频往往经过多倍速快进,在静态环境中可行,但无法直接适配动态的真实场景。

针对“通用大模型厂商会击穿具身智能赛道”的观点,该研究者认为,通用大模型与具身智能的底层分工其实非常清晰:上层的通用大模型负责理解与规划,底层的动作基础模型则负责毫秒级的快速调整与敏捷反应,两者需要协同配合,而非单一的通用大模型就能覆盖全部需求。未来具身大脑的架构大概率会延续GPT类的通用架构,通过融入第一人称、第三人称的交互视频数据来强化物理世界的理解能力,这也是当前主流大模型厂商正在推进的方向。

访谈中也聊到了中科大少年班的经历,该研究者表示少年班的学生普遍具备强自驱力、思维敏捷的特点,对新知识的吸收和转化速度很快。少年班的选拔流程注重考察候选人在短时间内消化新知识的能力,以及面对未知场景的专注力,当年他所在的一届约有三十余名学生,最终从百余名复试候选人中选拔而出。少年班的经历让他避开了高强度的题海战术,大一通过基础通识课明确了自己的计算机方向,本科阶段就参与了AI for Science的早期研究,同时担任少年班班长的经历也让他锻炼了沟通和团队协作能力。

当被问及如何理解“聪明”时,该研究者认为,单纯的思维敏捷、学习速度快并不稀缺,真正的聪明核心在于两点:一是能够提出有价值的好问题,二是能够清晰认识到自己的不足,并愿意直面并改进这些不足。他自己的短板在于对硬件的理解不够深入,因此在创业过程中会主动向硬件团队请教,弥补自身的技术盲区。

谈及从大模型赛道转向具身智能的原因,该研究者表示,作为刚毕业的新人,他希望能够在一个可以自己定义研究方向的领域展开工作。当前大语言模型已经进入收敛阶段,大厂中的年轻研究员往往只能执行既定的计划,很难有机会探索全新的方向;而具身智能赛道仍有大量未被解决的关键问题,充满了突破的可能性。他也提到,导师曾鼓励年轻人要勇于尝试,即便失败也能积累宝贵的经验,而他本身对风险的承受度较高,认为风险与机会永远并存。

该研究者也分享了所在团队的工作氛围,公司没有强制加班的要求,正常工作时间为9:30到18:30,员工可以根据自身情况灵活调整工作节奏,公司也为员工提供无限制的AI工具使用额度,团队内部主要使用Codex等工具提升研发效率。团队注重事先规划,核心管理层会定期推演具身智能的核心需求、数据准备和算力匹配方案,同时保持扁平化的信息共享机制,确保团队成员都能充分获取必要的信息。目前团队规模超过70人,覆盖了数据、模型、硬件、产品等多个方向。

在谈及HiFi-UMI数据集的研发时,该研究者介绍,团队最初尝试采购现成的数据采集设备,但发现市面上的设备无法满足预训练所需的精度和时间同步要求,因此自研了一套高精度的UMI手套数据采集系统。这套系统通过六路相机实现无盲区的视觉采集,包括头部的双目相机和手腕部位的上下双视角相机,彻底抛弃了传统的基站定位方案,通过自研视觉方法实现了毫米级的定位精度,同时在源头上保证了微秒级的时间戳同步,避免了后续补正数据带来的误差。团队还通过真机测试和仿真复现验证了采集数据的训练价值,目前已经建立了标准化的自动化数据清洗管线,提升了模型的学习效率。

针对即将发布的具身基础模型,该研究者透露,模型在预训练后已经展现出较强的零样本泛化能力,无需额外的后训练微调就能完成全新的任务。这一能力的核心在于高质量的预训练数据,团队通过构造能够激发上下文利用的样本,并在模型层面优化了时序建模和注意力机制,解决了长上下文带来的推理延迟问题。他还提到,团队并没有刻意追求世界模型的概念,而是从核心能力出发设计架构,吸收了包括动作基础模型、视觉语言模型在内的各类技术的优势。

对于具身智能中的上下文理解能力,该研究者将其分为三个层级:短时上下文负责高频的因果学习,比如抓取杯子打滑后重新调整的闭环过程;中时上下文负责工作记忆,比如在抓取多个相同物体时复用之前的经验;长时上下文负责长程任务的记忆,比如在做家务时记住物品的存放位置。当前很多具身模型都忽视了上下文蕴含的物理因果关系,而这正是具身智能的核心能力之一。

在被问及HiFi-UMI数据集是否包含触觉数据时,该研究者表示,目前开源数据集没有包含触觉数据,主要出于两个工程考量:一是二指夹爪配合双视角相机已经可以通过视觉判断夹紧状态,无需额外的触觉传感器;二是当前工业界的触觉传感器尚未形成统一的标准,不同设备的分辨率和点位差异较大,大规模采集的触觉数据可能在硬件迭代后无法复用,因此团队暂时将触觉数据的采集放在实验阶段。

关于具身智能的Scaling Law,该研究者表示,团队确实观察到数据多样性、数据量和算力扩展后模型性能有显著提升,但严格意义上的Scaling Law需要严谨的实验验证,目前团队更倾向于称之为存在一定的幂律规律。预训练数千个任务后,不仅头部的高频任务具备泛化能力,甚至占比仅0.1%到0.5%的低频任务也能取得不错的效果,同时模型还展现出跨任务的组合泛化能力,比如将“把遥控器放进盒子”和“把零食放进垃圾桶”的经验组合到“把零食放进蓝色盘子”的新任务中。

该研发团队推出的Agentic操作系统是一个完整的具身智能系统,包含语音识别、任务拆解、工具调用等核心功能,分为两层架构:System 2负责语义理解和长程规划,类似人类的大脑;System 1负责高频精准的动作执行,类似人类的小脑。当前系统使用字节跳动种子团队的模型进行上层规划,未来将逐步替换为自研模型,现阶段的策略是将底层的动作模型做到高度可控,配合优秀的交互框架,借力行业前沿的大模型能力来加速商业化落地。

针对具身智能领域缺乏公允评估基准的问题,该研究者表示,当前的仿真基准往往依赖后训练微调就能取得高分,缺乏实际参考价值,而结合仿真与真机的基准又存在仿真到现实的差距,且不同硬件平台的真机测试难以复现。现阶段最扎实的评估方式是自建严密的真机测试集,从简单到复杂的场景逐步测试,公开真实的成功率,并且如实披露模型的训练数据和微调情况,保持评估的真实性。

在谈及全球具身智能领域的最新进展时,该研究者表示,最认可Generalist团队的研发思路,其通过逐步扩大数据量验证了Scaling规律,从GEN-0到GEN-1.5的迭代展现了出色的上下文学习能力;另外Levine教授团队关于π0.7的研究也证明了可控性对于具身智能的重要性。他也提到,部分团队为演示专门训练的上下文学习方案存在被高估的情况,只有建立在深刻的上下文理解和强可控性之上的上下文学习才有实际价值。

该创业公司的第一性原理是不断追问“到底什么是具身智能的智能”,机械臂按照固定轨迹抓取杯子并不算真正的智能,真正的具身智能应该具备在光线扰动、未知物体、物理打滑、全新指令等场景下,依然能够自如感知、理解并达成目标的能力。团队也暂缓了大规模采集第一人称人体视频数据的计划,因为这类数据的标注和微调成本极高,且泛化收益尚未经过严谨的验证,而自研的UMI数据采集方案成本可控,且能够清晰验证参数与数据的配比规律。

在国内团队中,他最看好字节跳动种子团队和阿里通义千问团队的具身智能研发,前者在多模态领域积淀深厚,后者在内部的具身方向布局深入。当被问及少年班同学的近况时,他表示很多同学前往美国攻读数学、物理等基础学科博士,其中不少人转向了AI相关领域,包括AI交叉学科、量化、AI医疗制药等,甚至有同学加入了OpenAI从事理论研究,几乎没有同学选择完全脱离AI的非主流方向。

访谈的最后,他也和访谈者探讨了做播客与投资的异同,认为两者的相似之处在于都需要花时间深入了解一个人,通过提问看清对方的本质;不同之处在于做播客时会尽量保持温和,避免让对方感到不适,而投资时则需要尖锐的提问,逼对方暴露真实的状态。

当被问及三年后机器人是否能够完成洗碗等家庭任务时,该研究者表示概率高达80%,他提到自己的导师曾提到家庭洗碗机需要人工倒掉残渣、摆放盘子,每天花费二十分钟的痛点,如果自研的机器人能够稳定完成这类家庭任务,将是具身智能落地的重要里程碑。

这位年轻的研究者认为,具身智能赛道虽然充满挑战,但正是这种未收敛的状态带来了大量的创新机会,而团队将坚持从第一性原理出发,打造真正具备智能的具身机器人产品。

以上内容不代表本平台立场,仅供读者参考