忆生科技构建自主智能底座,推动AI 2.0时代

7月底,一家专注自主智能的科技公司正式推出两款核心工具,直击具身智能产业的数据痛点——无需穿戴设备的纯视觉真机遥操系统,以及高精度的第一视角手物数据采集方案,这两款产品不仅刷新了行业采集效率,更从底层重构了具身智能的数据获取逻辑。
这家名为忆生科技的企业由全球顶级AI专家、香港大学计算与数据科学学院创始院长马毅教授联合团队于2023年创立,不久前刚完成数亿元天使轮融资,投资方涵盖产业资本与国资平台。马毅教授是计算机视觉领域最高荣誉马尔奖得主,也是IEEE、ACM、SIAM三料Fellow,拥有二十余年视觉感知与智能系统的理论积淀,长期与全球顶尖学者合作探索下一代人工智能形态。
直击行业痛点的双产品矩阵
忆生科技的产品布局围绕具身智能的全链路展开,此次发布的两款核心产品是其数据底座层的关键组成部分,配合后续的运动控制小脑、视觉感知大脑两大模块,形成完整的技术闭环。
当前具身智能的训练数据采集存在明显的两难困境:真机遥操作由真人控制机器人完成动作采集,数据质量最高可直接用于大模型训练,但成本极其昂贵,比如某知名项目动用50名采集者耗时一年才积累350小时有效数据;第一视角采集通过头戴设备记录人类日常活动,相对容易扩量,但容易缺失精确的三维动作信息,且存在人机本体差异;仿真数据在虚拟引擎中生成,成本低、规模大,但存在仿真到现实的鸿沟,复杂受力、柔性物体的模拟难度极高。
据行业观察,当前数据采集赛道看似拥挤,但多数玩家仍停留在设备代工与众包的硬件生意模式,忆生科技则通过算法实现了降维打击,彻底重构了物理AI的数据获取成本结构。
针对这些痛点,忆生科技的两款产品从两个维度同时破局:
- EngramTeleOp:主攻真机遥操的降本,通过纯视觉算法替代传统的穿戴式动捕设备,大幅降低采集门槛与成本
- EngramEgo:聚焦第一视角数据的提质扩量,通过高精度的三维重建算法,将人类日常操作转化为可用的机器人训练数据
EngramTeleOp:把动捕从硬件问题变成算法问题
传统的灵巧手动捕方案主要依赖额外的传感器硬件,包括电磁式、拉伸传感器式、惯性式和外骨骼式,每一种都有明显的短板:电磁式手套精度高但价格昂贵、易损坏且需要全程穿戴;拉伸传感器式出货量大但精度受材料迟滞和手型差异影响严重;惯性式依赖加速度积分,存在漂移累积的硬伤;外骨骼式精度不错但结构臃肿、穿戴负担大。这些方案的核心问题是依赖硬件堆砌精度,规模扩大反而会提升单位成本,采得越多成本越高。
EngramTeleOp选择了完全不同的技术路线:纯视觉算法。操作员仅需佩戴VR头显,无需任何手套、手柄或其他穿戴设备,系统通过摄像头实时捕捉操作员的双手动作,再转化为机械臂的控制指令。这一路线让硬件成本大幅下降,但也带来了算法层面的两大核心挑战。
第一个挑战是手部位姿重建,也就是精准识别并重建操作员双手的完整三维姿态,精确到每一个手指关节的角度与位置。忆生科技的算法可以实现这一目标,目前数据精度介于拉伸动捕手套和电磁式动捕手套之间,且还在持续优化。
第二个也是最难的挑战是动作重定向,也就是让不同结构的机械手做出和人类动作一致的操作。传统的点对点映射方案依赖固定的查找表,遇到陌生姿态就会出现错位、失控的问题。忆生科技自研的“生成式小脑”算法摒弃了这种死板的映射方式,通过学习人手与机械手之间的内在运动规律,生成连续的映射曲面,能够适配不同手型的操作员,无需逐人标定,也无需针对每款机械手重新开发适配方案,实现一次训练、无限次复制,边际成本仅取决于算力。
目前,EngramTeleOp的有效数据率已从约30%提升至90%,单人日产能提升30倍,硬件成本降至传统方案的五分之一。此外,该系统还支持全身多自由度遥操,延迟低于10ms,能够实现跨机械手本体适配,支持跨省跨国的千公里远程操控,完成旋拧、精密对位、柔性物体操作等高难度精细任务,标定时间仅需5分钟,实现三步快速部署。据团队透露,目前公司在该领域的前沿理论研究论文也已进入国际顶级会议评审,实现学术与工程双线并进。
EngramEgo:从关键点到完整几何重建
如果说EngramTeleOp解决的是“精”的问题,那么EngramEgo则聚焦“多”的需求。传统的低成本第一视角设备虽然可以记录人类工作,但标定漂移、遮挡和同步丢帧会造成约30%的废片,且普通视频很难准确还原手部三维结构、物体姿态和接触过程。
EngramEgo的最大技术亮点在于,在执行者视角完成数据采集后,系统通过3D网格重建、CUPID遮挡物体生成式重建和4D手物交互重建算法,将普通视频转化为结构化的物理训练数据。
具体来看,该系统的重建覆盖三个核心维度:首先是手部,输出的不是离散的关键点,而是连续曲面网格,单手包含778个顶点,双手总计1556个顶点,实现了从数十个坐标到上千顶点的表示能力跨越;其次是全身,除了手部数据外,还同步输出全身骨架与人体网格,覆盖头、肩、躯干、腿、足,满足机器人移动、操作等多自由度任务的训练需求;最后是物体,能够还原物体的三维重建与六自由度位姿,完整记录物体的运动交互信息,解决了传统第一视角方案缺失空间信息的痛点。
这套4D手物交互算法可以从第一视角视频中完整恢复“手在哪里、物体如何运动、双方何时发生接触”,并将人类动作迁移到自由度与关节结构完全不同的机械本体上,是将日常操作转化为机器人训练数据的关键一步。
目前,EngramEgo的手物交互重建生成算法领跑全球,最新研究成果将W-MPJPE误差压到41.77毫米,比此前最好结果降低27.8%。其物体与位姿联合建模的生成式三维重建CUPID算法已入选顶会CVPR 2026 Highlight,第一视角传感条件下的人体与手部运动估计EgoAllo算法也已发表于CVPR 2025。
在硬件参数方面,EngramEgo采用四颗全局快门相机、IMU与300度水平视场,以60Hz记录操作过程,整机约350克、续航约8小时,端侧支持6路同时采集。轻量化的硬件设计让数据采集具备了规模化的可能,使用者不需要手套、不需要机器人硬件适配,只需在真实场景中正常操作即可产生高质量训练数据。
从数据采集到自主智能的完整链路
忆生科技的布局远不止数据采集这一环节,其真正的核心是构建自主智能的完整闭环。公司创始人马毅教授提出,真正的智能必须像生命一样,在“感知-记忆-预测-交互”的闭环反馈中学习,而当前的生成式大模型大多依赖静态数据训练,完成训练后知识与能力基本固定,无法根据行动结果主动修正认知。
忆生科技CTO杨言超提到,当前行业普遍面临数据采集效率不足的问题,按现有速率,人类攒够ChatGPT级别的机器人交互数据需要10万年,但只要将采集效率提升一个数量级,这个时间就会降到1万年,再提升一个数量级,问题的性质就会发生根本改变,“我们的目标是把这个时间降到100年,甚至10年”。
忆生科技模拟人类智能构建了“大脑+小脑”的统一架构:大脑的“视觉记忆”模块模仿人眼,获取并理解外部环境的物理模型,进行复杂推理;小脑的“肌肉记忆”模块模仿人手,通过运动控制获取并改善本体模型,生成高频、稳定的运动控制策略。两者形成的闭环是:大脑感知环境并预测行动方案,小脑执行动作,再将执行结果反馈给大脑,由大脑修正判断,实现持续进化。
这套架构的核心是建立在记忆机制之上的世界模型,这也是公司名字“忆生”的来源。有记忆才能积累经验,能预测才能理解交互后果,能持续学习才能适应变化的环境和任务。忆生科技通过双模型并行切入世界模型与具身智能:自主构建并持续进化的物理世界模型,对应大脑的视觉记忆,刻画空间几何结构;以及具身决策控制模型,对应小脑的肌肉记忆,记录交互时序规律。
此次发布的两款产品正是这条闭环链路的前端:EngramTeleOp与EngramEgo负责双线采集高质量交互数据,解决“训练数据从哪来”的问题;后续的运动控制小脑模块将遥操作数据提炼为可复用的运动记忆;视觉感知大脑模块则让机器人记住物体、位置与空间结构的关系。数据在闭环中流转,模型在记忆中进化。
忆生科技并不直接制造机器人本体,但通过“数据入口+记忆系统+世界模型”的全链路工具链,让任何机器人本体都能接入这套能够理解物理世界、保留长期记忆并持续自我修正的自主智能系统。CEO石志儒在采访中提到,很多伙伴误以为公司是数据采集服务商,但实际上他们是专注自主智能与可持续学习世界模型的企业,两款产品只是算法能力的自然延伸。公司的终极目标是赋予机器智能,构建能从开放世界中自我纠错、持续进化的“硅基生命”。
据忆生科技透露,目前公司的数据与算法能力已在多家头部人形机器人企业、一线运控上游企业完成运动控制与灵巧操作适配,验证了跨异构本体技能迁移的通用性;并正与制造业头部企业探索高柔性敏捷装配的落地。
行业趋势与未来展望
过去两年,具身智能行业的主旋律是“从0到1”,大家的焦点集中在如何造出具备基础运动能力的机器人本体,本体形态、自由度、关节性能等参数成为资本与市场的主要评价标准。而进入2026年,行业竞争的重心开始向后移动:机器人能否进入真实场景、能否产生实际价值、能否真正拥有智能,成为新的关注重点。
根据行业预测,2026年中国人形机器人产量将同比增长94%,全球人形机器人产业也将在下半年进入商业化关键阶段,评价重点从“基础运动能力”转向“可量化的用户价值”。但相关研究报告显示,机器人在仿真环境中的操控成功率可达89.4%,而在真实家庭场景中这一数字仅为12%,如何将仿真能力迁移到真实场景,依然是行业的核心挑战。
忆生科技的技术路径在此时凸显优势。相较传统的VLA模型,忆生科技基于记忆的生成式小脑架构在多任务平均表现上提升3倍以上,且能用单一模型高质量完成多项任务,成功率超过95%。其核心的记忆机制能够捕捉任务背后的物理与语义结构,实现机器人/灵巧手跨本体的技能迁移。
“数据荒”是眼下具身智能行业最紧迫的问题,但随着产业与资本的持续投入,这一问题终将得到解决。而忆生科技的“感知-记忆-预测-交互”完整链路及其独创的自主学习记忆机制,才是这场技术变革的真正核心。当前具身智能产业的竞争已经从单一的机器人本体,进化到“本体-数据-模型-场景”组成的完整体系,忆生科技的技术路线将从底层重塑机器自主智能的底座,推动具身智能走向真正能够认识世界、积累经验和持续成长的AI 2.0时代。


