文章摘要

近一年来,具身智能赛道吸引了大量资本与关注度,据行业观察统计,截至2026年6月中旬,国内该赛道累计融资规模已达438亿元,接近2025年全年融资额的八成。

当前赛道的落地尝试覆盖了家用陪伴、商业导览、工业产线等多个细分场景,但从演示demo到规模化量产部署,两者之间存在不小的鸿沟,并非所有场景都能顺利跨越,仅盯着具身智能的泛概念显然过于宽泛。

那么究竟哪个场景最接近批量落地?答案无疑是工业领域。

工业场景:具身智能落地的最优赛道

不少人听到工业场景会觉得门槛高、技术要求严苛,但对于具身智能来说,工业生产的落地难度反而低于生活场景。工业场景中的取放、搬运、插拔等动作重复度高,任务边界相对清晰固定,不像家用场景中会频繁出现宠物、玩具、陌生访客等不可控变量,因此更容易在短期内实现集中突破,成为具身智能赛道中进展最快的细分领域。

据官方税务统计数据,2026年1-5月,全国工业企业购进具身智能机器人的总金额同比增长了2.3倍,企业的采购重心正在从购买demo演示转向实际产线部署。

如果说上一轮AI浪潮的核心主角是「会对话的大模型」,那么这一轮的主角则是「能落地干活的具身机器人」。

但机器人能否真正胜任工作,无法仅通过对话或演示视频验证。无论模型参数规模多大、论文指标有多亮眼,机器人是否能在真实产线稳定运行,最终都要在产线上得到检验。这也意味着,具身智能赛道的竞争核心,是谁能率先将机器人送入工厂并实现持续运转,单纯比拼模型参数规模无法建立长期竞争优势。

但同时也需要明晰,此前进场的传统工业机器人,其模式仍不能称为具身智能的工业化落地。焊接、搬运、喷涂这类固定动作,传统工业机器人早已运行得又快又稳,但它们面前仍有两堵绕不开的墙:

  • 一堵是硬件:结构固定,换一个工位、换一种物料,就要重新设计;
  • 另一堵是软件:动作靠预先编程,看不懂场景、听不懂指令,更不会举一反三。

过去几十年,工业自动化的边界被死死圈在「重复、固定、大批量」三个词中。打破这两堵墙,正是本轮技术浪潮要解决的核心问题。

为此,机器人需要先看懂当前场景的任务要求,这是认知判断;再准确完成动作执行,同时还要在无人值守的情况下稳定运行足够长时间,不能频繁故障。这背后需要一整套完整体系,从认知判断到动作执行,再到长期稳定运行,每一个环节都必须达标。

全栈模型体系,打通工业落地全链路

要覆盖工业落地的复杂流程,单一模型往往难以兼顾所有环节。近期专注工业具身智能商业化落地的安努智能,一口气推出六款模型,覆盖数据生成、认知理解、训练进化、动作执行、端到端部署等全链路环节,构建了从数据到落地的完整技术闭环。这六款模型分别是实时长视频生成模型Helios、软物体仿真平台SimLab、让世界模型对动作后果负责的ActiWorld、强化学习工具EvoHIL、工业垂类模型AnuVerse-0.5,以及端到端部署系统Nexus。

Helios:具身智能的基础技术底座

Helios是安努智能推出的实时长视频生成模型。传统视频生成往往存在生成速度慢、时长有限、画面易崩坏等痛点,Helios通过底层架构创新实现了显著突破,不仅支持分钟级长视频的实时生成,在单张H100 GPU上就能达到19.5 FPS的推理速度。

值得注意的是,Helios最初并非专为具身智能设计,但其解决的长时序建模、持续生成、实时推理、高效视频生成等核心问题,恰好是当前具身智能与世界模型的基础刚需,目前已被多家头部具身智能与世界模型团队采用,成为该领域的关键技术底座。

SimLab:破解软体物体仿真难题

ANU SimLab则聚焦软物体操作仿真。工业场景中的刚性物体仿真技术已经相对成熟,但物流分拣、快递包装等任务中的软体物体,其褶皱、光线变化都会让传统物理引擎难以精确建模,识别难度大幅提升,这类软体仿真至今仍是行业攻坚的难点。

安努SimLab已在物流软包裹分拣抓取数据生成、工业设备热视觉数据生成等实际项目中完成落地验证,甚至可以通过百元级机械臂、零真实标注跑通全流程。其核心是自研的软体和热学物理求解器,配合基于Isaac Sim搭建的合成数据工厂,以及经过真实机械臂验证的sim2real迁移方法,将仿真训练的能力迁移到真机上,再搭配自研的数据采集套件,共同构成了向上层输送训练素材的数据工厂。

ActiWorld:让机器人提前预判动作成败

ActiWorld的核心目标是让世界模型对自身动作的后果负责,让机器人在执行动作前就能预判失败概率。当前主流的世界模型技术路线,有的聚焦物理规律,有的关注空间预测,也有平台化路线方案,但这类模型往往存在一个共性问题:画面视觉效果真实,并不代表其能准确匹配机器人的动作意图,一旦画面对动作变化不敏感,再逼真的视频也无法支撑决策,这种偏差在操作任务中尤为致命。

因此,ActiWorld将研发重点放在动作后果的可验证性上,不再单纯以视觉效果和流畅度作为模型评判标准,而是从动作、时间、空间三个维度同时发力,确保模型预测的画面包含足够的动作信息以区分抬起、推动等不同操作,确保当前状态既能承接历史信息又能准确预测未来,同时让模型的注意力集中在真正发生变化的区域。

为实现这一目标,ActiWorld在训练阶段设计了三项约束:一是逆动力学头,从相邻预测结果中反推动作意图;二是双向预测,训练时保留当前观测作为参照,要求模型同时还原历史与预测未来;三是运动加权,根据相邻真实画面的差异计算运动区域权重,强制模型聚焦变化区域。这三项约束仅在训练阶段生效,推理环节仍采用标准接口,不会增加额外成本,且兼容现有动作条件扩散骨干网络。

除了优化画面表现,ActiWorld还能提前预判动作方案的成败,帮助机器人筛选最优动作。测试数据显示,其对动作成败的判断与真实结果的偏差低于3.25%。在包裹二维码朝上放置的分拣任务中,原本的执行策略成功率仅为56%,加入ActiWorld的预演引导后,相对失败率降低了约13.6%。

相较于其他头部团队的世界模型,ActiWorld仅聚焦动作预判与失败预警,训练阶段固化动作逻辑,推理阶段无额外成本且不绑定特定机器人本体,正是工业落地所需的「提前预判」能力。

RoHIL与EvoHIL:让机器人稳定适应产线变化

光有预判能力还不够,机器人在实际产线运行中还会面临更多棘手问题,比如光照变化就可能导致动作失效,这正是RoHIL和EvoHIL两代真机强化学习技术要解决的痛点。在该框架下,机器人仅需30分钟训练就能达到满分水准,跨光照场景无需重新采集数据,奖励标准也无需人工离线重新标注,系统会根据人工确认的成功样本自主迭代,无需停线重训。

以USB插入这类精密任务为例,其成功率可达100%,当光照条件完全偏移时,需要人工介入的比例仅为1.32%,不到传统方法的十分之一。RoHIL通过重新打光世界模型,让机器人在任意光照条件下都能保持稳定判断,跨光照部署成功率达到100%。

除了光照变化,产线工位更换、任务调整也会导致训练好的模型失效,若依靠人工离线标注、停线重训解决,成本极高。此时就需要机器人具备自主进化能力,EvoHIL正是为此打造:它为奖励模型、动作生成器、视觉感知模块赋予自适应能力,让模型自主判断动作完成质量,无需人工离线标注与停线重训,就能适应新工位、新光照环境,自主生成新动作方案进行尝试。

真机测试显示,搭载EvoHIL的机器人在6类典型工业任务中的成功率大幅提升,同时训练、迁移与奖励设计的整体成本在同等规模部署下可降低约80%。

AnuVerse-0.5:工业场景的动作执行核心

上述模块尚未触及动作执行层,真正落地到动作环节的是工业垂类模型AnuVerse-0.5。该模型采用视频专家预测画面、动作专家输出动作的MoT架构,基于14B参数的Helios开发,推理速度可达百毫秒级,仅需一张桌面级显卡就能运行,在部署成本与运行速度上都适配产线边缘场景。从这套体系可以看出安努智能的落子逻辑:数据、判断、执行三个层级,分别对应工业落地过程中的各个卡点。

Nexus:打通产线部署最后一公里

模型研发完成后,落地部署是另一大关键环节。安努智能推出的Nexus端到端部署系统,解决了不同品牌机器人形态各异、多种模型调度复杂的痛点。不同品牌的机器人硬件架构不同,搭载的模型也可能存在差异,若每次更换场景都要重新对接底层控制系统,部署效率将大打折扣。

Nexus统一了模型与不同机器人之间的调度逻辑,让VLA、世界动作模型等不同端到端模型都能快速上线部署,具备快速部署、自主调度、资源汇聚三大优势。此外,真实产线对安全稳定性要求极高,机器人误操作可能带来巨大损失,因此Nexus内置了基于动作层面的安全防护机制,规避这类风险。

同时,工厂通常已有成熟的生产管理系统,机器人的工作状态需要被监控与管理,Nexus已打通SAP的EWM和Joule系统,让机器人能够无缝融入工厂原有生产管理流程。不仅如此,产线上机器人的运行数据还会回流到底层数据环节,形成闭环:Helios与SimLab生成数据,ActiWorld负责动作预判,RoHIL与EvoHIL实现机器人技能进化,AnuVerse-0.5负责动作执行,最终真实运行数据回流到底层数据基座,用于下一轮模型训练,让整套体系实现持续运转与进化。

部署经验:真正的长期护城河

安努智能的这套模型体系还有一个独特之处,就是其研发路径与行业主流不同。多数具身智能公司的打法是先打磨模型,再带着模型寻找落地场景,但安努选择了相反的路径:没有一味追求通用基础模型的规模,而是先让工程师进驻真实产线。

安努智能董事长兼CEO文宏杰曾表示,此前评估公司往往优先看技术路线、团队背景、市场空间与资本效率,但进入工厂实地工作后,他对具身智能的理解发生了彻底改变。他认为,模型能力会随着行业整体进步持续外溢,单项技术指标优异并不足以保证整套系统在产线长期稳定运行,只有产线部署经验会越积累越深,成为企业的核心竞争壁垒。

这一判断后来也得到了行业验证,近两年越来越多的具身基础模型开源,没有自研模型的公司也可以基于开源模型进行开发,安努智能正是通过这种方式,仅用数月就补全了认知底座与动作模型。模型可以依靠开源获取,但产线部署经验必须通过实打实的现场积累才能获得。

这一观点也得到了高盛8月底发布的全球具身智能研究报告的印证,报告指出,机器人走路、导航等能力可通过仿真训练解决,但柔性物体操作、工具使用、精细抓取等任务本质上无法通过仿真完全覆盖,因此真实产线与场景的部署数据始终稀缺,这类由部署产生的专有数据才是机器人公司的长期护城河,比模型代码、机器人硬件外形更具持久性。

为积累这类经验,安努的工程师直接进驻产线,收集并解决实际问题。比如在富临精工的产线中,曾出现实验室中成功率100%的抓取任务,搬到车间后仅因顶灯角度改变,成功率就跌到40%,这类场景问题很难在论文、开源模型或数据集中找到,但却是产线的常态。

安努内部将这种工作方式称为FDE(前沿部署工程):驻场阶段工程师解决具体问题,项目结束后人力撤出,但可复用的产品能力会被保留下来。工程师将踩过的坑沉淀为可复用的技能包,后续同类场景可直接复用。这种模式的效果立竿见影:富临精工的第一个工位部署花了4个月,而有了沉淀的技能包后,同类型工位仅需3天就能完成部署,且设备平均故障间隔时间达到300小时以上。

先部署再补模型的策略,让安努将原本用于实验室的时间提前投入到产线经验积累中,当模型环节补全时,安努已经掌握了同行尚未积累的部署know-how。这些经验不会随模型开源贬值,反而会随着机器人进入更多工位、更多工厂而不断增厚。正如文宏杰所说:「当新增一台机器人带来的软件收入增长,快于交付人力的增长,公司才真正进入规模化阶段。」企业能否达到这一阶段,依靠的正是产线中积累的实战经验,这也将成为未来具身智能赛道拉开差距的核心因素。

Q&A

Q1:你们敢说「全栈闭环」的底气是什么?

答:我们选择了一条兼具挑战但更贴近商业化的路径:将通用基座模型的「动作精度」打磨到工业产线愿意买单的标准。我们基于通用基座模型,融合富临精工、英特尔等产线回流的真机数据,搭配SimLab仿真平台与Helios生成的长尾数据进行联合训练。经过ActiWorld校验动作、筛选有效样本后,送入具备抗光照、高鲁棒、自主进化专利的RoHIL/EvoHIL强化学习系统完成迭代;再通过模型蒸馏将能力沉淀至端侧小模型AnuVerse-0.5,实现百毫秒级实时响应;最终由Nexus系统完成产线一键规模化部署。

安努的核心壁垒并非从零搭建世界模型,而是在通用基座与真实产线之间构建「检验-学习-执行-落地」的技术闭环。上游重研发、重算力的基座由头部厂商深耕,下游真实场景应用数据来自客户,安努聚焦中间层,让机器人在工厂真正落地,实现比人工更稳定、成本更低的运行效果,这就是我们「全栈闭环」的底气。

Q2:如果本体厂商自己下场做工业场景怎么办?你们会不会被吃掉?

答:参照笔记本电脑、智能手机再到新能源汽车的产业发展路径,能成长为行业巨头的主机厂,走的无一不是扶持生态伙伴的路线。唯有相互依存、双向赋能,才能把产业规模真正做大。我们和本体厂商的关系,也正是如此。

本体商需要有人去证明「我的基座在工厂真的跑得起来」,我们则需要他们的本体和算力支撑;我们在垂直场景沉淀的工程化know-how成果,也会反哺优化基座模型,实现双向增益、生态共赢。就像英伟达自己不开发游戏,但几乎没有游戏公司能脱离它的技术底座。基座越通用、底层能力越强,安努作为垂直场景公司打磨出的行业方案价值就越高。

Q3:你们的工业数据壁垒到底有多深?别人拿同样基座微调不也能做?

答:数据壁垒不在「量」,在「质」和「闭环速度」。其一,我们的数据全部源自真实产线:我们联合富临精工、英特尔等伙伴深耕产线超一年,沉淀了深度的工程化交付及标准化产品的know-how;其二,真机数据成本高、周期长是行业普遍痛点。我们依托SimLab仿真平台与Helios打造了安努独有的工业长尾数据生成管线,以远低于行业的成本生成物理一致的合成数据,再经真机回流校验,形成「合成-真机校验-再合成」的正向飞轮;其三,Nexus部署系统是数据飞轮的核心入口:机器人部署越多,回流数据越丰富,模型精度越高,后续部署越高效,形成滚雪球式正向循环,先发者将占据全量优势。

Q4:你们团队这么小,同时推进这么多重研发模块,执行力怎么保证?

答:我们不是每个模块都从零自研,而是精准卡位+生态借力+端侧应用轻研发:

  • 世界模型基座 → 采用本体厂商开源/授权版本;
  • 3D视频生成 → 联合北大、字节、Canva共同研发;
  • ActiWorld → 与香港科技大学(广州)共同研发;
  • 强化学习框架 → 联合重庆大学及香港大学。

安努将研发攻坚集中锚定两大核心:AnuVerse 0.5端侧垂直小模型与Nexus端到端部署系统。前者是工业垂直场景的核心执行能力,后者是客户真正的付费价值所在。正因坚持应用端轻量化研发路线,安努团队无需臃肿配置,也没有巨额算力投入,既不追逐论文的学术热度,也不跟风布局通用AGI赛道。场景和任务足够聚焦,团队的执行效率才会更高。

Q5:目前有实际订单吗?客户付费意愿到底怎么样?

答:有,而且不是POC(概念验证)。富临精工绵阳工厂的料箱搬运场景,已经是批量订单在跑了。制造业客户付费逻辑很直接——算ROI。我们的机器人一机多岗靠Nexus调度,换线不重新示教(RoHIL零额外交互),单班回本周期能压到12-18个月,比传统工业机器人便宜40%以上。

Q6:Cosmos 3这类通用世界模型加上ICL技术继续发展,对安努到底是冲击还是机会?

答:Cosmos 3+ICL的发展对通用模型公司也许是杀估值的事,但对安努的部署态则是效益放大的杠杆,而不会是威胁。通用基座越强,越能把「通用推理」变成水电煤一样的基础设施。武器免费了,扣扳机的人和靶场就会变成稀缺资产。

安努的壁垒从来都不是「再造一个世界模型」,而是在工业现场的真机数据飞轮、工艺约束建模、以及从仿真到产线365天不停转的部署能力。Cosmos再强,也解决不了「这个工位敢不敢用、稳不稳、停机一小时赔八万谁担责」的问题。所以我们的叙事不是「我们也有世界模型」,而是「我们把世界模型接进了工厂,保证它真的能用、敢用、持续用」。

长期看,具身智能的竞争将从「谁的模型更聪明」转向「谁在真实产线里跑得更久、ROI更高」。而后者,正是我们过去两年在富临精工等客户现场已经被真实工业产线验证过的核心壁垒。

以上内容不代表本平台立场,仅供读者参考