文章摘要
当前大语言模型擅长语言处理,却缺乏对物理世界的认知、推演与决策能力,在防灾应急等领域短板凸显。行业已形成共识,空间智能导向的世界模型是AI发展的下半场。国内飞渡科技研发的全栈空间智能“峥嵘大模型”,已实现物理世界推演决策落地,获得产业与资本一致认可,行业评价标准正从视觉生成转向实用决策。

过去三年,人工智能在语言理解领域取得了突破性进展,但一个致命的短板始终存在——它依然无法真正理解我们身处的物理世界。

大模型缺乏通向物理世界的有效通路,这绝非危言耸听。

2026年7月,中国南北同时遭遇严峻洪涝考验。南方地区受台风与西南季风共同影响,广西多地遭遇破纪录强降雨,南宁市横州、宾阳等站点降雨量刷新历史极值,六蓝水库发生溃口。从监测到异常洪峰到溃口发生,留给应急指挥部的黄金处置时间不足30分钟;贵港郁江出现2001年以来最大洪水,洪峰水位超出警戒水位5.68米,一处教育园区积水最深接近三楼,上万名师生被困,全区紧急避险转移18.7万人。几乎同期,北方也面临极端降雨考验:台风巴威虽未直接登陆东北,但通过远距离水汽输送和外围云系制造强降雨,沈阳一个街道10小时降雨量达310.6毫米,接近这座城市半年的降水量,17条河流出现超警以上洪水,80多座水库超汛限水位。

这正是当前大语言模型的典型困境。即便将人类有史以来所有水利防灾文献全部喂给模型,它也能写出一份文采斐然的防灾指南,但在灾害面前,它无法回答最核心的几个问题:水从哪里来、往哪里去、几分钟后会抵达何处、会淹没哪些区域。这些关键信息不在文本语料中,而存在于真实的物理世界运行规律里。

AI擅长语言理解与文本生成,却缺乏对物理世界的认知、推演与决策能力。

极端天气频发的当下,这条短板正在转化为日益高昂的社会成本。城市内涝、流域洪水、山洪灾害年年考验应急管理体系,可水往哪里流、淹到哪里、优先救援哪些区域,关键决策仍离不开专业人员的经验判断;在低空经济领域,空域划分、航线排布、冲突判定依然依赖人工经验和静态图纸;具身智能领域中,机器人走出实验室后虽能感知物体与环境,但面对复杂动态变化,对未来状态的预测与推演仍不够可靠。

随着这类场景的不断涌现,行业对这条短板的认知已经从模糊的感知升级为清晰的共识。某行业研究机构发布的空间智能研究框架指出,空间智能是基于3D视觉信息进行理解、推理、生成与交互的AI系统,自动驾驶、3D生成、具身智能是其不同成熟度的应用领域,而世界模型正是空间智能发展的终局状态,也是人工智能发展的下半场。

所谓世界模型,是从海量数据中构建的对世界运作方式的内部表征,可以推理行动后果、预测未来状态。简而言之,谁能补上AI理解物理世界、推演决策的短板,谁就能优先拿到人工智能下半场的入场券。

2025年11月,相关领域学者发布长文,将生成、多模态和交互概括为空间智能世界模型的重要支柱。随后相关团队发布专用引擎,首次打通从生成世界到训练、评估、部署真实机器人的闭环;国内多所高校联合发起专业评测体系,推动世界模型从视觉生成迈向世界理解;国内科技企业也在权威评测榜单上轮番登顶。概念、评测、资本三股力量同时进场,说明这条赛道已经初步跨过了讲故事的阶段。

2026年9月,某团队发布新一代世界模型Atlas,被称为重大里程碑。该模型从零预训练,原生支持文本、图像、视频和3D四种模态,通过像素级精确的相机控制生成最长1分钟的1440p视频,还能从几张照片重建出点云和3D高斯泼溅的显式三维世界,将生成、重建、模拟整合进以3D空间为核心的模型中,构建起“世界模拟器”。

那么,我们真的从“生成好看的世界”转向“生成能用的世界”了吗?如果Atlas遭遇2026年夏天的那几场暴雨,即便它能从照片中重建河流的几何形状,它真的能够推演暴雨中河水的流向、溃口发生后下游哪些村庄需要优先转移吗?

目前来看,即便实现了像素级的三维空间视频生成,当前的世界模型仍存在明显短板:物理仿真、策略训练与效果评估仍属于独立的引擎管线,以3D高斯为代表的重建与生成类技术,核心目标还是把世界“拍得更真”,而防灾应急需要的是更早、更准、可验证的决策,两者之间还隔着仿真计算、动态边界、验证体系等硬工程环节。即便全球顶尖团队仍在攻坚上半场的技术,也恰恰说明,从生成到决策的下半场路径,是整个行业共同的缺口,也是行业共识形成的核心原因。演示视频中的世界模型越来越多,但真正能走进真实世界做决策的模型依然稀缺。

灾难从来不会等待技术成熟,几分钟的时间窗口里,一个只能生成逼真画面的系统帮不上任何忙。真正有用的系统,必须在灾害发生前,就将整条河谷乃至整个区域装进一个可推演的数字副本中。

这样的解决方案正在酝酿,而一个明确的信号来自国家级的创业舞台。

2026年8月26日至29日,HICOOL全球创业者峰会在北京举行。这是北京倾力打造的全球创业盛会,来自141个国家和地区的10209个创业项目、13472名创业者同台竞逐,两项数据双双刷新历史纪录。举办到第七年,HICOOL的行业分量来自其赛后成绩单:该生态已累计孵化5家上市公司、18家独角兽企业、219家专精特新企业,获奖项目赛后融资总额突破700亿元,其评选结果某种程度上就是产业风向的投票。

2026年的大赛一等奖颁给了空间智能与世界模型方向,获奖的是国家级专精特新重点“小巨人”企业飞渡科技,其获奖成果是自研的空间智能“峥嵘大模型”。在上万个全球项目的竞争中,产业评委将最重的一票投给了补上大模型通向物理世界短板的这条赛道。

资本侧的投票同样直接。在峰会的“对话硅谷传奇投资人”路演环节,知名风投合伙人担任评委,他长期深耕风险投资,其所在机构投资组合覆盖250余家企业,包括SpaceX、Airbnb等知名企业。就在一个月前的行业大会上,该投资人就曾表示,大语言模型热潮之后,判断AI初创企业的风投标准已经改变,他更加看好AI与物理世界结合的实体AI。一位见惯了硅谷顶级路演的老将更换了投资标尺,而其指向的方向,与HICOOL产业评委的选择惊人一致。

这两张投票背后的逻辑,值得深入拆解。飞渡科技给出的答案,是一套全栈的空间智能基础设施,这也是它与大多数演示型玩家的核心分野。

飞渡独创了一套称为3DT的统一数据标准,兼容百余种异构空间数据,支持PB级三维场景实时渲染,作为空间智能计算的核心底座。在数据底座之上是“峥嵘大模型”,这是国内首个通过国家备案的工业级空间智能大模型,搭建了“外观层-几何层-语义层-物理层-模拟层”五层技术栈,将视觉感知转化为可计算的物理推演能力,让真实的物理世界可以被精准推演和决策。这些计算在端侧通过元尊S800空间智能一体机实现,全栈国产信创架构保障了数据安全。

真实应用持续沉淀数据与反馈,并不断回流到模型训练与评估中,飞渡的数据飞轮已经开始运转:场景越多,模型越懂业务;模型越强,又能进入更多场景。

飞渡的思路与国际技术发展前沿高度吻合,相关学者曾将世界模型拆分为渲染器、仿真器、规划器三种功能,相关团队构建仿真器的目标,就是让生成的世界从“看起来真实”变成机器人可以进入的训练场。而飞渡更进一步,将空间智能的核心目标指向推演与决策。说到底,世界模型不是靠定义出来的,而是靠用出来的:渲染与生成只是上半场,推演与决策才是真正的下半场。

以城市防洪为例,过去的做法是等到暴雨预警或内涝已经发生后,调度人员才依据历史经验和静态图纸判断风险点、组织力量处置,整个过程属于事后响应。这是因为推演过程只发生在人的大脑中,机器无法在事前做出推理,更遑论做出科学决策。

建立空间智能基础设施后,气象、地形、管网等各类型数据可以在同一个平台上汇总,构建起城市的可计算数字副本。模型可以在数字空间中提前预演这场降雨,推演哪座立交桥下会先积水、积水有多深、影响周边哪些道路或小区、哪个泵站需要提前启动,所有结果都可以在降雨落地之前给出可检验的推演结论。调度方案可以先在虚拟世界中试错上万次,找到最优解后再下发到真实世界执行,决策从经验驱动转变为模型推演驱动。

决策从经验驱动变成了由模型推演来驱动。

这绝非纸面推演,飞渡面向洪涝灾害防御构建的推演链路,有三个核心环节最能说明“世界模型有用”到底意味着什么。其一,动态边界控制:当溃口发生、洪水漫溢、河道冲刷导致边界条件突变时,系统可以在秒级时间内感知变化、重构计算域、续接推演,实现推演不中断、结果不失效,最大程度保留决策窗口。其二,真实世界1:1验证:推演结果与实时监测数据逐时刻比对,偏差超过阈值立即在线修正,每一次验证误差都会沉淀为模型的经验数据。其三,智能体化的调度:被称为水利界首席参谋的智水AI与灵枢(SAGE)灾害模拟推演智能体,可以让用户只需要提出目标,比如“推演未来6小时洪水演进并给出最优调度方案”,系统便自动完成数据调取、模型选择、参数配置、计算推演、方案比选的全流程,并将结果翻译成决策者可以直接使用的建议:哪片区域会积水、积水深度如何、影响多少人、疏散路线如何、需要多长时间。

在北京某区的水库智能调度项目中,这套智能体经历了真实事件的严格检验。每一次推演都与历史真实事件库回放比对,系统由此获得持续进化的记忆能力,越用越懂业务、越算越懂场景、越做越会决策。依靠统一基准下的多场耦合并行计算,大范围流域的全域洪涝推演耗时可以从以天为单位压缩到分钟级;从降雨输入到淹没范围输出的全链条推演,数分钟内即可完成。

目标指向推演和决策的世界模型,不再追求更美观的重建结果,而是转向服务水利行业和应急减灾。其应用场景覆盖水旱灾害防御、山洪预警、智慧灌区调度、国家水网智能管控等全领域,可以基于无人机实时回传数据与AI重建,短时间内完成灾害现场厘米级精度的三维语义建模,还能动态模拟山体滑坡、泥石流、溃坝等灾害的演进过程,自动生成救援力量调度与人员疏散方案。其基于亚米级地形建模构建的暴雨洪涝仿真系统,已将灾害模拟分析的准备周期从传统的数月量级压缩到数日级别,实施成本更是降至原有方法的10%。

在中国,这样的模型和应用已经落地千余个项目,与传统方案相比,其优势不仅体现在效率上。经验会随着人员流动失传,但一个可计算、可验证、会进化的世界副本则会越用越聪明,这正是数据飞轮在真实场景中的体现,也是空间智能基础设施建设的真正意义。

这样一套空间智能基础设施不是一次性交付的软件项目,而是一种像水库、堤坝一样长期服役、持续增值的公共能力。建设这样的公共能力,在现实场景中开发工业级应用,正是中国的模型开发者们给出的核心答案。

统一底座加行业插件的架构,让这套能力可以低成本地泛化到各行各业:在低空经济领域,飞行器可以先在数字空间推演万次,再在真实天空安全完成首次飞行;在具身智能领域,机器人装上空间大脑后,可以先预判环境变化再自主行动。

这些能力也经受了国际学术舞台的严格检验:峥嵘大模型先后斩获2026 CVPR多模态理解、2026 CVPR多模态推理、2026 ECCV具身智能交互多项世界冠军和季军等荣誉。生成、理解、推理、决策每一环的过硬成绩,都在背书中国的世界模型出海。

在HICOOL峰会期间,飞渡的展位上,来自各国政府、龙头企业、科研院所的嘉宾围绕具身智能、能源交通、航空航天、水利水务、高端制造、城市治理等场景深入洽谈,现场达成多项合作意向。展会期间,飞渡还在相关国际合作培训上发表了题为“全球领先的空间智能基础设施”的演讲,讲述如何在20多个国家落地,将这套能力带向全球市场。

奖项是行业的认可,订单才是真实的验证。飞渡团队被问到最多的问题,不是如何获奖或者世界模型的定义,而是空间智能和世界模型究竟有什么用、该如何落地应用。

回到最开始的问题:AI通向物理世界的短板该如何补上?过去两年,行业的注意力大多放在“生成”上,比拼的是谁的演示更逼真、谁构建的虚拟世界更宏大。但判断一家世界模型公司是否在接近答案,不应该看谁的演示更像一个完整的世界,而应该看谁在用它做出真实的决策。

各类评测榜单的兴起本身就印证了这一点:新的评测体系推动评价标准从视觉生成转向世界理解,权威评测已经将物理一致性、三维准确性、可控性,以及数据生成、策略评估和动作规划等能力纳入核心评测维度。全行业的评判标尺,正在从“好不好看”转向“能不能用”。

在HICOOL“对话硅谷传奇投资人”路演环节,飞渡与其他五支获奖队伍、十支清华大学博士创业团队同场竞技,最终夺得冠军。该投资人在赛后邀请飞渡明年赴硅谷参加全球投资人峰会路演。

产业与资本两个评委席投出的同一张票,投的不是一个炫酷的演示,而是一条已经在真实世界里跑通的“理解世界、推演未来、作出决策、驱动行动”的全过程闭环。人工智能正从语言理解向物理世界理解演进,空间智能基础设施是连接数字世界与物理世界的核心纽带,其价值必须通过这条闭环才能真正兑现。

补上缺失的一环的人,将会拿到下一个十年的入场券。

灾害不会等待AI慢慢成长,下一场暴雨来临之前,城市需要的是一个能提前把雨“下完一遍”的数字世界。大幕已经拉开,飞渡科技正持续深耕全链路全栈空间智能基础设施,加速全球化布局,让机器真正理解并进入物理世界,让空间智能成为驱动千行百业的新质生产力引擎。

世界模型的中国时刻,才刚刚开始。

以上内容不代表本平台立场,仅供读者参考