文章摘要
8月6日,Om AI联汇完成数亿元融资并开源端侧原生模型VLX - Seek 1.5。当下AI落地物理世界,竞争规则改变,端侧原生模型成新方向。VLX - Seek 1.5采用端侧原生架构与流式多模态技术,评测中表现出色,减少误判。融资体现资本对端侧原生范式的认可,开源利于争夺标准定义权。该公司还构建端侧智能生态,端侧原生或助物理AI规模化落地。

当下的具身智能领域,正迎来一轮关键的范式升级。8月6日,Om AI联汇接连释放两大重磅动作:一方面完成了数亿元融资,由前海母基金领投;另一方面正式开源旗下全球首款端侧原生模型VLX-Seek 1.5。这两件事放在一起,很容易让人联想到20年前亚马逊AWS开启云计算时代的场景——彼时AWS一边开放API吸引开发者,一边通过资本验证路线价值,最终让云计算从简单的服务器租赁进化为全新的基础设施范式。如今,物理AI也在寻找属于自己的「原生时刻」。

过去数年,AI行业的竞争核心长期围绕更大的模型体量、更多的训练数据以及更强的云端算力展开,参数规模一度成为衡量模型能力的核心指标。但当AI落地到真实物理世界,机器人、无人机等终端需要在工厂、仓库、家庭、户外等复杂场景中持续运行,行业的竞争规则也随之改变。决定模型价值的不再仅仅是参数量,而是四个更现实的问题:响应延迟是否足够低?端侧算力能否支撑?部署成本能否实现规模化?设备能否脱离云端独立运行?

在真实的物理场景中,每新增一台机器人或智能终端,都会带来实打实的硬件、能源和维护成本。如果依赖云端算力,每一次感知都需要上传数据、等待云端推理再返回结果,就像人在运动时每个动作都要远程呼叫大脑,不仅会产生网络延迟、传输成本,还会带来用户隐私泄露的风险。显然,物理AI不可能永远依赖远端的云端大脑。

目前全球物理AI玩家已经形成了多条不同的技术路线:NVIDIA Cosmos选择云端世界模型路线,通过构建空间认知基础帮助AI理解物理环境;Physical Intelligence的π系列探索云端通用机器人策略模型,希望通过大规模训练让机器人具备跨任务泛化能力;Google Gemini Robotics沿着云端VLA方向推进,打通语言理解、视觉感知和机器人动作的连接,让机器人可根据自然语言完成任务;Tesla Optimus则强调模型与机器人本体的闭环,通过自有硬件平台推动能力迭代。这些路线各有侧重,并没有绝对的优劣之分,分别回答了「如何让AI理解世界」「如何让机器人获得通用能力」「如何让模型与硬件协同」等不同命题。

但在这张路线图谱中,此前始终存在一个未被填补的关键坐标:如何让AI模型从诞生之初就适配端侧环境?这正是Om AI联汇想要切入的赛道。

该公司自研的VLX端侧流式多模态模型系列,核心思路是「端侧原生」:模型不依赖云端大算力,也不绑定单一硬件平台,并非先在云端训练完成再通过压缩、蒸馏、量化等方式迁移到端侧,而是在设计阶段就将端侧算力、延迟、功耗和部署成本作为核心约束条件。这两种思路的本质差异在于:前者的逻辑是「如何让强大的AI模型跑到设备上」,而后者则是「如果AI生来就在设备上,它应该长成什么样」。

这种设计思路的区别,直接决定了物理AI能否快速、大规模走出实验室。端侧原生模型能够带来直接的价值提升:更低的响应延迟、更低的部署和运维成本、更强的本地自主性,让物理AI真正落地到工厂巡检、家庭服务、无人机作业、智能终端等场景中。而大规模落地的核心要求,就是模型具备本地理解能力、持续交互能力和低成本部署能力,这也让端侧原生不再只是一个营销概念,而是代表了一条全新的架构路线,决定着未来物理AI如何进入千千万万个真实设备。

VLX-Seek 1.5共有3B、10B两个参数版本,端侧原生架构是其战略选择,而流式多模态则是其核心战术优势。与传统VLM的批处理模式不同——传统模式下摄像头拍摄单张照片上传云端,等待推理结果返回,这种方式不仅延迟高、依赖大带宽,还会将连续的物理世界感知切割为静态快照,VLX-Seek 1.5接收的是持续的视频流输入,能够在端侧实时理解环境并动态输出决策。其核心由三层心智链路构成完整闭环:Flow层负责持续注意力,让模型从「看不见」到「看得清」;Seek层负责精细推理,让模型从「看不准」到「看得准」;Go层负责执行控制,让模型从「动不了」到「自主行动」。

这种架构范式的升级,验证了「同参数级别比拼的关键不在参数量而在架构」的判断。Om AI联汇公开的评测数据显示,VLX-Seek 1.5覆盖了通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个测试方向,对比模型包括自家上一版VLX-Seek、英伟达LocateAnything等检测增强型VLM,以及多款更大体量的开源或闭源模型。

最终结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,在无人机定位、具身设备空间推理等场景中也展现出了强劲竞争力。

其中最具代表性的是3B参数版本与同规模模型LocateAnything-3B的对比:在通用检测任务中,VLX-Seek 1.5-3B的LVIS Mean指标达到57.5,相比LocateAnything-3B的50.7提升了13.4%,证明小参数模型在复杂长尾目标识别中并未因体量受限出现能力退化;在更贴近真实交互的指代表达理解任务中,其RefCOCOg test Mean指标达到80.2,相较对手提升3.4%,这意味着模型能够更好地理解人类语言和空间关系的关联。

真正拉开差距的是无人机视角场景:无人机作业时目标往往体积小、距离远、视角特殊且环境复杂,传统模型很容易出现漏检或误判。在RefDrone测试中,VLX-Seek1.5-3B的F1指标达到73.2,相较LocateAnything-3B的52.3提升了40%,实例准确率Acc达到58,相较对手的35.6提升了62.9%。这说明在极端视角和小目标场景下,端侧原生架构展现出了远超传统路线的效率优势。

除了识别精度,模型的可靠性同样关键。对于机器人、无人机和安防系统来说,一次错误的判断可能引发不可逆的真实世界安全问题。为了解决「过于自信」的风险,VLX-Seek 1.5引入了目标幻觉指标,用于衡量模型产生不存在目标误报的概率,其计算公式为Object Hallucination = FP/Number of GT Objects,其中FP代表针对实际不存在的目标产生的假阳性检测,数值越低说明误报越少。在RefDrone目标幻觉评测中,VLX-Seek1.5的FP/GT为18,而LocateAnything-3B为71.3,这意味着其能够显著减少错误的目标判断,在信息不足时主动拒绝给出不确定的结论——这种「知道什么时候说不知道」的能力,正是智能系统走进真实物理世界的重要标志,在安防、巡检等高可靠场景中,减少误报比减少漏报更加重要。

资本对技术范式的投票往往早于技术社区的判断。此次Om AI联汇完成的数亿元融资,释放的明确信号是:资本市场开始为端侧原生范式定价。这与云原生早期的投资逻辑高度相似:当时的投资人押注的并非某一款具体的PaaS产品,而是整个范式迁移的趋势。

VLX-Seek1.5的开源,则是Om AI联汇争夺行业标准定义权的关键一步。其思路与Kubernetes的发展逻辑一致:不靠售卖标准获利,而是通过免费开放的方式让标准成为行业共识,当全行业遵循这套标准后,定义方的基础设施和托管服务就能获得巨大的商业增益。目前VLX-Seek1.5的能力已经向开发者开放,当越来越多的开发者接入并在更多真实场景中验证模型,形成数据反馈和持续迭代的正向飞轮,其生态位将进一步稳固。

除了模型本身,Om AI联汇还基于VLX模型基座构建了完整的端侧智能生态。其「一脑多形」智能体平台OmAgent,旨在推动AI落地具身场景。目前OttoPlex御行已经完成商业化落地;消费端,OttoBox携手联想、苹果推出了AI PC工具「OttoBox AI Studio」;其自研的可穿戴AI视觉中枢Homer AI,已经服务全国近10万视障用户,平台月均AI调用量达到千万次。这些落地案例证明,Om AI联汇并不只想成为一家单纯的模型公司,而是希望成为端侧原生智能时代的基础设施提供者。

从云计算到云原生,产业的真正跃迁从来不是简单堆砌算力,而是找到适配新世界的全新架构。如今物理AI也走到了类似的节点:融资是资本对新路线的投票,开源是生态对新范式的首次接入。当AI模型开始脱离云端,进入千千万万个真实设备,端侧原生或许正是物理AI实现规模化落地的关键答案。未来的具身智能竞争,不再只是大模型参数的比拼,真正拥有最大价值的,未必是参数体量最大的模型,而是能够让机器人、无人机和智能终端实现规模化稳定运行的基础设施。

以上内容不代表本平台立场,仅供读者参考