S-Agent:空间智能从回答到行动链的范式转变

空间智能的核心革新,在于将传统的单次静态回答,重构为一条可执行的动态行动链。
来自南洋理工大学S-Lab与Ropedia的研究团队推出了S-Agent框架,重新定义了空间智能的实现路径:视觉语言模型(VLM)负责理解任务意图、规划下一步行动,DA3等专用模型则专注于深度估计、相机位姿计算与三维空间对齐,最终由空间专家模块将原始几何输出转化为可用于推理的结构化证据。实验结果显示,在零样本(zero-shot)设置下,S-Agent在MMSI-Bench基准测试中取得了46.4%的平均分,在ViewSpatial-Bench上的得分达到60.0%;而通过S-300K轨迹数据蒸馏微调后,8B量级的模型在MMSI-Bench和ViewSpatial-Bench上的得分分别提升至41.6%和46.8%。
-
论文标题:S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
“站在耳机旁,背对入口门,相机在你的哪个方向?”
一段开场演示视频中提出的问题,正是典型的动态空间推理场景。对人类而言,这只需要一次短暂的心理旋转就能完成;但对视觉语言模型来说,它需要同时完成实体定位、跨帧对齐、三维理解和自我中心坐标转换。模型拿到的并非一张线索完整的全景图,而是从一段视频中抽取的64帧画面——耳机、入口门和相机分散在不同的观察视角中,“左、右、前、后”的方位也需要以人的站位和朝向为基准重新定义。
演示中的完整行动链清晰展示了S-Agent的工作逻辑:它不会直接猜测答案,而是先定位三个核心实体,再将离散的2D线索整合到共享的三维场景中,随后以耳机为原点、以“背对入口门”为朝向建立自我中心坐标系,最终判断相机位于右后方,输出答案D(back-right)。整个推理轨迹包含3轮规划和6次工具调用,每一步行动本身都是推理过程的重要组成部分。
这段不到一分钟的演示,浓缩了S-Agent的核心主张:空间智能不应只是“看完视频后给出一个静态答案”,而应该进入Agent式的行动循环——持续追问“下一步该看哪里、测量什么、验证什么”,并将每一次行动获得的证据累积为可追踪的世界状态。
图1|案例视频中的完整行动链:定位实体、3D对齐、建立自我中心坐标系,再解析相机象限。
空间智能的分工重构:让VLM专注任务理解,让专用模型处理几何计算
S-Agent的设计初衷并非否定VLM的价值,而是重新规划VLM在空间智能系统中的角色定位。VLM的优势在于语义理解:它能够读懂问题意图、识别场景中的实体与关系,并将自然语言指令转化为可执行的判断目标。但在真实的三维空间中,仅依靠语义理解是远远不够的。深度估计、相机位姿计算、三维空间对齐、物体尺度与朝向判断等任务,本质上更偏向几何感知与空间计算,而这往往不是通用VLM的强项。
基于这一认知,S-Agent提出的核心思路是:不要让VLM在单个模型中承担所有任务。对于“图中有什么、问题在问什么、下一步该验证什么”这类语义理解任务,VLM的表现十分出色;但对于“这个点的具体距离是多少、相机如何运动、两个视角如何对齐”这类几何计算任务,DA3等专用深度或三维模型的表现往往更加可靠。空间智能的关键,并非让VLM成为万能的几何模型,而是让它学会将合适的问题交给最合适的工具处理。
在此基础上,S-Agent将空间推理重新定义为时空证据累积(spatio-temporal evidence accumulation)过程:VLM无需在单次参数计算中完成实体识别、几何恢复、坐标转换和关系判断等所有任务,而是作为Agent围绕当前问题发起一系列行动,调用2D感知、3D几何和空间专家模型逐步补充缺失的证据,并将已获得的场景状态持久保留下来。
从被动回答者到主动规划者:S-Agent的三层工具体系
S-Agent的系统架构如图所示。VLM在这套架构中不再是被动的答案回答者,而是成为语义规划器:每一步推理中,它都会结合当前问题、原始观察、已有的场景记忆和此前的行动历史,决定下一步需要获取哪类证据、应该调用哪个工具,以及现有的证据是否足够支撑得出结论。
整个工具体系按照空间理解的层级被划分为三个模块:Level 1负责2D视觉证据的获取,包括从长视频或多视图输入中筛选关键帧、定位问题涉及的实体,以及通过开放词汇检测补充遗漏的目标;Level 2负责将局部的2D线索升级到三维空间,通过度量深度、计算相机位姿、生成鸟瞰图或新视角画面,将分散的观察结果对齐到统一的共享坐标系中;Level 3则由计数、距离测量、相对位置判断、视觉朝向分析、物体视角解析等空间专家模块组成,将密集且可能带有噪声的原始几何输出,过滤为规划器可以直接使用的高层空间事实。
这种分工模式的核心价值,并非简单地给VLM增加更多工具。S-Agent将语义决策、几何证据处理和状态维护拆分为可协同工作的独立模块:模型负责提出下一步的行动方向,工具负责返回可验证的客观证据,记忆模块则负责将已获得的证据在后续行动中持续生效。
研究团队的消融实验也证实,采用Agent式的行动循环并非简单地堆砌更多工具。原始的深度数据、相机位姿信息和点云数据往往包含大量密集数值和噪声,通用VLM未必能直接解读;真正拉开性能差距的,是Level 3空间专家将这些原始数据转化为与任务相关的测量结果、相对位置和方向判断,再通过双记忆机制将这些证据接入后续的行动步骤中。也就是说,S-Agent的核心优势并非工具数量更多,而是每一步行动都能产生可被后续步骤复用的有效证据。
图2|S-Agent框架示意:语义规划器、三层空间工具与双记忆协同工作。
零样本领先,蒸馏后8B模型逼近前沿水平
研究团队首先验证了无需微调的零样本使用方式:无需对底座模型进行专门的空间微调,只需将S-Agent的行动规划模块、空间工具体系和记忆机制接入现有VLM,就能在多视图和视频空间推理任务上获得显著的性能提升。MMSI-Bench的零样本测试结果显示,S-Agent的平均分为46.4%,高于Gemini 3 Pro的45.2%和GPT-5.4的41.9%。
论文表1|MMSI-Bench zero-shot结果表,截图自论文正文。
更值得关注的是,性能提升并非仅体现在整体平均分上。相较于其使用的InternVL3.5-8B底座模型,S-Agent在MMSI-Bench上的得分提升了17.4个百分点,其中相机运动子任务的提升幅度更是达到31.1个百分点。在ViewSpatial-Bench上,S-Agent的整体得分达到60.0%,其中人物视角相对方向(P-RD)子任务的得分高达81.1%;在ReVSI基准测试中,其平均成绩为58.8%。
将零样本和监督微调(SFT)两种设置下的结果进行对比,最亮眼的是经过S-300K轨迹数据蒸馏后的S-Agent-8B模型:研究团队使用约29.2万条高质量的S-Agent行动轨迹,对Qwen3-VL-8B进行了监督微调。微调后的模型在MMSI-Bench上的得分从31.1%提升至41.6%,在ViewSpatial-Bench上从42.2%提升至46.8%。对比GPT-5.4的41.9%和45.6%,这款8B模型在前者的测试中几乎持平,在后者的测试中还高出了1.2个百分点。
论文中的完整对照结果显示,S-Agent-8B同时超过了Qwen3-VL-8B-Instruct以及使用相同8B规划器的零样本S-Agent。这说明,紧凑的模型未必需要将全部空间知识压缩到参数中,当模型学会判断何时采取行动、如何解释工具返回的结果,以及如何跨步骤整合已有证据时,系统级的能力可以显著超越底座模型本身。
图3|论文项目视频中的性能对比页。S-Agent在zero-shot与SFT设置下均获得显著提升。
论文表4|S-Agent-8B在MMSI、ViewSpatial与ReVSI上的蒸馏结果,截图自论文正文。
S-300K数据集:将强Agent的行动过程转化为小模型的学习课程
性能提升的背后,离不开S-300K这套高质量的行动轨迹数据集。S-Agent不仅是一个推理框架,同时也是一款行动轨迹数据生成器。研究团队使用高性能模型驱动的S-Agent生成空间推理轨迹,过滤掉执行失败或答案错误的样本,最终整理出了包含约29.2万条有效样本的S-300K数据集。
与传统的“问题-答案”式指令数据不同,S-300K将监督信号拆分为多种粒度:完整的行动轨迹可以教会模型如何从初始问题推导出最终结论;轮次级样本用于训练模型在当前上下文环境中选择下一步的行动;专家/工具级样本则专门用于训练模型如何调用特定工具并解释其返回的结果。
这相当于将强Agent的行动方法拆解为一套可学习的课程,学生模型不仅需要学习最终的答案标签,还需要掌握如何发现证据缺口、修正失败的实体定位,以及何时停止调用工具以终止推理。相关案例覆盖了距离判断、实体计数、路线规划、尺寸测量和方向识别等任务,这也说明,空间智能的训练中,可追踪的行动过程比单一的最终答案更为重要。
图4|项目展示的多类真实推理案例,覆盖距离、计数、路线、尺寸与方向等任务。
空间智能的未来方向:从模型规模到行动能力
综合来看,S-Agent展示了一条不同于单纯扩大模型参数规模的技术路线:让通用VLM专注于行动规划,将几何恢复任务交给专用工具,通过记忆机制维护跨帧的场景一致性,再通过可追溯的推理轨迹将能力蒸馏到更小的模型中。
这套技术思路可以自然延伸到多个领域,包括机器人导航与操作、AR/VR空间助手、长视频问答、自动驾驶场景理解等。这些场景的共同需求,不再仅仅是识别画面中的物体,而是主动选择下一步的观察、测量和验证步骤,并持续维护物体在三维世界中的位置、朝向和状态变化。
从这个角度来看,S-Agent将空间智能的评价核心从“模型的参数规模”转向了“系统的行动能力”:即能否判断证据缺口、调用可靠的工具、沉淀场景状态,并将成功的行动链反哺给更小的模型。
S-Agent给出的发展方向已经十分清晰:当单次的猜测被替换为可追踪、可复用、可蒸馏的行动链时,视觉模型就从“看懂单帧画面”走向了“理解整个空间”,空间智能也由此从静态的问答模式,迈入了可执行、可积累、可迁移的Agent时代。

