ProVisE与SpatialGen-Bench:空间认知的视觉评测新范式

当我们询问他人“杯子在哪里”时,对方通常会直接指向目标位置,而非生硬地报出一串坐标数值。但在当前的空间认知评测体系中,AI模型却被要求用这种反直觉的方式证明自身的空间认知能力——绝大多数基准测试都要求模型输出坐标、选项或文字描述,这对于天然工作在像素空间的图像生成模型来说尤为不友好,直接阻断了它们用直观方式作答的可能。
如果让生成式模型直接“画出”答案,如何让它们清晰表达空间判断?如何在无需人工干预的情况下验证生成结果的正确性?不同类型的模型在空间任务上的能力差异究竟体现在哪里?
近日,相关研究团队提出了ProVisE(Protocolized Visual Evaluation)框架,让图像生成模型能够以自身擅长的方式回答空间问题,同时将生成的视觉答案还原为标准评测可用的结构化预测结果。相关研究成果以《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》为题发布,相关资源链接如下:
- 论文链接:https://arxiv.org/abs/2607.21072
- 项目地址:https://zju-omniai.github.io/ProVisE/
- Github 链接:https://github.com/ZJU-OmniAI/ProVisE
- Benchmark 链接:https://huggingface.co/datasets/wx91726/SpatialGen-Bench
视觉协议是ProVisE的基本单元,每套协议包含引导模型生成答案的提示词,以及对应的解析器,用于将生成图像中的颜色、位置、区域等信息转换为结构化预测。整个流程分为三步:首先由协议路由根据任务选择合适的视觉协议;随后图像生成模型按照引导提示生成可解析的视觉答案;最后由协议解析器将像素结果转换为原基准测试所需的标签、点、掩码、状态或轨迹。
为了适配不同类型的空间基准测试,ProVisE内置了Agentic Protocol Construction框架,能够根据任务的输入形式、答案结构和评分规则,自动构建对应的“生成-解析”协议。该框架会逐任务扫描数据特征,根据任务特点选择三种协议构建模式:
- 复用:直接复用兼容的已有协议
- 构建:利用已注册的解析组件组装新协议
- 回退:在确定性组件无法覆盖时,由辅助VLM解析生成图像并恢复结构化预测
协议构建完成后还需经过验证,确保视觉答案能够正常生成、解析并接入原评测指标,通过验证后即可冻结并用于所有图像生成模型的评测。
举个具体的例子:面对目标定位任务,模型可以直接在图中标注目标位置;判断两点的相对深度时,模型可以生成对应的深度图;当被问及缆车上是否还能容纳一名乘客时,模型会在座椅上补画第二位乘客,直观展示空间余量,随后解析器会将这些视觉结果转换为标准的判断结果。
为了系统评估空间认知能力,研究团队构建了SpatialGen-Bench基准测试,涵盖从直接视觉感知、场景理解、空间推理到具身交互的14项子任务,分为四个层级:
- 空间感知:考察模型从画面中提取基础几何与空间属性的能力,包括计数、相对深度、朝向和尺寸比较
- 空间理解:要求模型整合多个物体及不同视角的信息,形成对物体关系与整体场景的理解,包括目标定位、关系分析、视角判断和场景建模
- 空间推理:在场景理解基础上,检验模型能否结合空间关系和物理约束进行多步推演,包括多步推理、状态预测和几何可行性判断
- 空间交互:进一步将空间认知延伸至行动,考察模型能否据此作出决策,包括可供性定位、导航和轨迹规划
在该基准测试的排行榜中,Claude Fable 5与GPT-5.6 Sol均超过80分,与Kimi K3一同霸榜前三,GPT-5.4得分为61.04;在图像生成模型中,GPT-5 Image 2以54.49分排名第一。
研究团队对比了20个文本输出VLM和11个图像生成模型的表现,发现两类模型的优势各有侧重:
- 图像生成模型展现出更直接的空间直觉:当任务可以通过深度图或空间标记直接作答时,生成模型表现出较强的竞争力,直接在像素空间作答减少了将连续空间关系转换成文字时的信息损耗。
- 两类模型具有明显的互补性:在GPT-5.4做错的题目中,GPT Image 2做对了37%,两者覆盖的正确题目并不完全重合。
- 文本输出VLM在抽象推理任务上仍占优势:在计数、尺寸比较、几何可行性判断和状态预测等需要统计多个对象、比较尺度、组合几何约束或推演状态变化的任务中,文本VLM在空间推理层级平均领先17.6个百分点。
- 生成成功并不意味着空间答案正确:失败归因分析显示,88.03%的失败样本已经成功生成图像并解析出有效预测,只是预测结果错误,主要问题在于图中呈现的空间状态不准确,而非无法生成图像或解析结果。
这项工作为空间智能研究提供了全新的视角,真正理解物理世界的智能体,不应只是会计算坐标的“文本机器”,还应能够在像素空间中直接表达并预演空间状态。未来的智能系统不必在“Show”与“Tell”之间二选一,可以让文本或隐空间表示承担约束规划与组合推理的任务,视觉生成负责呈现空间状态,再由确定性工具完成验证。理解、生成与验证的协同,或许比单纯扩大任一类模型的规模更接近通用空间智能。
该研究由相关团队完成,团队专注于大模型与智能体、多模态空间推理、具身智能和情感交互等方向的研究。

