AgentHOI:无需训练的人类-物体交互检测新范式

人-物交互检测是计算机视觉场景理解的核心任务之一,能够识别图像中人与物体之间的交互关系,为机器人感知、智能驾驶等领域提供关键技术支撑。传统的检测方法往往存在标注成本高、泛化能力不足的问题,近期来自北京大学王选计算机研究所的研究团队提出了一款无需专项训练的交互检测框架AgentHOI,相关研究成果以《Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild》为题,已被ECCV 2026正式接收,相关代码与模型已全部开源。
传统HOI检测的痛点与局限
传统的人-物交互检测模型大多采用监督学习范式,需要预先定义动作与物体的类别词表,再使用带有标注好的人框、物体框和交互标签的数据训练分类器。这类方法在封闭的测试数据集上表现尚可,但存在两个明显的短板:其一,标注成本高昂,复杂图像中可能同时存在多个人、多个物体和多种交互动作,穷举并标注所有交互关系需要耗费大量时间;其二,泛化能力受限,现实场景中的动作组合、物体外观和图像风格千变万化,一旦测试画面偏离训练分布,模型就容易出现“见过词汇却没见过对应组合”的问题。
近年来,部分开放词汇的HOI方法开始借助CLIP或多模态大模型,但大多只是将其作为特征提取器、语义对齐器或提示词生成器,最终仍然需要训练针对交互检测任务的专用分类器,无法从根本上解决泛化和标注成本的问题。
AgentHOI的核心设计思路
本次提出的AgentHOI框架,则重新拆解了HOI检测的问题定义:它不再将交互检测视为固定词表上的分类任务,而是转化为“开放语义推理+精确空间定位”的协作过程,通过两个基础模块的配合完成检测,全程无需使用HOI专项标注数据,也不需要更新模型的可学习参数。
AgentHOI的基础版本由两个现成的视觉基础模块组成:第一步,多模态大模型对整张图像进行分析,推理出画面中可能存在的“动作-物体”组合;第二步,视觉定位模型接收对应的文字描述,分别定位出执行动作的人和被交互的物体,输出两者的边界框。在本次实验中,研究团队使用GPT-4o承担多模态理解与推理任务,使用GroundingDINO完成空间定位工作。
不过,直接将两个基础模块串联起来并不足以应对复杂场景。研究团队发现,在多人多物体的场景中,这类简单拼接的方法会遇到两类典型问题:一是多模态大模型容易只识别出最显眼的交互动作,遗漏其他不那么突出的交互关系,根据统计,多交互场景下的交互召回率比单交互场景低14.92%;二是当定位提示过于笼统时,模型容易混淆外观和动作相近的人物或物体,比如同时有多个人骑摩托车时,无法准确匹配具体的交互主体。
针对这些问题,完整版的AgentHOI加入了两套关键的优化机制:上下文感知多轮推理和多维度交互定位。
上下文感知多轮推理机制
上下文感知多轮推理机制将整个交互识别过程拆分为三个相互衔接的阶段,利用前一轮的识别结果作为上下文,持续补充和细化最终的交互预测结果:
- 第一轮为初始HOI识别:多模态大模型首先观察整幅图像,识别出较为显著的人-物交互关系;
- 第二轮为HOI再挖掘:系统将首轮识别的结果作为上下文,提示模型检查尚未被发现的交互关系,帮助模型将注意力转向其他人物和物体,减少复杂场景中的交互遗漏;
- 第三轮为动作重分配:针对已经识别出的人-物组合,系统结合物体可能对应的动作类别,引导模型重新检查二者之间的关系,补充更细粒度的交互标签,比如除了“拿着”之外,还可以识别出“握住”等更精准的动作。
三个阶段分别负责发现主要交互、补充遗漏交互和细化动作类别,让模型在复杂场景中获得更完整的交互识别结果。
多维度交互定位机制
在完成交互语义推理之后,AgentHOI还需要在图像中准确定位每条交互对应的人和物体。基础版本的方法通常将HOI三元组转换为简单的文字描述,比如“一个拿着瓶子的人”,但在多人多物体的场景中,这类描述无法区分外观和动作相近的实例,容易导致定位错误。
为此,多维度交互定位机制为每个交互实例分别生成人物描述和物体描述,并在提示词中融入三类关键信息:
- 语义信息:人物正在执行的动作以及与之交互的物体类型;
- 空间信息:人物或物体在画面中的大致位置;
- 外观信息:人物的服装、配饰以及物体的颜色、标签等可用于区分的特征。
以人与瓶子的交互为例,人物描述可以从简单的“拿着瓶子的人”扩展为“画面左侧穿黑色上衣、戴帽子、正在拿着或握住瓶子的人”,物体描述则可以写成“被人拿着或握住的、带有红色标签的瓶子”。视觉定位模型根据这两类精准描述分别寻找对应的人和物体,能够有效降低相似实例之间的混淆,让识别出的交互语义与图像中的具体实体准确对应。
开放世界交互检测的实验效果
研究团队在多个公开数据集上对AgentHOI进行了评估,首先是HICO-DET数据集,该数据集包含9658张图像、600类HOI组合,涉及118种动作和80类物体。在零样本评测中,AgentHOI在未见动词和稀有优先未见组合的设置下分别取得29.85和38.64 mAP,是对比方法中的最佳结果。
为了模拟真实世界中的分布变化,团队还对测试图像进行了风格迁移和画质退化处理,包括模糊、噪声和压缩等情况。在这些变化下,依赖源数据分布训练的监督方法普遍出现明显的性能下降,而AgentHOI在多个评测设置上保持领先,展现出较强的跨风格和抗退化能力。
在默认的HOI检测设置下,AgentHOI整体达到29.61 mAP,高于其他对比方法如OpenCat、Weakly-HOI和Align-Former。在稀有类别上的差距更为明显,AgentHOI取得40.33 mAP,而对比的弱监督方法中最高仅为24.52 mAP。这是因为弱监督方法虽然减少了边界框标注的工作量,但仍需要从有限的任务数据中学习交互模式,当某些类别的样本数量较少时,很难稳定学习到对应的视觉规律。而AgentHOI直接调用基础模型在大规模预训练中获得的视觉-语言知识,通过多轮推理发现长尾动作,无需依赖某类交互在训练集中的出现频率。
在词表规模更大、类别更丰富的SWIG-HOI数据集上,AgentHOI无需针对新数据集进行重新训练,整体取得13.00 mAP,未见类别取得11.61 mAP,后者超过了全监督方法CMD-SE的10.70 mAP,接近SGC-Net的12.46 mAP。
更值得关注的是,AgentHOI不仅能够识别数据集预先定义的交互类别,还能发现标注之外的真实交互。面对大规模HOI数据集中常见的漏标问题,它可以通过多轮推理和上下文理解,补充识别“遛狗”等细微或重叠的动作;即使不使用特定数据集预设的物体与动作词表,也能理解开放场景中的任意交互。例如,面对一张“骑马”的图片,除了数据集标注的“ride horse”之外,AgentHOI还能进一步识别“straddle”“hold”和“swing lasso”等动作,推动HOI检测从“在固定选项中选择”迈向开放灵活的场景理解。
总结与展望
AgentHOI将HOI检测拆分为开放语义推理和空间定位两个核心环节,通过多模态大模型与视觉定位模型的协作,在无需HOI专项训练数据和不更新模型参数的情况下完成交互识别与定位。实验结果表明,该框架在零样本、稀有类别和分布偏移等场景中都展现出了不错的适应能力。
不过,该方法目前仍受到推理成本、基础模型能力和生成结果稳定性等因素的限制。未来的研究可以进一步探索更轻量的推理流程、更可靠的交互验证机制,以及面向视频和动态场景的时序建模方法,在保留开放词汇能力的同时提升检测效率与结果稳定性。
相关项目资源:

