HOI-Edit基准与SCPE:复杂人-物交互图像编辑新范式

近期一项被国际机器学习顶会ICML 2026收录的研究,围绕复杂人-物交互(HOI)图像编辑任务提出了一套完整的解决方案,包括全新的评测基准、自动化评测指标以及基于视频过程反馈的自纠错优化框架,相关数据集与代码已全部开源。
- 论文标题:Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework
- 论文链接:https://arxiv.org/abs/2606.19073
- 代码链接:https://github.com/oceanflowlab/HOI-Edit
- 项目主页:https://andyplus1.github.io/HOIEdit_page/
从像素修饰到交互重构:图像编辑的进阶挑战
传统的指令式图像编辑主要聚焦于颜色、风格、物体属性等静态内容的修改,已经取得了不错的进展。但当编辑需求转向“拿起桌上的红苹果”“把碗放到餐桌中央”“清理扶手箱内部”这类任务时,模型需要面对的不再是简单的局部重绘,而是真正理解人与物体之间的交互关系。
这类任务要求模型同时满足多重约束:既要保留原图中人物和物体的身份,又要准确理解场景中的空间指代,还要推理动作发生的过程与物理后果。例如当画面中有多件相似工具时,模型可能会选错目标;当要求清理扶手箱时,模型还需要先完成打开扶手箱的前置动作,这些能力已经远超普通静态属性编辑的范畴。
然而当前的图像编辑评测基准往往将HOI任务与普通属性修改混为一谈,评价指标也多依赖CLIPScore这类全局相似度指标或单独的实体检测,无法回答两个核心问题:目标人物和目标物体是否被准确保留?二者之间的交互是否真实发生且符合上下文逻辑?
为填补这一空白,这项研究提出了HOI-Edit层级化认知评测基准、HOI-Eval自动化评测协议,以及基于图生视频(I2V)模型的SCPE自纠错框架,构建了从评测到优化的完整链路。
层级化认知评测体系:HOI-Edit基准
HOI-Edit基准面向复杂人-物交互编辑任务,从三个由易到难的认知层级系统刻画模型的能力:
- L1 基础交互编辑:聚焦交互关系的创建、移除与修改,要求模型在调整动作的同时保留原图中的人和物体身份。
- L2 上下文空间理解:考察模型对场景空间关系的理解能力,比如在多个相似物体中精准选中目标,或将动作结果放置到正确位置。
- L3 因果与物理推理:要求模型推理事件的因果链与物理后果,比如先完成必要的前置动作,再生成符合物理规律的最终结果。
在数据构建上,HOI-Edit通过上下文感知的指令设计、系统化区域标注和多维问答构造,形成了覆盖357个L1样本、202个L2样本、146个L3样本的评测集合,涵盖丰富的交互类别,避免了仅关注视觉相似度的粗粒度判断,将具体人-物对、动作状态、空间约束和过程合理性纳入统一评测。
细粒度自动化评测:HOI-Eval指标
针对传统全局指标无法准确判断交互是否真实发生的问题,研究团队提出了HOI-Eval自动化评测协议,核心思路是让评测模型“带着目标区域思考”,具体流程分为三步:
- 目标区域关联:基于原图中的人物、物体及辅助区域,在编辑后的图像中建立对应关系,定位需要评测的目标区域。
- 身份一致性验证:分别检查人物和物体的身份是否保持一致,避免出现目标被错误修改或丢失的情况。
- 交互与合理性问答:围绕交互是否发生、动作是否到位、空间位置是否正确、过程步骤是否完整以及物理现象是否合理等问题设计针对性问答,全面验证编辑结果的合理性。
相比仅关注整体视觉相似度的全局指标,这种评测方式能够有效避免指代歧义,更贴近人类对HOI编辑效果的判断标准。实验也验证了HOI-Eval与人工评测结果的相关性显著高于DINOv2、CLIP等传统指标。
基于视频过程的自纠错优化框架SCPE
研究团队发现,I2V模型能够生成完整的交互过程视频,而非仅输出最终的编辑图像,这使得模型的失败原因不再是黑盒结果,可以通过视频过程进行观察、分析和修正。基于这一发现,团队提出了SCPE(Self-Correcting Process Editing)多智能体自纠错框架,该框架结合了I2V模型的时序生成过程与多模态大模型的理解能力,实现复杂交互编辑的自动分析与纠错。
SCPE的核心是一个闭环优化流程,由四个专门的智能体组成:
- Generator:根据输入图像、原始指令和经验工具书生成细化的视频提示。
- Analyzer:采样生成的视频帧,诊断具体的失败原因,比如轨迹偏移、步骤缺失或物理不合理等问题。
- Reflector:将单个失败案例提炼为可复用的一般性经验。
- Curator:将提炼出的经验增量写入经验工具书,供后续生成调用。
在下一轮生成时,Generator会调用更新后的工具书,显式强调目标对象、动作轨迹、前置条件和物理后果,从而减少同类错误的发生。与一次性的提示词增强工具不同,SCPE利用真实的生成视频作为反馈来源,能够根据模型实际的失败位置进行精准纠错,同时经验工具书将单个案例的经验沉淀为跨样本的优化策略,不仅能优化当前任务,还能提升后续复杂交互编辑的稳定性。
实验验证与性能分析
为验证SCPE的有效性,研究团队在HOI-Edit基准上对开源图像编辑模型、闭源商业模型以及I2V视频生成模型进行了系统评测,重点关注交互准确性(I)、人物身份保持(H)、物体身份保持(O)以及考虑合理性的交互成功率(I+Q&A),以此判断模型是否真正完成了目标交互,而非仅生成视觉上相似的结果。
实验结果显示,SCPE带来了稳定且显著的性能提升。以原始的Wan 2.2 I2V模型为例,加入SCPE后,模型在三层认知任务上的交互表现均有明显提升:L1交互分数提升约22%,L2约束成功指标提升约26%,L3约束成功指标提升约22%,并且在多个关键交互指标上超过了闭源强基线模型。这说明SCPE不仅能让动作“发生”,还能让动作准确发生在正确的对象、位置和合理的过程中。
从可视化结果来看,SCPE在复杂交互场景中表现出更强的稳定性和可控性:在L1基础交互场景中,它能克服静态模型常见的编辑惯性和幻觉伪影;在L2空间理解场景中,能够更精准地识别目标对象和空间位置;在L3因果推理场景中,更擅长保持过程一致性与物理合理性,生成符合常识的中间步骤和最终结果。
研究团队还通过消融实验验证了SCPE各组件的贡献:官方的Prompt Enhancer虽然小幅提升了交互分数,但却降低了身份保持的得分,说明盲目补充提示可能引入身份漂移;仅使用视频过程反馈的版本就能显著提升交互和身份保持得分,而加入完整的SCPE框架(包含经验工具书)后,性能进一步提升,证明了经验沉淀的关键作用。
此外,SCPE在不同的主干模型和评测器设置下都展现出良好的泛化能力,说明其优势来自过程诊断与经验积累的核心机制,而非依赖特定的模型或工具。
研究总结
总体而言,这项研究围绕复杂人-物交互图像编辑任务,提出了覆盖评测、指标与优化框架的完整解决方案。HOI-Edit构建了面向三层认知能力的层级化评测基准,HOI-Eval实现了更细粒度的交互正确性评测,而SCPE框架则通过视频过程反馈实现了模型的自纠错优化,为未来构建具备更强空间理解、因果推理和物理一致性的视觉生成模型提供了重要的基础。
塔猴是一个专注于为用户提供系统学习、内容创作与商业连接的AIGC综合服务平台,致力于为每一位AI探索者打造理想的创作、成长家园。在塔猴,你不仅可以学习众多AIGC类实战课程,获得与时俱进的AIGC技能和视野,还有机会获得长期商业合作和接单机会!点击进入:https://www.tahou.com/
AI生成内容提示:本文由人工智能辅助创作,内容仅供参考,不代表平台观点。请注意核实信息的准确性,并理性判断。

