ICML 2026:跨模态AI模型ICRDrag实现零误差区域编辑

还在为AI图像拖拽编辑的痛点发愁吗?传统点拖拽控制稀疏难以精准对齐,带掩码的区域拖拽又容易出现视觉断层、变形走样。近日,上海交通大学牛力实验室推出的ICRDrag(In-Context Region-based Drag)正式开源,作为ECCV 2026的重磅研究,一举打破了这些局限,实现了丝滑的任意区域图像拖拽编辑。
论文地址:https://arxiv.org/pdf/2606.25907
项目地址:https://github.com/bcmi/ICRDrag-Region-Drag-Editing
在线Demo:https://drag.ustcnewly.com/
该实验室长期聚焦图像生成与编辑领域,在图像合成、少样本生成等方向产出了诸多代表性成果,如今ICRDrag正是其在精细化图像编辑方向的又一里程碑工作。
直观效果对比
在实际编辑中,蓝色掩码代表源区域,红色掩码代表目标区域,核心目标是将源区域丝滑拖拽至目标区域,同时保持非编辑区域的细节完整。无论是人像姿态调整、宠物动态变化还是静物形状修改,ICRDrag都能轻松胜任。
该工具还支持多区域协同编辑与锚点锁定,单次操作最多可同时处理5对源-目标区域,用户还可以在无需改动的区域设置锚点,确保AI严格按照需求完成编辑,不会出现多余的变形。
核心技术突破
ICRDrag从底层重构了拖拽编辑的控制逻辑,五大核心技术支撑其出色表现:
- 上下文学习框架:基于DiT(Diffusion Transformer)架构,一次性输入原图、源区域掩码和目标区域掩码,直接一步输出编辑后的图片,省去繁琐的中间步骤。
- 图像与掩码注意力一致性(IMAC):生成过程中严格约束注意力分布,让图像特征与掩码轮廓精准对齐,确保编辑结果不会超出划定的区域边界。
- 双向注意力约束(STAC):让目标区域与源区域建立双向关联,确保物体在形变、移动后依然保留自身特征,不会出现细节丢失或变异。研究团队还通过可视化注意力图验证了这一约束的有效性:缺少IMAC约束会导致选区对不准,缺少STAC约束则会出现细节流失、人脸变形等问题,而双重约束叠加则能实现精准的编辑效果。
- 专属LoRA分支:针对图像和掩码分别定制独立的LoRA,区分纹理细节与空间轮廓的特征处理,避免特征污染,兼顾细节保留与轮廓精准。
- 分阶段渐进训练:考虑到用户手绘的掩码往往比较粗糙,模型先通过规范的语义掩码学习变换逻辑,再引入随机膨胀的稀疏掩码模拟真实手绘场景,让AI能够精准理解用户的粗糙选区意图。
极限场景测试
传统拖拽工具在处理非刚性大形变、人体肢体大范围位移时容易出现“骨折”等问题,而ICRDrag在这类极限场景下表现稳定。研究团队在人像大角度转头、肢体遮挡复原等高难度任务中进行了测试,效果出色。
此外,团队还在从未参与训练的Adobe Stock真实图库上进行跨域测试,模型依然展现出惊艳的泛化能力。
首个大规模区域拖拽数据集PRD
此前区域拖拽编辑领域的一大痛点是缺乏高质量训练数据,为此团队基于百万级视频数据集OpenVid打造了PRD(Paired Region Dataset),填补了行业空白:
- 超大训练集:包含28.7万组高质量的「原图 + 源掩码 + 目标图 + 目标掩码」配对样本。
- 专业评测基准PRDBench:精选1000组人工校验的高质量样本,同时标注掩码与关键点,可用于公平对比点拖拽和区域拖拽模型的性能。
这项技术为诸多创作者带来了便利:人像后期可以自由调整身材比例、五官和姿态;静物与产品设计时拖拽商品位置、调整大小无需重新调整光影;构图优化时移动主体后AI会自动无缝填充背景;创意设计时还能轻松实现各种天马行空的形变效果。
团队访谈:学术突围与未来方向
Q1:为何放弃点对拖拽转向区域拖拽?
答:早期图像拖拽编辑以点对拖拽为主,但我们发现其控制精度不足,转而探索区域对控制的方向,这一方向当时关注的团队较少,且基于DiT架构的上下文学习让这类编辑任务变得切实可行,最终验证了技术路线的正确性。
Q2:高校实验室如何对抗大厂的资源优势?
答:核心是找到大模型尚未解决的痛点。当前大型图像模型虽然强大,但在精细区域拖拽上仍有明显不足。学术界的优势在于验证新技术的可行性,做出原型Demo,后续工业界可以在此基础上扩大数据规模和模型参数,打造通用落地模型,我们也期待能与业界合作扩展数据集规模。
Q3:2D拖拽为何具备3D意识?
答:这主要源于视频训练数据的先验知识。视频天然包含姿态调整、视角转换等连续帧信息,基于这些 data训练后,模型在2D编辑时就能学到3D变化的效果。
Q4:如何解决推理速度瓶颈?
答:当前在A6000显卡上生成一张图需要约35秒,难以直接用于网页或App。后续我们计划探索轻量化模型架构、引入稀疏注意力、跨步采样LoRA,以及模型量化、剪枝等加速手段,让模型更接近实用标准。
Q5:文本控制与空间拖拽如何融合?
答:未来的图像编辑大模型必然是多模态引导并存的。纯文本指令虽便捷,但无法实现像素级精细控制,因此模型还需要融合空间布局图、深度图、关键点等结构引导,而区域拖拽正是精细控制的重要方向。我们后续将推动点对拖拽与区域拖拽的模型统一,同时精准隔离拖拽时的因果关系,确保仅需要变化的区域做出调整。
目前ICRDrag的论文、代码与在线Demo均已正式开源,无论是科研人员还是普通创作者,都可以亲自体验这一高效的图像编辑工具。图像可控生成的前沿探索仍在继续,ICRDrag的出现为完美局部创作铺下了坚实的一步。

