文章摘要
浙江大学团队开源的PhyEdit是一种全新AI图像编辑技术组合方案,借助3D基础模型和DiT图像编辑器,可实现单张图片内物体跨位置移动。在ManipEval测试和匿名盲测中表现出色,成果被ACM MM 2026收录。它有复杂遮挡精准落位等三大优势,有专属数据集,提供易用开源工具链,但也存在一定局限,为图像生成交互化提供新思路。

当前图像生成模型正从单纯的创作功能向可交互操作方向进化,但要将单张图片中的物体精准移动到另一个三维空间位置,难度远高于简单的颜色替换或风格迁移。

浙江大学相关团队开源的PhyEdit,展示了一种全新的技术组合方案:借助成熟的3D基础模型明确目标物体的几何空间信息,再通过高性能的DiT图像编辑器完成最终的视觉渲染。

该方案可以实现单张图片内物体的跨位置移动,不仅能从近处移至远处、穿过遮挡区域,还能按照用户指定的三维轨迹生成连续的状态变化效果。

在ManipEval基准测试中,PhyEdit的DIoU达到65.33,Chamfer距离降至18.93。对比同类方案Nano Banana Pro,其DIoU提升了5.36,Chamfer距离降低了6.40;在匿名盲测环节,PhyEdit获得了78.0%的整体偏好率。这项研究成果已被ACM MM 2026收录。

超出训练分布的实战案例

团队展示了一个未在训练数据中出现的机械臂操作场景:用户提供一条弯曲的移动轨迹后,PhyEdit会先生成不同目标点的关键状态帧,再通过视频模型补全中间的过渡画面。其中实线边框为PhyEdit直接生成的帧,虚线边框为插值生成的过渡帧,整个移动过程中,机械臂、红笔、桌面和纸张之间的尺度与位置关系始终保持稳定。

需要说明的是,PhyEdit并非自主预测动作的动力学模型,所有轨迹均由用户指定,其核心作用是将给定的三维动作指令渲染为可信的视觉状态。

三大核心能力优势

复杂遮挡下的精准落位

现有图像编辑模型往往能够识别需要移动的目标物体,但无法准确判断物体在目标位置的合理尺度和前后遮挡关系,常见的失败案例包括源位置残留、深度信息错误、仅完成部分目标物体的编辑等。而PhyEdit在处理物体遮挡、深度方向大幅变动以及多物体协同操作时,表现出更强的稳定性。

ManipEval基准测试并非仅比较二维边界框,还包含深度误差、点云Chamfer距离、质心距离、relocation-aware DINO和物理合理性等多项评估指标。PhyEdit的Phys-VLM指标达到93.72,同时DeQA得分与其基础模型Qwen-Image-Edit基本持平,说明几何精度的提升并未带来视觉画质的明显下降。

适配多种3D几何模型

PhyEdit默认使用Depth-Anything-3作为几何估计模型,但整个框架并未绑定特定的3D模型。研究人员固定编辑器的checkpoint,仅更换用于生成preview的3D backbone即可完成适配。测试结果显示,DA2、MoGe、VGGT、Pi3X和DA3对比Nano Banana Pro,都保持了正向的平均几何增益,其中DA3的Geo.Δ为+5.55,Pi3X为+3.94,MoGe为+3.62。

这说明PhyEdit的性能提升并非依赖某一款特定的深度模型,更换精度更高的几何估计器还能进一步拉高模型上限。即使3D preview出现一定问题,PhyEdit仍能借助原图和用户指令的信息,生成较为合理的编辑结果。

移动与编辑同步完成

加入三维空间控制功能后,模型原有的基础图像编辑能力是否会受到影响?团队通过300条额外指令,测试了颜色、材质、图案和局部元素的编辑效果。

PhyEdit需要在单次生成流程中同时完成三维物体移动和附加编辑任务,综合成功率达到87.5%;而Qwen-Image-Edit在仅执行纯编辑任务时的成功率为88.8%,两者差距仅1.3个百分点。但PhyEdit的三维Chamfer距离为20.97,远低于Qwen-Image-Edit的46.31,证明其三维定位精度优势显著。

核心技术实现逻辑

PhyEdit以Qwen-Image-Edit作为生成主干网络。用户选择目标物体并给出三维位移指令后,冻结的3D模型会先估计深度信息和相机参数,将掩码后的像素反投影为点云,在三维空间中完成物体位移后再重新投影为preview图像。

尽管这个preview图像可能比较粗糙,但它可以有效消除语言描述中的空间歧义,明确物体的新位置、投影尺度和前后遮挡顺序;原图则保留了物体的纹理、身份和整体环境信息,最终由DiT模型将两者融合为自然的最终画面。因此PhyEdit并非直接将点云渲染作为最终结果,而是将其转换为生成模型可以理解的“3D草稿”。

为了避免最终图像仅在外观上相似但深度信息存在错误,训练过程中加入了pixel-level SILog深度损失函数。对比latent-to-latent、latent-to-depth等方案,直接监督解码后图像的深度信息,取得了最佳的几何评估指标。

专属训练数据集RealManip-40K

研究团队构建了RealManip-40K数据集,包含41154对真实源图和目标图,提供深度图、物体掩码和代表性三维坐标,覆盖远近变化、遮挡切换和多物体操作等多种场景。

数据管线首先利用3D模型的camera token聚类筛选近静态机位,避免将相机的移动误判为物体位移,之后再依次完成目标检测、跟踪、图像分割、深度重建和VLM过滤等步骤,确保数据集的标注质量。

易用的开源工具链

本次开源的仓库提供了完整的GUI界面,用户可以直接上传图片、选择多个目标物体,在点云可视化界面中调整平移和旋转参数,先查看实时的几何preview效果,再调用模型生成最终的编辑后图像。

总结与现存局限

PhyEdit对“physically-grounded”的定义并非完整的物理仿真,仅通过显式模块处理刚体位移、投影、尺度和深度顺序,不涉及力、碰撞或动力学计算。透明反光物体、极端近景移动以及严重的深度和分割错误,仍然是当前模型的主要失败场景。

但这项工作的核心意义在于边界清晰:当基础生成模型已经具备出色的视觉创作能力时,可以将空间中可计算、可验证的部分交给几何模块处理,而非继续依赖纯文本prompt解决所有三维空间歧义,为图像生成的交互化发展提供了新的思路。

以上内容不代表本平台立场,仅供读者参考