CFT一致特征传输:美图图像打光技术革新

在人像后期修图中,调整光线氛围是最常见也最考验技术的需求之一,比如将普通室内人像改成午后暖阳的柔和质感,或是切换到赛博霓虹的冷调氛围,甚至用伦勃朗光突出人物侧脸轮廓。但在复杂光照场景下,现有的AI人像重打光方案常常出现光照不稳定、阴影方向错乱,甚至改变人物本身特征的问题。
目前主流的三类基于扩散模型的人像重打光方案都存在各自的局限:基于控制信号驱动的方案虽然可控性有所提升,但最终效果高度依赖控制信号的准确性与完整性;基于本征分解的方法在复杂光照环境中容易出现误差累积,导致阴影不一致、色彩偏移或是细节丢失;而直接图到图翻译的方案没有显式建模光照专属的特征位移,在光照编辑的精度和表达力上都存在明显不足。
此外,现有的公开人像重打光数据集规模有限,且大多在受控环境下采集,缺乏多色温、空间变化阴影、非均匀照明等复杂光照效果,难以支撑真实场景下的可控重打光模型训练。
针对这些痛点,美图影像研究院(MT Lab)提出了一致特征传输(Consistent Feature Transport,简称CFT)方法,将人像重打光重新定义为光照一致的特征传输问题,在Rectified Flow框架下显式学习源图像与目标光照图像分布之间的光照变换,而非通用的图像翻译。该研究成果已被计算机视觉顶级会议ECCV 2026收录。
本次研究的论文标题为《Consistent Feature Transport for Image Relighting》,相关项目资源已对外公开。
核心技术框架
CFT在噪声、源图像、目标图像三个分布之间建立联合建模,整体训练目标包含三个核心部分:
1. 噪声到目标图(L₁):给定源图像xsrc、重打光目标图像xtgt以及文本描述条件ctgt,学习从先验噪声到目标隐空间的速度场,完成条件式生成。
2. 噪声到源图(L₂):在同一先验噪声下,以中性描述条件csrc重建源图像的分布,这条路径可以强化模型对非光照内容(包括人物身份、面部几何、场景结构)的保留能力。
3. 源图到目标图:光照一致的特征传输(L₃,CFT的核心模块):借鉴无反演编辑的思路,利用Rectified Flow的线性特性,通过平行四边形法则构造从源图像到目标图像的直接传输路径:ztdirect=zsrc+zttgt−ztsrc,对应的速度场为vtdirect=vθ(zttgt,t,xsrc,ctgt)−vθ(ztsrc,t,xsrc,csrc)。
值得注意的是,L₃的监督采用了身份与场景内容不同,但光照变换完全相同的图像对作为真值。如果直接使用同一组图像对作为监督,模型容易拟合样本特有的内容差异,将光照变化与非光照变化混淆;而使用“同光照变换、不同内容”的配对样本,可以让模型学习到可跨实例复用的光照特征传输能力,在生成稳定性与光照传输监督之间取得了更好的平衡。
为了支撑复杂光照场景的训练,研究团队构建了覆盖室内、室外等主流场景的大规模人像重打光数据集,包含14类不同的光照效果类别,重点支持空间结构化照明、多色温与复杂阴影的建模,弥补了现有肖像重打光数据在复杂光效上的不足。
模型性能验证
在自建的测试集上,CFT方案相比现有主流方案,在像素保真度、感知相似度、分布真实感以及光照专用指标上都表现更优。定性实验结果显示,在多光源交互、空间结构化照明、色温大幅偏移等难度较高的场景中,CFT在光照一致性和生成稳定性上都有明显优势。
根据30名用户对40组随机样本的打分结果,结合Flux-Kontext的Flux-Kontext + CFT方案在光照质量、内容一致性、物理合理性以及图像美学四个评估维度上都取得了最佳表现。此外,消融实验结果显示:单独增加L₂无法提升重打光质量,但与L₃结合时可以提供额外的结构保持能力,完整的CFT方案效果最优;如果L₃使用原始的(xsrc,xtgt)或是随机配对的样本作为监督,模型性能反而会下降,甚至不如仅使用L₁的方案;对传输速度场的方差分析表明,完整的CFT方案在训练集和测试集上都拥有最低的方差,能够学习到更一致、稳定的光照特征传输场。
| 配置 | SSIM↑ | PSNR↑ | LPIPS↓ | FID↓ |
| 仅 L₁ | 0.9153 | 22.92 | 0.0985 | 20.38 |
| L₁ + L₂ | 0.9141 | 22.83 | 0.1018 | 21.61 |
| L₁ + L₃ | 0.9161 | 23.38 | 0.0972 | 19.32 |
| L₃用原始配对监督 | 0.9141 | 22.8 | 0.1003 | 20.3 |
| L₃用随机配对监督 | 0.9135 | 22.8 | 0.1035 | 19.55 |
| 完整 CFT(L₁+L₂+L₃) | 0.9202 | 23.51 | 0.0946 | 18.73 |
跨任务泛化能力
CFT的“一致特征传输”思路并不局限于人像重打光任务。研究团队在OmniStyle-150k数据集上构建了风格迁移测试集,并将CFT应用于OmniStyle和Qwen-Image-Edit两个方案中,结果显示,加入CFT后,模型在内容结构保留和感知保真度上都有持续提升,生成结果在风格化效果上也实现了更好的平衡,证明CFT可以迁移到风格迁移等多种属性编辑任务中。
| 方法 | SSIM↑ | PSNR↑ | LPIPS↓ |
| OmniStyle(w.o. CFT) | 0.5222 | 13.8 | 0.4125 |
| OmniStyle(w. CFT) | 0.5275 | 14.12 | 0.3945 |
| Qwen-Image-Edit(w.o. CFT) | 0.4422 | 12.97 | 0.3697 |
| Qwen-Image-Edit(w. CFT) | 0.4648 | 13.37 | 0.3562 |
目前,基于CFT的图片打光能力已经上线美图旗下的Picchi、AirBrush与BeautyPlus三款产品,用户无需输入冗长的提示词,就可以快速实现多种不同的光线效果调整。

