文章摘要
人像后期修图中调整光线需求常见但现有AI方案有局限,如光照不稳定、数据集难支撑真实场景等。美图影像研究院提出CFT方法,将人像重打光定义为光照一致的特征传输问题。该方法有核心训练目标,构建了大规模数据集。在性能验证和跨任务泛化上表现优,相关能力已上线美图三款产品。

在人像后期修图中,调整光线氛围是最常见也最考验技术的需求之一,比如将普通室内人像改成午后暖阳的柔和质感,或是切换到赛博霓虹的冷调氛围,甚至用伦勃朗光突出人物侧脸轮廓。但在复杂光照场景下,现有的AI人像重打光方案常常出现光照不稳定、阴影方向错乱,甚至改变人物本身特征的问题。

目前主流的三类基于扩散模型的人像重打光方案都存在各自的局限:基于控制信号驱动的方案虽然可控性有所提升,但最终效果高度依赖控制信号的准确性与完整性;基于本征分解的方法在复杂光照环境中容易出现误差累积,导致阴影不一致、色彩偏移或是细节丢失;而直接图到图翻译的方案没有显式建模光照专属的特征位移,在光照编辑的精度和表达力上都存在明显不足。

此外,现有的公开人像重打光数据集规模有限,且大多在受控环境下采集,缺乏多色温、空间变化阴影、非均匀照明等复杂光照效果,难以支撑真实场景下的可控重打光模型训练。

针对这些痛点,美图影像研究院(MT Lab)提出了一致特征传输(Consistent Feature Transport,简称CFT)方法,将人像重打光重新定义为光照一致的特征传输问题,在Rectified Flow框架下显式学习源图像与目标光照图像分布之间的光照变换,而非通用的图像翻译。该研究成果已被计算机视觉顶级会议ECCV 2026收录。

本次研究的论文标题为《Consistent Feature Transport for Image Relighting》,相关项目资源已对外公开。

核心技术框架

CFT在噪声、源图像、目标图像三个分布之间建立联合建模,整体训练目标包含三个核心部分:

1. 噪声到目标图(L₁):给定源图像xsrc、重打光目标图像xtgt以及文本描述条件ctgt,学习从先验噪声到目标隐空间的速度场,完成条件式生成。

2. 噪声到源图(L₂):在同一先验噪声下,以中性描述条件csrc重建源图像的分布,这条路径可以强化模型对非光照内容(包括人物身份、面部几何、场景结构)的保留能力。

3. 源图到目标图:光照一致的特征传输(L₃,CFT的核心模块):借鉴无反演编辑的思路,利用Rectified Flow的线性特性,通过平行四边形法则构造从源图像到目标图像的直接传输路径:ztdirect=zsrc+zttgt−ztsrc,对应的速度场为vtdirect=vθ(zttgt,t,xsrc,ctgt)−vθ(ztsrc,t,xsrc,csrc)。

值得注意的是,L₃的监督采用了身份与场景内容不同,但光照变换完全相同的图像对作为真值。如果直接使用同一组图像对作为监督,模型容易拟合样本特有的内容差异,将光照变化与非光照变化混淆;而使用“同光照变换、不同内容”的配对样本,可以让模型学习到可跨实例复用的光照特征传输能力,在生成稳定性与光照传输监督之间取得了更好的平衡。

为了支撑复杂光照场景的训练,研究团队构建了覆盖室内、室外等主流场景的大规模人像重打光数据集,包含14类不同的光照效果类别,重点支持空间结构化照明、多色温与复杂阴影的建模,弥补了现有肖像重打光数据在复杂光效上的不足。

模型性能验证

在自建的测试集上,CFT方案相比现有主流方案,在像素保真度、感知相似度、分布真实感以及光照专用指标上都表现更优。定性实验结果显示,在多光源交互、空间结构化照明、色温大幅偏移等难度较高的场景中,CFT在光照一致性和生成稳定性上都有明显优势。

根据30名用户对40组随机样本的打分结果,结合Flux-Kontext的Flux-Kontext + CFT方案在光照质量、内容一致性、物理合理性以及图像美学四个评估维度上都取得了最佳表现。此外,消融实验结果显示:单独增加L₂无法提升重打光质量,但与L₃结合时可以提供额外的结构保持能力,完整的CFT方案效果最优;如果L₃使用原始的(xsrc,xtgt)或是随机配对的样本作为监督,模型性能反而会下降,甚至不如仅使用L₁的方案;对传输速度场的方差分析表明,完整的CFT方案在训练集和测试集上都拥有最低的方差,能够学习到更一致、稳定的光照特征传输场。

配置 SSIM↑ PSNR↑ LPIPS↓ FID↓
仅 L₁ 0.9153 22.92 0.0985 20.38
L₁ + L₂ 0.9141 22.83 0.1018 21.61
L₁ + L₃ 0.9161 23.38 0.0972 19.32
L₃用原始配对监督 0.9141 22.8 0.1003 20.3
L₃用随机配对监督 0.9135 22.8 0.1035 19.55
完整 CFT(L₁+L₂+L₃) 0.9202 23.51 0.0946 18.73

跨任务泛化能力

CFT的“一致特征传输”思路并不局限于人像重打光任务。研究团队在OmniStyle-150k数据集上构建了风格迁移测试集,并将CFT应用于OmniStyle和Qwen-Image-Edit两个方案中,结果显示,加入CFT后,模型在内容结构保留和感知保真度上都有持续提升,生成结果在风格化效果上也实现了更好的平衡,证明CFT可以迁移到风格迁移等多种属性编辑任务中。

方法 SSIM↑ PSNR↑ LPIPS↓
OmniStyle(w.o. CFT) 0.5222 13.8 0.4125
OmniStyle(w. CFT) 0.5275 14.12 0.3945
Qwen-Image-Edit(w.o. CFT) 0.4422 12.97 0.3697
Qwen-Image-Edit(w. CFT) 0.4648 13.37 0.3562

目前,基于CFT的图片打光能力已经上线美图旗下的Picchi、AirBrush与BeautyPlus三款产品,用户无需输入冗长的提示词,就可以快速实现多种不同的光线效果调整。

以上内容不代表本平台立场,仅供读者参考