文章摘要
生成式AI技术便利了视觉内容修改,也带来版权认证新挑战,传统水印易被AI编辑、全景旋转等变换破坏。近期两项研究基于变换不变量思路,分别提出应对AI编辑的Rel-Zero零水印方案、应对全景旋转的TRIAD方案,性能优于现有方案,为鲁棒水印研究指明新方向,同时存在一定局限。

随着生成式AI技术的快速发展,视觉内容的创作与修改变得愈发便捷,但也带来了版权认证的新挑战:无论是局部重绘、风格迁移还是全景图像的视角变换,传统依赖固定像素或局部纹理的水印方案很容易被轻易破坏,无法在内容变换后保留有效的所有权凭证。

近期两项相关研究从“变换不变量”这一核心视角出发,分别针对AI编辑后的图像与可旋转全景图像,提出了鲁棒性更强的水印方案,不再依赖对抗攻击训练或有限的特征记忆,而是将内容身份锚定在变换后依然稳定的结构上。

第一项工作针对AI编辑带来的图像语义与外观变化,提出了无需修改原图的零水印方案Rel-Zero。传统嵌入式水印需要向图像写入额外信号,为了抵御生成式编辑往往需要增强信号强度,这会在鲁棒性与视觉保真度之间产生难以平衡的权衡;而零水印方案则通过提取内容本身的指纹并外部存储,避免了对原图的修改,但早期的零水印依赖全局或手工特征,很容易被强语义编辑覆盖。

Rel-Zero的核心观察在于:生成式编辑虽然会改变单个图像块的像素或语义特征,但部分图像块之间的相对距离依然能够保持稳定。也就是说,如果两个图像区域在原图中差异显著,那么经过局部编辑、全局修改或重新生成后,它们的相对差异往往依然存在,这种关系结构比单一的局部外观更难被同时抹去。

该方案通过三个步骤实现:首先利用冻结的VAE重建图像,模拟生成式编辑带来的特征位移,从原图与重建图中挖掘最稳定的图像块对作为训练监督;接着使用冻结的ViT提取每个图像块的语义特征,计算全连接的图像块对关系;最后通过轻量的关系预测器为所有候选图像块对打分,选取Top-K对的索引集作为零水印。验证时只需在待检图像中重新预测关系集合,计算与登记集合的重合度即可完成认证。

在固定假阳性率为0.1%的测试设置下,Rel-Zero在确定性再生成、Instruct-Pix2Pix、MagicBrush、UltraEdit和ControlNet-Inpainting五类AI编辑场景中,真正例率分别达到85.13%、89.65%、95.63%、96.55%和97.43%,相比现有零水印基线有显著提升;对于裁剪、缩放、对比度调整、亮度变化和高斯噪声等常规失真,其真正例率也保持在95.12%至98.57%之间。更重要的是,该方案全程未修改原图像素,SSIM值为1.000、LPIPS值为0.000,特别适合医学影像、档案图像和高质量视觉资产等对原始像素敏感的场景。

第二项工作则针对全景图像的旋转问题,提出了TRIAD方案。全景图像本质上定义在球面之上,用户改变观看视角对应的是三维旋转群SO(3)的作用,而常见的等距柱状投影将球面展开为矩形平面后,刚性旋转会表现为纬度相关的非线性扭曲,物体可能跨越图像边界、极区被拉伸,局部纹理发生大范围位移,依赖二维卷积或像素对齐的水印解码器很难覆盖这种连续且无限的变换空间。

TRIAD首先通过球谐变换将全景图像表示为不同阶数的球谐系数,旋转不会随意破坏这些系数,而是让同一阶的表示按照Wigner-D矩阵进行结构化变换,保持SO(3)等变性。如果仅使用零阶系数虽然可以得到旋转不变量,但这类全局平均的低频信息容量有限,修改后还会带来明显的亮度变化。

为此,该方案将水印写入更高阶的不可约表示子空间,并在提取阶段对三个高阶表示进行张量耦合,再借助Clebsch-Gordan系数投影到平凡表示V₀。得到的三阶标量与球面双谱等价:无论输入如何旋转,最终标量都能保持不变,同时保留了二阶功率谱会丢失的相位耦合信息,能够承载更高容量的水印。

在panoContext与SUN360数据集上的测试显示,当使用10000幅全景图训练、2000幅测试,默认嵌入32bit水印时,未使用旋转增强的平面水印基线一旦脱离0°视角,比特准确率会迅速跌至接近随机猜测的50%,即使加入离散旋转增强,表现依然会随视角剧烈波动;而TRIAD在0°到180°的测试范围内,始终保持近乎100%的比特准确率。在视觉保真度方面,32bit配置下的PSNR达到39.22dB,SSIM为0.9946;面对JPEG压缩、缩放、对比度调整、亮度变化、高斯噪声、模糊、中值滤波及混合失真时,比特准确率保持在97.5%至100%之间,混合失真下也能达到98.4%。此外三阶双谱的容量优势也得到验证:二阶功率谱在32bit时仅有61.3%的比特准确率,而三阶双谱在16、32和64bit设置下均能实现100%的比特准确率。

两项工作虽然针对不同的攻击场景——前者应对生成式编辑带来的语义与外观变化,后者应对球面数据上的连续几何变换,但都做出了相似的研究选择:不再将鲁棒性理解为“训练时接触更多攻击样本”,而是追问“哪些结构在变换后依然存在”。

Rel-Zero将水印锚定在图像块之间的相对关系上,生成式编辑通常受内容保持、局部约束和低维编辑方向的影响,因此图像内部的部分关系几何能够保持稳定;而TRIAD则通过群表示中的平凡分量实现旋转不变性,将等变特征通过三阶耦合投影为标量,从数学结构上抵消了旋转带来的姿态变化。一个基于数据规律,一个来自表示论,但最终都将水印从脆弱的绝对特征迁移到了更稳定的关系或不变量上。

这种思路为鲁棒水印的设计提供了可推广的方法论:面对新的内容变换,未必需要依赖更大的模型和更多的攻击增强,而是可以先识别变换群、保持量与可观测关系,再选择合适的嵌入和提取空间,往往能得到更清晰的机制解释与更可靠的泛化能力。

当然两项方案也存在各自的局限:Rel-Zero依赖生成式编辑保留足够的跨区域关系,如果攻击进行大比例裁剪、完全重绘或刻意破坏图像块的关系结构,其稳定性还需要进一步检验,同时该方案也需要可信的外部登记与检索系统。TRIAD的理论不变量建立在完整的球面信号与SO(3)旋转设定上,离散球谐变换、ERP采样、局部视野或缺失区域都会带来数值误差,进一步扩大有效载荷时,也需要处理高阶频带更容易受压缩和混叠影响的问题。

尽管存在这些限制,两项工作依然为鲁棒水印的研究指明了新的方向:从平面图像走向球面、三维与多模态内容,从经验攻击集合走向对称性和不变量,从单一水印信号走向与内容内在结构绑定的身份表示。

以上内容不代表本平台立场,仅供读者参考