文章摘要
图表示学习存在分布偏移问题,现有方法多将分布外泛化与检测任务割裂处理。近日多机构团队提出统一框架UniGOOD,通过不变子图分布生成器、跨不变子图谱对比学习模块和三总体不变正则化器实现联合优化。该框架在多数据集上性能优,消融实验验证模块有效,超参数敏感性低。其统一设计、理论保障与实验效果,为图学习落地提供方案。

图表示学习在诸多领域取得了突破性进展,但一个长期存在的核心痛点始终制约其落地应用:当训练数据与测试数据的分布出现不一致时,模型的性能会出现急剧退化,这一问题被称为分布偏移。

针对这一问题,学界衍生出两大独立的研究方向:分布外泛化聚焦协变量偏移,目标是在未知分布环境下仍保持稳定的模型性能;分布外检测则针对语义偏移,用于识别并筛除分布外的异常输入样本。

不过现实中的图数据往往同时混杂协变量偏移与语义偏移,但现有方法大多将两项任务割裂处理,这成为图学习走向实用的关键阻碍。

是否可以构建一个统一框架,让模型既能适应未知分布环境,又能精准识别异常输入?这一问题成为了图学习领域的重要研究方向。

近日,多机构联合研究团队提出了统一图分布外泛化与检测框架UniGOOD,首次将两项任务纳入统一优化体系。该框架通过三个协同设计的模块实现目标:不变子图分布生成器、跨不变子图谱对比学习模块以及三总体不变正则化器,能够在两种偏移并存的场景下捕获不变图模式,同时支撑高性能的泛化与检测任务。

不变图学习的核心是提取跨环境下特征与标签间保持稳定关系的不变子图,这为联合实现分布外泛化与检测提供了可行路径。当预测仅依赖不变特征时,可实现最优的分布外泛化;而有效的分布外检测也能从聚焦不变模式中获益。不过基于不变图学习设计联合框架,仍面临三大技术挑战:如何在无标签数据中建模不变子图、如何确保不变图表示同时适配泛化与检测任务、如何在恰当的不变性原则下整合带标签与无标签数据。

框架核心模块

UniGOOD通过三个核心模块实现联合优化:

  • 不变子图分布生成器:基于变分图自编码器架构,对不变子图的条件分布进行建模。传统确定性方法面临观测噪声与无标签过拟合的双重局限,该模块从概率视角切入,以双路图神经网络编码均值与方差参数化高斯分布,采样后经内积与阈值筛选分离不变与变化子图。由于真实不变子图未知,重构损失失效,KL散度成为唯一优化项,其权重控制采样随机性,为无标签数据注入结构先验,有效抑制过拟合。

  • 跨不变子图谱对比学习模块:利用不变子图的条件分布学习兼顾泛化与检测的图表示。该模块构造一张“总体图”,节点为全部样本,边权重表示不变子图间的语义相似度,实现同类增强、异类削弱。对总体图的归一化邻接矩阵做谱分解,取特征向量作为表示,这些表示天然编码了不变子图在类别空间中的关系结构,从而为泛化与检测提供了判别基础。直接学习特征矩阵并不现实,转而用一个图神经网络来参数化这些表示,经过等价推导,谱分解的低秩逼近目标可转化为结构清晰的对比学习损失,前两项拉近正样本对,后三项推远负样本对,正样本聚集支撑协变量偏移下的泛化,负样本分离增强语义偏移的检测敏锐度。

  • 三总体不变正则化器:回答了“生成器输出的子图何以称‘不变’”这一根本问题。在不变子图关于标签的总体图之外,补充定义变化子图关于标签、不变子图关于环境、变化子图关于环境三张总体图,并推导三总体对比学习损失函数。基于四张总体图共同构成的对比学习目标,可从理论上证明:存在最优的不变子图生成器及其互补的变化子图生成器,当且仅当这四项目标被同时最小化。

最终将四项损失与KL散度加权求和,推理时通过不变表示完成标签预测实现泛化,利用KNN距离完成无参分布外检测。

实验效果

UniGOOD在多个合成与真实世界图数据集上均取得了最优性能,在分布外泛化与检测两项任务中均显著超越现有基线方法。

在GD-Tox21-SIDER数据集上,UniGOOD的分布外泛化AUROC分数相对基线提升了9.53%;在GD-HIV-ZINC数据集上,分布外检测的FPR相对降低了9.21%。此外,框架在发现不变子图方面表现优于基线,尤其是在语义偏移场景下优势更为明显。

消融实验验证了各模块的有效性:移除KL损失会导致性能降至次优,说明其在生成多样化不变子图中起到关键作用;对三总体不变正则化器的任意单个损失分量进行消融,同样会造成性能下降,证实了专门设计的不变性原则能够增强不变子图的识别能力。

超参数敏感性分析显示,UniGOOD对超参数并不十分敏感,在较宽的参数取值范围内均能优于最优基线方法。可视化结果表明,该框架在编码空间中实现了语义偏移的分布外图与分布内图、协变量偏移图之间的清晰分离,这一判别能力显著提升了分布外检测的性能。

总结

UniGOOD为图分布外泛化与检测问题提供了一套统一的解决方案:

  • 统一的框架设计:将三个核心模块有机融合,在单个框架内协同解决两项任务,打破了此前两项任务割裂处理的局限。

  • 坚实的理论保障:从理论上证明了框架能够为两项任务提供可验证的最优解,为后续研究提供了坚实的理论基础。

  • 卓越的实验效果:多项基准测试均取得显著提升,验证了框架的实用性与先进性,为图学习在真实复杂场景中的落地提供了可行方案。

以上内容不代表本平台立场,仅供读者参考