文章摘要
传统过拟合检测依赖验证集损失上升,存在延迟。近期一项研究提出Log - Alignment Ratio(LAR)指标,可实时监测模型泛化状态,无需额外复杂运算和验证集。经多类实验验证,LAR能清晰反映模型训练阶段,区分泛化与过拟合,为大模型过拟合早期检测提供低成本手段。

训练过程中,当模型在训练集上的损失持续下降,甚至准确率接近100%时,并不代表它的泛化能力正在提升——这可能只是单纯记住了训练数据。传统的过拟合检测依赖验证集损失上升,但这种方式存在明显延迟,有没有办法在训练内部更早发现风险?

近期一项由《Attention Is All You Need》核心作者参与的研究,提出了一种名为Log-Alignment Ratio(LAR)的训练内部诊断指标,能够在不依赖验证集、额外开销极低的前提下,实时监测模型的泛化状态变化。

该指标重新定义了权重与激活的对齐程度:通过分析输出投影矩阵的权重和输入激活在不同奇异方向上的分布,当两者共同集中在少数方向时,LAR会升高,对应模型正在形成可泛化的通用表示;当任意一方的分布扩散,或者两者的集中方向出现错位时,LAR则会下降,预示模型逐渐陷入对训练数据的记忆,过拟合风险上升。

与传统的奇异值分解或主成分分析不同,LAR的实际计算仅依赖前向传播中已有的权重、激活和输出数据,无需额外的复杂运算,也不需要预留验证数据集,几乎不会增加训练的时间和资源成本。

研究团队首先在12类算法任务上验证了LAR的有效性,他们训练了两层Transformer,并调整模加法任务的训练集比例。实验显示,模型往往会先在训练集上达到99%以上的准确率,但此时验证准确率仍然很低;经过一段时间的训练后,部分模型会从记忆训练数据转向真正的泛化,也就是所谓的Grokking现象。

在这类实验中,LAR的变化轨迹清晰对应模型的训练阶段:从初始化时的约0.5开始短暂下降,随后持续上升,在记忆、Grokking和最终检查点三个阶段依次升高;发生Grokking的模型,最终的LAR值也明显高于未发生泛化的模型。同时,LAR还能够估算模型使用的有效维度,其结果与解释95%输入激活方差所需的主成分数量高度吻合,尤其是在模型完成泛化后的最终检查点,两者的偏差最小。

在小型算法任务上验证基本规律后,研究团队进一步在3B参数的语言模型预训练中测试了LAR的表现。他们共训练了10个模型,分别采用Adam和Muon两种优化器,数据规模覆盖2亿、4亿、8亿、16亿和1000亿token,其中1000亿token的数据集在训练预算内未出现过拟合,被用作非过拟合基线。

实验结果显示,基线模型的LAR从约0.5开始上升,在Adam优化器下峰值约为0.676,在Muon优化器下约为0.688,随后缓慢下降;而出现过拟合的模型,其LAR曲线在训练后期的下降幅度明显更大。研究团队以LAR峰值后的1000个训练步骤为窗口统计下降斜率,发现非过拟合模型的LAR下降速度会逐渐放缓并趋于稳定,而过拟合模型的LAR则会在接近过拟合时刻时出现更陡峭的下降。

研究团队还将LAR与稳定秩、有效秩进行了对比,发现稳定秩几乎无法区分泛化与过拟合状态,有效秩仅在Muon优化器下有一定区分度,而LAR在两种优化器下都能更清晰地分辨模型的训练状态。

他们通过基线模型的LAR与其他数据规模实验的LAR的差值,也就是LAR差分,与泛化差距(验证损失减去平滑训练损失)进行对照,发现两条曲线在训练过程中的形状高度相似。由于LAR差分的计算完全不依赖验证数据,这一结果证明,内部监测信号能够与外部评测结果保持一致。

进一步分析显示,输出投影矩阵的第一奇异值约为第二奇异值的3倍,因此第一奇异方向上的权重能量约为第二方向的9倍,过拟合前的大部分变化都集中在第一奇异方向的权重-激活重叠中。在Adam优化器下,过拟合信号主要来自激活谱的扩散;而在Muon优化器下,权重谱和激活谱都会出现扩散,尽管两种优化器的内部变化路径不同,但过拟合出现前,计算方向的集中程度都会发生明显改变。

这项研究将泛化监测从依赖损失曲线的外部评测,推进到了模型内部的实时监测。LAR无需改变模型架构和训练目标,仅利用前向传播的既有信息就能提供持续的训练信号,为研究者和开发者提供了一种低成本、高效率的过拟合早期检测手段,让大模型的训练过程更加可控。

在传统的训练流程中,判断模型是否出现过拟合往往需要等待验证集损失的变化,而LAR则允许开发者在训练过程中实时监控内部计算方向的变化,更早地做出调整,避免不必要的训练资源浪费。

以上内容不代表本平台立场,仅供读者参考