稀疏权重分解:低数据成本的大模型可解释性新路径

在大模型机制可解释性研究中,长期存在一个极具反差的现实困境:想要拆解一个已经训练完成的模型内部运行逻辑,研究者往往需要先额外训练一套全新的稀疏表示模块。
诸如Transcoder、稀疏特征模块这类现有方法,会通过学习一组新的内部单元来近似原模型某一层或某个模块的计算过程,再通过保留或移除这些单元来寻找对应的任务回路。这类方案确实推动了机制可解释性领域的发展,但也带来了不少额外成本:新的表示模块需要额外的数据和优化步骤,而且如果替代模块无法充分复现原模块的行为,后续的分析就会同时混杂模型本身的行为和替换带来的误差。
简单来说,研究者想要打开一个黑箱,却往往需要先训练另一个更小的“黑箱”来完成这项工作。
这类方案的问题不止在于训练成本。真正的任务回路需要找到一组可以独立干预的内部计算单元:只保留这些单元时,模型的相关任务能力依然存在;移除它们时,模型的表现会出现明显下降。而传统的训练型替代表示通常需要针对不同模型、不同层甚至不同训练checkpoint分别进行拟合,这让大规模、系统性的回路分析变得更加困难。
更理想的解决方案,应当同时满足三个核心要求:能够保持原模型的行为、提供可以独立干预的单元,并且可以直接从已有预训练权重中以较低成本构造得到。
由至知创新研究院联合Safe AI Forum、牛津大学、斯坦福大学、清华大学的研究者提出了一条更为直接的技术路线:不再训练一套独立的替代网络,而是从现有的预训练权重中直接“拆解”出可干预的内部单元。这套方法被命名为稀疏权重分解(Sparse Weight Decomposition,简称SWD)。
SWD的核心思路是将一个稠密的权重矩阵分解为两个稀疏矩阵,并且让两个矩阵共享中间维度,这些共享的中间维度就成为了可以独立评分、选择和消融的瓶颈单元。研究者可以直接通过这些权重本身来抽取任务回路,无需额外训练替代模块。
该论文给出了三项值得关注的核心结果:
- 在匹配替换保真度的单矩阵实验中,SWD使用的数据量不到Transcoder等训练型基线方法的1%;
- 在GPT-2、Qwen2.5和Qwen3.5-27B的任务回路实验中,SWD通常只需要更少的瓶颈单元和活跃连接,就能达到相同的充分性和必要性测试目标;
- 该方法不仅可以扩展到27B规模的大模型,还覆盖了GPT-2 Small全部48个注意力和MLP权重矩阵,同时还提供了完全不需要校准文本的zero-data版本。
SWD的出发点十分直观。对于预训练模型中的稠密权重矩阵W,我们需要寻找到两个稀疏矩阵A和B,使得W≈AB。A和B共享m个中间维度,第i个维度会先通过A的第i列从输入中读取一个标量,再通过B的第i行将这个标量写入输出。这样一来,A的一列和B的一行共同构成了一个瓶颈单元,也就是一条固定的rank-one读写路径。
我们可以把这个过程想象为在一张极其密集的交通网络中新增一组“中转站”:每个中转站只连接少量的入口和出口。研究者不仅可以清楚地看到一条路径从哪里读取数据、向哪里写入数据,还可以单独关闭这个中转站,观察模型的行为会发生怎样的变化。
真正的挑战在于,如何在大幅减少连接数量的同时,依然保留原权重对模型激活的作用。SWD会使用少量校准文本产生的层输入,来优化分解前后的输出误差;在求解过程中会交替更新两个因子,通过硬阈值来维持非零连接的预算,并重新拟合保留下来的权重值。完成分解后,每个瓶颈单元都可以像稀疏特征一样参与任务归因、排序和消融,完全不需要再训练一套独立的神经替代网络。
既然目标是直接分解权重,一个很自然的问题是:为什么不直接使用奇异值分解(SVD)?SVD同样可以将一个矩阵表示为多个rank-one成分的之和,而且不需要训练数据,近期的NaNA等方法也已经证明,SVD的成分可以用于任务排序和干预。
但对于回路分析来说,单元数量少并不等于真正的计算路径少。SVD成分的读方向和写方向通常都是稠密的,即使只保留少数成分,它们依然可能连接几乎所有的输入和输出维度。而SWD则进一步将稀疏性施加到了每个单元的读写连接上,少量的瓶颈单元对应的同时也是少量的活跃连接。
研究团队还构造了两个能够精确还原GPT-2原权重的稠密对照方案:保留全部奇异值的full-rank SVD,以及采用随机正交基的Random-B。这两种分解都可以在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要更多的活跃连接才能达到与SWD相同的任务表现。这组对照实验表明,SWD的优势并不是简单地“把矩阵拆开”,真正的关键在于每个单元都具备稀疏的读写结构。
在进行回路分析之前,首先需要回答一个更基础的问题:将原权重替换为稀疏分解后的结构,模型还是原来的模型吗?
研究团队使用留出文本上的交叉熵差值(CE delta)来衡量替换保真度,同时使用KL散度和替换位置的激活重构误差作为补充验证指标。CE delta越接近0,说明替换后的模型行为越接近原模型。
在GPT-2 Small第8层mlp.c_proj的单矩阵实验中,SWD仅使用数千个校准token就进入了低CE误差区间;而Transcoder和VPD-Recon-CI等训练型基线方法则需要约10^6量级的optimizer-replay token才能达到相近的替换质量。这一趋势同样出现在Qwen2.5-0.5B、1.5B、3B以及Qwen3.5-27B等模型上。
综合所有单矩阵的比较结果来看,在达到相同替换保真度的前提下,SWD使用的数据量不到训练型替代表示方法的1%。这意味着,大量的数据和长时间的替代模块训练,并不是获得高保真回路单元的必要前提。直接从预训练权重出发,也可以构造出足够忠实的干预表面。
高保真地复现原矩阵,只能说明所有瓶颈单元合在一起能够正常工作。真正的任务回路还需要满足两个更严格的条件:只保留少量选中的单元时,模型的任务行为仍然存在;只移除这些单元时,模型的任务表现会出现明显下降。前者被称为充分性测试,后者则是必要性测试。
研究团队首先在独立训练划分上使用一阶任务归因对候选单元进行排序,随后构造从top-1、top-2到top-k的嵌套回路,并在留出测试集上进行评估。回路的成本同时通过两个口径来衡量:选中的瓶颈单元数量,以及这些单元实际包含的非零读写连接数量。
在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四项任务上,SWD在达到相同的充分性或必要性要求时,通常只需要比Transcoder和VPD-Recon-CI更少的单元和活跃连接。即使将平均激活消融替换为零消融,这一优势依然保持。这一结果同样可以扩展到Qwen2.5和Qwen3.5-27B等模型上。
换句话说,SWD得到的不只是一种低误差的矩阵近似,而是一组真正能够通过因果检验的任务回路单元。
SWD的验证并没有停留在GPT-2的单个矩阵上。在模型规模方面,研究团队将单矩阵替换和回路抽取流程扩展到了Qwen2.5-0.5B、1.5B、3B,最终进一步验证到了Qwen3.5-27B。在27B模型的第31层mlp.down_proj上,SWD依然只需要显著更少的数据就能达到低CE delta,并且以更少的活跃连接达到相当的充分性和必要性测试目标。
在替换范围方面,研究团队进一步将GPT-2 Small 12个Transformer block中的全部48个注意力和MLP权重矩阵都替换为稀疏分解结构,同时保留了embedding、LayerNorm、非线性函数和输出头。由于局部近似误差会在跨层累积,团队将SWD作为稀疏初始化,固定所有非零位置,只微调已经保留下来的因子值。得到的SWD-FT在连接数量不变的情况下,将模型的交叉熵从3.90降至3.44,略优于相近非零参数预算下稀疏预训练基线的3.45。
更值得注意的是,SWD-FT总计使用了约2060万个token,而稀疏预训练基线达到相近的CE值则需要28.84亿个token,前者的数据量同样不到后者的1%。这让从现有稠密checkpoint出发构造全模型的稀疏干预表面,成为了一条极具吸引力的技术路线。
SWD还提供了一个完全不需要校准文本的zero-data版本。在GPT-2 Small的单矩阵实验中,该版本完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差。实验结果显示,zero-data SWD在权重空间中更接近原矩阵;而使用激活校准的SWD则在高稀疏度下,更能保持典型文本上的模型行为。即使完全不使用校准激活,zero-data SWD得到的瓶颈单元依然能够抽取出有效的任务回路,这为逐checkpoint、逐训练阶段追踪大模型的内部结构提供了新的可能性。
回路曲线已经证明了这些单元在因果测试中有效,但机制可解释性还关心另一个问题:这些单元能否呈现出可理解的语义模式?
研究团队在GreaterThan任务上,对GPT-2 Small全部9208个候选mlp.c_proj瓶颈单元进行归因排序,并从第6、8、10层中展示了六个高排名的单元。随后,他们在独立的WikiText-2文本上收集每个单元的高激活上下文,并通过大模型总结重复出现的语义模式。
在这六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个则更多对应标点、句法和命名实体。这些语义模式并没有参与单元的选择过程,但却与GreaterThan任务所需的数值比较能力形成了明显的呼应。
研究团队还进行了一项独立的定向编辑实验。他们筛选出瓶颈单元c205,并将该单元读方向诱导的rank-one更新施加到原始稠密的GPT-2权重上。在提示词“The opposite of up is”中,正确答案“down”相对干扰答案“left”的logit margin提高了0.216;而在七条无关的事实提示上,平均末token KL仅为4.02×10^-5。在相近的正向目标变化下,这个单单元方向测得的副作用低于随机单元和rank-4 LoRA对照。
这意味着,从权重分解中得到的瓶颈方向,不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。
过去,机制可解释性往往需要先学习一套新的特征字典或替代模块,再对这些新单元进行归因和干预。SWD则展示了另一种可能:预训练权重本身就可以被重新组织成稀疏、可寻址、可通过因果检验的计算路径。
从不到1%的数据成本,到更少的瓶颈单元和活跃连接;从GPT-2、Qwen2.5到Qwen3.5-27B;从单矩阵、整个Transformer主干到完全不依赖校准文本的zero-data分解,SWD正在将权重侧的机制可解释性变成一条更轻量、也更容易扩展的技术路线。
更重要的是,这些稀疏路径不只存在于数值曲线中:它们能够响应具体的语义模式、通过充分性和必要性测试,还可以被用于定向改变模型的行为。随着模型规模不断增长,直接从已有checkpoint中抽取和追踪回路,或许将成为理解大模型内部计算的一条重要路径。
相关论文信息:
- 论文标题:Sparse Weight Decomposition for Efficient Circuit Extraction
- 作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu
- 机构:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University
- 论文链接:https://arxiv.org/abs/2608.03913
- 代码仓库:https://github.com/Veri-Safe/SWD
- 模型链接:https://huggingface.co/veri-safe/SWD
- 交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog

