大模型机制可解释性:多电路的内蕴多样性探索

一场聚焦大语言模型机制可解释性的学术分享活动即将在2026年8月8日上午9点到10点开展,本次活动围绕“条条电路通罗马:探索大模型机制可解释性的内蕴多样性”主题展开,邀请到了领域内的青年学者带来前沿研究分享。本次活动由专业学术交流平台联合相关学术组织共同举办,旨在邀请一线青年学者分享最新技术进展,推动学术思想的碰撞与交流。活动的组织团队包括王奕辰、蒋官语、张宸源、涂耿以及本次活动的主持人姚云志,战略合作伙伴为腾讯。
分享嘉宾介绍
本次分享的讲者为陈熙,他本科毕业于多伦多大学,获得计算机科学与数学双专业荣誉理学学士学位,本科阶段师从Gerald Penn教授。他将于2026年9月赴香港中文大学(深圳),跟随杜梦楠教授攻读人工智能方向博士学位。
陈熙的研究方向集中在大语言模型机制可解释性、可解释与可信人工智能领域,重点关注如何从模型内部计算结构出发,获取精准、完整且可靠的机制解释,并以此提升人工智能系统的可信度。他曾参与大语言模型sheaf发现方法DiscoGP的相关研究,围绕计算图联合剪枝、灵活粒度的机制发现、组合式电路构建及替代机制分析开展工作,相关成果发表于EMNLP 2025。此后,他作为共同第一作者完成了“All Circuits Lead to Rome”研究,该成果被ICML 2026接收。他的联系邮箱为tonyxichen@tonyxichen.com。
报告核心内容
随着大语言模型能力的不断提升,理解模型内部完成推理、语言理解与知识调用的具体过程,已经成为提升人工智能透明度、可靠性与安全性的关键问题。传统的机制可解释性研究,通常将大模型内部复杂的计算过程还原为注意力头、MLP模块及其连接组成的计算电路,且大多隐含假设:针对某一种模型能力,存在相对唯一、稀疏且不可替代的内部机制,基于这一假设,多数电路发现方法的目标都是寻找支撑特定任务或模型能力的唯一计算子图。
本次报告将围绕大语言模型的电路与sheaf发现展开详细分享。首先会介绍DiscoGP提出的sheaf发现框架,与仅要求因果相关的普通circuit不同,sheaf要求被发现的计算子图在其余连接被移除或进行零消融后,仍能独立维持模型的任务能力。报告将结合陈熙参与的DiscoGP相关研究,讲解如何通过计算图联合剪枝与灵活粒度的结构建模,更精准地定位模型中的功能计算路径,并讨论组合式机制构建与替代电路发现等相关问题。
在此基础上,报告将重点介绍ICML 2026收录的研究“All Circuits Lead to Rome”。该研究重新审视了“一个任务对应一个内部机制”的功能各向异性假说,提出了重叠感知的sheaf发现框架OASR,在保证任务性能、稀疏性与功能完备性的同时,主动寻找与已有sheaf结构差异尽可能大的替代机制。实验结果显示,在间接宾语识别、语法判断及代码注释等多个任务中,同一模型内可以稳定发现多组结构重叠度极低但任务性能相近的机制解释;以间接宾语识别任务为例,两组均达到100%准确率的sheaf,其边级交并比仅为4.1%。随着发现的机制数量增加,不同机制的并集持续扩大,而它们的共同交集反而不断缩小。
报告还将讨论这一现象如何跨越DiscoGP、ACDC、EAP与Edge Pruning等不同电路发现方法普遍存在,并解释为何即便仅包含三条边的超稀疏sheaf,也不能被简单理解为模型完成任务时唯一且不可替代的“核心机制”。研究结果表明,电路发现方法得到的并非某个任务唯一的真实机制,而更可能是由大量功能等价、部分冗余且可相互替代的机制构成的解释空间中的一个成员。
最后,报告将探讨这一发现对可信人工智能研究的意义。更精准的机制解释,不仅需要发现能够支撑模型行为的计算机制,更需要理解不同机制之间的等价性、替代性、稳定性及其适用边界。通过从单一电路的视角转向机制等价类与分布式机制的视角,有望更准确地理解模型内部的计算过程,并利用这些机制层面的洞见,为模型诊断、风险识别、行为干预及可信人工智能的发展提供更可靠的理论基础。
主持人介绍
本次活动的主持人是姚云志,目前为浙江大学博士生,师从陈华钧教授与张宁豫教授。他的主要研究领域包括知识增强、语言模型可解释性与知识编辑,已在Nature Machine Intelligence、NeurIPS、ACL、EMNLP、SIGIR等顶级会议与期刊发表多篇学术论文。
直播渠道
本次活动将通过视频号与B站两大平台同步直播,观众可关注对应平台获取直播入口。

