研究 i 可解释性 ii 矿业 iii 晶体学 机制可解释性 神经网络是训练出来的,不是编写出来的。训练结束后,它会做加法,也会在空间中旋转物体,但没有人写下它是怎么做到的。我们找出网络学到的算法,然后检验这个解释是否正确。
从答案已知的地方开始
大型语言模型太大,无法逐个神经元地拆解。在自然数据上,也没有可以用来核对解释的标准答案。所以我们从小处开始。我们用群论中的任务训练网络。群论是研究对称性的数学,在训练开始之前,任务的所有可能解法都可以写下来。在钟面上做加法就是这样的任务,组合一个多边形的旋转和翻转也是。
网络学会任务之后,我们就可以问:它用的是哪一种已知解法,还是找到了新的解法?本页的每篇论文都配有一张交互图。
网络怎样做加法
以模 59 加法为例。数字过了 58 就回到 0,就像钟点过了 12 就重新开始。训练好的网络并不记住 3481 个可能的和。它把每个数放在几个圆上,所在的角度取决于这个数,然后通过把角度相加来把两个数相加。
a 23 b 41 圆 k = 4 圆 k = 9 圆 k = 20
(23 + 41) mod 59 = 5 最高得分: 5
图 1 训练好的网络所做事情的理想化版本。每个圆以自己的速度 k 把一个数变成一个角度。把 a 和 b 相加,就是把它们的角度相加。柱状图给出每个可能答案的得分。只用一个圆时,有几个错误答案的得分几乎和正确答案一样高。打开更多的圆,就只剩下正确答案。
一个圆不够,因为有好几个错误答案离正确角度几乎和正确答案一样近。网络会用几个转速不同的圆,只有正确答案能在所有圆上都得到高分。在我们发表于 NeurIPS 2025 的论文中,我们证明这是中国剩余定理的一种近似形式。中国剩余定理是数论中的一个古老方法,它把一个计算拆成几个较小的计算,再把结果合并起来。最常见的两类网络,多层感知机和 Transformer,都会学到这种方法。在深层网络中,所需圆的数量只随模数的对数增长。
不同网络中的同一个形状
早先有两项研究在两种 Transformer 中为这个任务找到了两种不同的电路,分别称为 Clock 和 Pizza,并由此得出结论:网络的设计决定了它学到哪种算法。
我们在 TAG-DS 2025 上说明了真正决定形状的是什么。一个神经元簇中的每个神经元都有两个相位,每个输入对应一个。如果所有神经元的两个相位都相等,这个簇的整体活动就填满一个圆盘。如果两个相位各自独立变化,整体活动就覆盖一个环面,也就是甜甜圈的表面。Clock 和 Pizza 的两个相位几乎相等,所以它们都学到圆盘。把两个输入并排送入的多层感知机,我们称为 MLP-Concat,学到的是环面。
它们的整体活动构成: 一个圆盘 β = (1, 0, 0)
MLP-Add Clock Pizza MLP-Concat
图 2 四种架构中同一神经元簇的 40 个神经元的相位,以及它们的整体活动所构成的形状。虚线对角线上的点两个相位相等。贝蒂数 β 分别数出形状有几个连通块、几个环和几个封闭的空腔。
我们的 ICLR 2026 论文让这个比较变得精确。我们没有逐个解读神经元,而是把协同工作的神经元归为一组,把它们的整体活动当作一个几何对象来研究,并比较了数百个训练好的电路。圆盘是环面被压扁后的样子,是透过一个投影看到的同一个算法。Clock 和 Pizza 其实是同一个电路。
压平 着色依据 a + b a 拖动可以旋转
图 3 每一对 (a , b ) 都是环面上的一个点。把环面压扁,就得到 Transformer 学到的圆盘。按 a + b 着色时,圆盘分成一块块扇形,Pizza 电路的名字就由此而来。
数的网格
模素数加法可以叠起来。在初等 p 群中,每个元素都是一列模素数 p 的数,逐位相加。我们在 TAG-DS 2025 的论文中发现,每个神经元对应一个陪集,也就是网格中位于同一条直线上的一组元素,并按照环面上的距离,即李度量,给相邻的直线排序。网络把几个神经元的直线相交来找到答案,这是中国剩余定理的多维版本。
已打开的神经元
ξ = (1, 0)ξ = (0, 1)ξ = (1, 1)ξ = (1, 2)
剩余格子: 7
点击一个格子来选择答案。
图 4 模 7 的数对,画成边缘首尾相接的网格。每个神经元方向 ξ 点亮一行格子,也就是它的陪集,相邻的行按李距离逐渐变淡。一个方向剩下七个候选,两个方向只剩一个。
分而治之
正多边形的旋转和翻转构成数学家所说的二面体群。在我们 NeurIPS 2025 研讨会的论文中,我们研究了在这个群上训练的网络中的单个神经元。一个神经元就是群元素上的一个波。当它的频率与边数有公因数时,它的取值会分成几个精确的水平,每个水平就是一个陪集。没有公因数时,每个元素各有自己的值,构成近似陪集。
神经元频率6 激活水平数: 6 , 精确陪集
外圈是旋转,内圈是反射。实线表示乘以 r,虚线表示乘以 s。 把鼠标移到一个元素上,可以看到同一水平的其他元素。
图 5 正十八边形 36 个对称的凯莱图上的一个神经元。颜色表示神经元的激活值。频率为 6 时,取值分成三个旋转水平和三个反射水平,共六个陪集。频率为 5 时,5 与 18 没有公因数,没有精确的水平。
在我们的 ICML 2026 论文中,我们把这些神经元一直追踪到整个网络。神经元聚成若干簇,每个簇的活动呈现凯莱图的形状,每个簇解决一个更简单的问题:答案在哪个陪集里。网络在输出端把各簇的投票加起来,所有簇都同意的那个元素就是答案。簇的数量只需随群的大小的对数增长,多层感知机和 Transformer 再一次学到了同样的解法。
a r³ b s 模 3 神经元簇 模 5 神经元簇
剩余候选: 1
外圈是旋转 0 到 14,内圈是反射 15 到 29。
图 6 论文中的例子,用的是正十五边形的 30 个对称。一个簇把答案缩小到同类元素中与它模 3 相同的五个。另一个簇把答案缩小到模 5 相同的三个。只有答案同时在两组中。
超越凯莱图
在前面这些群里,每个簇的活动都是凯莱图。对于交错群,也就是一个列表的偶置换,情况并不总是这样。我们在 TAG-DS 2026 做了口头报告的论文发现,当一个簇的子群是正规子群时,它的活动仍然是凯莱图。当子群不是正规子群时,它的陪集不构成群,活动呈现的是施赖尔陪集图,一种更一般的图。这在 A4 、A5 和 A6 中都成立,多层感知机和 Transformer 都是如此。
A₄ 的凯莱图 正规子群的陪集 非正规子群的陪集
图 7 A4 的 12 个元素坍缩到一个子群的陪集上。正规子群得到一个更小的群的凯莱图。非正规子群得到施赖尔陪集图。
旋转
上面这些群都是有限的。空间中的旋转则不然。旋转有无穷多个,而且彼此之间连续变化。在一篇正在审稿的论文中,我们训练网络在三维及更高维度中组合旋转。
只有一两个隐藏层的网络找不到干净的解法。更深的网络学到了罗德里格旋转公式,这是让一个向量绕某个轴旋转给定角度的标准方法。单个神经元对绕特定轴的旋转作出反应,后面的层再把它们逐项组合起来。在更高的维度中,神经元对平面内的旋转作出反应,而不是绕轴的旋转。
v cos θ (k × v ) sin θ k (k · v )(1 − cos θ ) θ 110° 暂停 拖动球体可以旋转它
图 8 罗德里格旋转公式。深层网络在被训练来组合旋转时会学到它。向量 v 绕轴 k 旋转角度 θ 的结果,等于三个彩色部分之和。
层与层之间的权重
这项工作的大部分内容描述的是网络运行时神经元在做什么。另一篇正在审稿的论文描述了在模加法上训练的深层网络中,连接相邻两层的权重。难点在于,同一层中的神经元可以按任意顺序排列而不改变网络,所以没有自然的方法把权重排好来读懂它们。我们在网络自身的活动中找到了一个隐藏的顺序,它就在二维傅里叶变换的相位里。按这个顺序排列之后,层与层之间的权重原来是正弦波。
图 9 两个隐藏层之间的权重,形式与论文描述的一致:神经元分成若干簇,每个簇内的权重是两者相位差的余弦。按网络原来的顺序看,它们像噪声。按簇和相位排序后,波形就显现出来。
可解释性有什么用
一个正确的解释,用处远不止于研究本身。我们看到三种用途。
更小的模型
知道了算法,网络就可以缩减成小得多的东西。在我们的 NeurIPS 2025 论文中,用理论预测的简单神经元替换训练出来的神经元,网络的准确率没有变化。一个学到了已知算法的网络,最终可以直接用这个算法来代替。
给操作人员的解释
采矿规划人员或矿物学家,都要根据模型的输出采取行动。如果我们知道是哪个机制产生了输出,就能把理由展示给他们,用的是他们可以拿自己的知识去核对的说法。我们另外两个研究方向,链条的末端都有这样一个人。
可以把关的模型
机制已知的模型可以被把关。不应使用的能力,可以在计算它的地方关掉。一个模型在证明自己是通过正确的机制得出答案之前,可以先不部署。
这三种用途都取决于一点:用不同方式训练的网络会得到同样的算法,这样为一个网络做的工具,才能用在下一个网络上。我们研究的每一个新群都在检验这一点。到目前为止,它都成立,只有一点不同:对于旋转,网络需要足够的深度,才能把问题拆成小块。
Interpreting SO(n) Multiplication: Deep Networks Generalize by Learning an Algorithm Arthur Ayestas Hilgert , Xiangzhuo Zeng , Sihui Wei , Gabriela Moisescu-Pareja , Vincent Létourneau , Gavin McCracken
International Conference on Learning Representations (ICLR 2027) 审稿中
交互图→
The Form of the Weights in Deep Networks Trained on Modular Addition Sihui Wei , Arthur Ayestas Hilgert , Xiangzhuo Zeng , Gavin McCracken
International Conference on Learning Representations (ICLR 2027) 审稿中
交互图→
Deep neural networks divide and conquer dihedral multiplication Sihui Wei , Gavin McCracken , Gabriela Moisescu-Pareja , Harley Wiltzer , Doina Precup , Irina Rish , Jonathan Love
International Conference on Machine Learning (ICML 2026)
交互图→
On the Geometry and Topology of Representations: The Manifolds of Modular Addition Gabriela Moisescu-Pareja , Gavin McCracken , Harley Wiltzer , Vincent Létourneau , Colin Daniels , Doina Precup , Jonathan Love
International Conference on Learning Representations (ICLR 2026)
交互图→
Toward a general understanding of neural representations learned by deep neural networks on group multiplications Arthur Ayestas Hilgert , Sihui Wei , Doina Precup , Gabriela Moisescu-Pareja , Gavin McCracken
Topology, Algebra, and Geometry in Data Science (TAG-DS 2026) 口头报告
交互图→
Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks Gavin McCracken , Gabriela Moisescu-Pareja , Vincent Létourneau , Doina Precup , Jonathan Love
Neural Information Processing Systems (NeurIPS 2025)
交互图→
Interpreting deep neural networks trained on elementary p groups reveals algorithmic structure Gavin McCracken , Arthur Ayestas Hilgert , Sihui Wei , Gabriela Moisescu-Pareja , Zhaoyue Wang , Jonathan Love
Topology, Algebra, and Geometry in Data Science (TAG-DS 2025) 快闪报告
交互图→
The Geometry and Topology of Modular Addition Representations Gabriela Moisescu-Pareja , Gavin McCracken , Harley Wiltzer , Vincent Létourneau , Colin Daniels , Doina Precup , Jonathan Love
Topology, Algebra, and Geometry in Data Science (TAG-DS 2025)
交互图→
The Representations of Deep Neural Networks Trained on Dihedral Group Multiplication Gavin McCracken , Sihui Wei , Gabriela Moisescu-Pareja , Harley Wiltzer , Irina Rish , Jonathan Love
NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations
交互图→
下一篇 ii 深部矿山系统 →