机制可解释性

神经网络是训练出来的,不是编写出来的。训练结束后,它会做加法,也会在空间中旋转物体,但没有人写下它是怎么做到的。我们找出网络学到的算法,然后检验这个解释是否正确。

从答案已知的地方开始

大型语言模型太大,无法逐个神经元地拆解。在自然数据上,也没有可以用来核对解释的标准答案。所以我们从小处开始。我们用群论中的任务训练网络。群论是研究对称性的数学,在训练开始之前,任务的所有可能解法都可以写下来。在钟面上做加法就是这样的任务,组合一个多边形的旋转和翻转也是。

网络学会任务之后,我们就可以问:它用的是哪一种已知解法,还是找到了新的解法?本页的每篇论文都配有一张交互图。

网络怎样做加法

以模 59 加法为例。数字过了 58 就回到 0,就像钟点过了 12 就重新开始。训练好的网络并不记住 3481 个可能的和。它把每个数放在几个圆上,所在的角度取决于这个数,然后通过把角度相加来把两个数相加。

每个可能答案的得分,从 0 到 58

(23 + 41) mod 59 = 5 最高得分: 5

图 1 训练好的网络所做事情的理想化版本。每个圆以自己的速度 k 把一个数变成一个角度。把 a 和 b 相加,就是把它们的角度相加。柱状图给出每个可能答案的得分。只用一个圆时,有几个错误答案的得分几乎和正确答案一样高。打开更多的圆,就只剩下正确答案。

一个圆不够,因为有好几个错误答案离正确角度几乎和正确答案一样近。网络会用几个转速不同的圆,只有正确答案能在所有圆上都得到高分。在我们发表于 NeurIPS 2025 的论文中,我们证明这是中国剩余定理的一种近似形式。中国剩余定理是数论中的一个古老方法,它把一个计算拆成几个较小的计算,再把结果合并起来。最常见的两类网络,多层感知机和 Transformer,都会学到这种方法。在深层网络中,所需圆的数量只随模数的对数增长。

不同网络中的同一个形状

早先有两项研究在两种 Transformer 中为这个任务找到了两种不同的电路,分别称为 Clock 和 Pizza,并由此得出结论:网络的设计决定了它学到哪种算法。

我们在 TAG-DS 2025 上说明了真正决定形状的是什么。一个神经元簇中的每个神经元都有两个相位,每个输入对应一个。如果所有神经元的两个相位都相等,这个簇的整体活动就填满一个圆盘。如果两个相位各自独立变化,整体活动就覆盖一个环面,也就是甜甜圈的表面。Clock 和 Pizza 的两个相位几乎相等,所以它们都学到圆盘。把两个输入并排送入的多层感知机,我们称为 MLP-Concat,学到的是环面。

40 个神经元的相位

它们的整体活动构成: 一个圆盘 β = (1, 0, 0)

图 2 四种架构中同一神经元簇的 40 个神经元的相位,以及它们的整体活动所构成的形状。虚线对角线上的点两个相位相等。贝蒂数 β 分别数出形状有几个连通块、几个环和几个封闭的空腔。

我们的 ICLR 2026 论文让这个比较变得精确。我们没有逐个解读神经元,而是把协同工作的神经元归为一组,把它们的整体活动当作一个几何对象来研究,并比较了数百个训练好的电路。圆盘是环面被压扁后的样子,是透过一个投影看到的同一个算法。Clock 和 Pizza 其实是同一个电路。

着色依据 拖动可以旋转
图 3 每一对 (a, b) 都是环面上的一个点。把环面压扁,就得到 Transformer 学到的圆盘。按 a + b 着色时,圆盘分成一块块扇形,Pizza 电路的名字就由此而来。

数的网格

模素数加法可以叠起来。在初等 p 群中,每个元素都是一列模素数 p 的数,逐位相加。我们在 TAG-DS 2025 的论文中发现,每个神经元对应一个陪集,也就是网格中位于同一条直线上的一组元素,并按照环面上的距离,即李度量,给相邻的直线排序。网络把几个神经元的直线相交来找到答案,这是中国剩余定理的多维版本。

已打开的神经元

剩余格子: 7

点击一个格子来选择答案。

图 4 模 7 的数对,画成边缘首尾相接的网格。每个神经元方向 ξ 点亮一行格子,也就是它的陪集,相邻的行按李距离逐渐变淡。一个方向剩下七个候选,两个方向只剩一个。

分而治之

正多边形的旋转和翻转构成数学家所说的二面体群。在我们 NeurIPS 2025 研讨会的论文中,我们研究了在这个群上训练的网络中的单个神经元。一个神经元就是群元素上的一个波。当它的频率与边数有公因数时,它的取值会分成几个精确的水平,每个水平就是一个陪集。没有公因数时,每个元素各有自己的值,构成近似陪集。

激活水平数: 6, 精确陪集

外圈是旋转,内圈是反射。实线表示乘以 r,虚线表示乘以 s。 把鼠标移到一个元素上,可以看到同一水平的其他元素。

图 5 正十八边形 36 个对称的凯莱图上的一个神经元。颜色表示神经元的激活值。频率为 6 时,取值分成三个旋转水平和三个反射水平,共六个陪集。频率为 5 时,5 与 18 没有公因数,没有精确的水平。

在我们的 ICML 2026 论文中,我们把这些神经元一直追踪到整个网络。神经元聚成若干簇,每个簇的活动呈现凯莱图的形状,每个簇解决一个更简单的问题:答案在哪个陪集里。网络在输出端把各簇的投票加起来,所有簇都同意的那个元素就是答案。簇的数量只需随群的大小的对数增长,多层感知机和 Transformer 再一次学到了同样的解法。

剩余候选: 1

外圈是旋转 0 到 14,内圈是反射 15 到 29。

图 6 论文中的例子,用的是正十五边形的 30 个对称。一个簇把答案缩小到同类元素中与它模 3 相同的五个。另一个簇把答案缩小到模 5 相同的三个。只有答案同时在两组中。

超越凯莱图

在前面这些群里,每个簇的活动都是凯莱图。对于交错群,也就是一个列表的偶置换,情况并不总是这样。我们在 TAG-DS 2026 做了口头报告的论文发现,当一个簇的子群是正规子群时,它的活动仍然是凯莱图。当子群不是正规子群时,它的陪集不构成群,活动呈现的是施赖尔陪集图,一种更一般的图。这在 A4、A5 和 A6 中都成立,多层感知机和 Transformer 都是如此。

图 7 A4 的 12 个元素坍缩到一个子群的陪集上。正规子群得到一个更小的群的凯莱图。非正规子群得到施赖尔陪集图。

旋转

上面这些群都是有限的。空间中的旋转则不然。旋转有无穷多个,而且彼此之间连续变化。在一篇正在审稿的论文中,我们训练网络在三维及更高维度中组合旋转。

只有一两个隐藏层的网络找不到干净的解法。更深的网络学到了罗德里格旋转公式,这是让一个向量绕某个轴旋转给定角度的标准方法。单个神经元对绕特定轴的旋转作出反应,后面的层再把它们逐项组合起来。在更高的维度中,神经元对平面内的旋转作出反应,而不是绕轴的旋转。

拖动球体可以旋转它
图 8 罗德里格旋转公式。深层网络在被训练来组合旋转时会学到它。向量 v 绕轴 k 旋转角度 θ 的结果,等于三个彩色部分之和。

层与层之间的权重

这项工作的大部分内容描述的是网络运行时神经元在做什么。另一篇正在审稿的论文描述了在模加法上训练的深层网络中,连接相邻两层的权重。难点在于,同一层中的神经元可以按任意顺序排列而不改变网络,所以没有自然的方法把权重排好来读懂它们。我们在网络自身的活动中找到了一个隐藏的顺序,它就在二维傅里叶变换的相位里。按这个顺序排列之后,层与层之间的权重原来是正弦波。

从一个隐藏层到下一层的权重

  • 正权重
  • 负权重
图 9 两个隐藏层之间的权重,形式与论文描述的一致:神经元分成若干簇,每个簇内的权重是两者相位差的余弦。按网络原来的顺序看,它们像噪声。按簇和相位排序后,波形就显现出来。

可解释性有什么用

一个正确的解释,用处远不止于研究本身。我们看到三种用途。

更小的模型

知道了算法,网络就可以缩减成小得多的东西。在我们的 NeurIPS 2025 论文中,用理论预测的简单神经元替换训练出来的神经元,网络的准确率没有变化。一个学到了已知算法的网络,最终可以直接用这个算法来代替。

给操作人员的解释

采矿规划人员或矿物学家,都要根据模型的输出采取行动。如果我们知道是哪个机制产生了输出,就能把理由展示给他们,用的是他们可以拿自己的知识去核对的说法。我们另外两个研究方向,链条的末端都有这样一个人。

可以把关的模型

机制已知的模型可以被把关。不应使用的能力,可以在计算它的地方关掉。一个模型在证明自己是通过正确的机制得出答案之前,可以先不部署。

这三种用途都取决于一点:用不同方式训练的网络会得到同样的算法,这样为一个网络做的工具,才能用在下一个网络上。我们研究的每一个新群都在检验这一点。到目前为止,它都成立,只有一点不同:对于旋转,网络需要足够的深度,才能把问题拆成小块。

论文

  1. Interpreting SO(n) Multiplication: Deep Networks Generalize by Learning an Algorithm

    Arthur Ayestas Hilgert, Xiangzhuo Zeng, Sihui Wei, Gabriela Moisescu-Pareja, Vincent Létourneau, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) 审稿中

    交互图

  2. The Form of the Weights in Deep Networks Trained on Modular Addition

    Sihui Wei, Arthur Ayestas Hilgert, Xiangzhuo Zeng, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) 审稿中

    交互图

  3. Deep neural networks divide and conquer dihedral multiplication

    Sihui Wei, Gavin McCracken, Gabriela Moisescu-Pareja, Harley Wiltzer, Doina Precup, Irina Rish, Jonathan Love

    International Conference on Machine Learning (ICML 2026)

    交互图

  4. On the Geometry and Topology of Representations: The Manifolds of Modular Addition

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    International Conference on Learning Representations (ICLR 2026)

    交互图

  5. Toward a general understanding of neural representations learned by deep neural networks on group multiplications

    Arthur Ayestas Hilgert, Sihui Wei, Doina Precup, Gabriela Moisescu-Pareja, Gavin McCracken

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2026) 口头报告

    交互图

  6. Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks

    Gavin McCracken, Gabriela Moisescu-Pareja, Vincent Létourneau, Doina Precup, Jonathan Love

    Neural Information Processing Systems (NeurIPS 2025)

    交互图

  7. Interpreting deep neural networks trained on elementary p groups reveals algorithmic structure

    Gavin McCracken, Arthur Ayestas Hilgert, Sihui Wei, Gabriela Moisescu-Pareja, Zhaoyue Wang, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025) 快闪报告

    交互图

  8. The Geometry and Topology of Modular Addition Representations

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025)

    交互图

  9. The Representations of Deep Neural Networks Trained on Dihedral Group Multiplication

    Gavin McCracken, Sihui Wei, Gabriela Moisescu-Pareja, Harley Wiltzer, Irina Rish, Jonathan Love

    NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations

    交互图