Interprétabilité mécaniste

Un réseau de neurones est entraîné, pas programmé. À la fin de l'entraînement, il sait additionner des nombres ou faire tourner des objets dans l'espace, mais personne n'a écrit comment il s'y prend. Nous retrouvons l'algorithme qu'un réseau a appris, puis nous vérifions que cette explication est juste.

Partir de ce qu’on sait déjà

Les grands modèles de langage sont trop gros pour être démontés neurone par neurone. Sur des données naturelles, il n’existe pas non plus de vérité de référence pour contrôler une explication. Nous commençons donc petit. Nous entraînons des réseaux sur des tâches tirées de la théorie des groupes, les mathématiques de la symétrie, où toutes les solutions possibles peuvent être écrites avant même l’entraînement. Additionner des nombres sur une horloge est l’une de ces tâches. Combiner les rotations et les retournements d’un polygone en est une autre.

Une fois que le réseau a appris la tâche, on peut se demander laquelle des solutions connues il utilise, ou s’il en a trouvé une nouvelle. Chacun des articles ci-dessous est accompagné d’une figure interactive.

Comment un réseau additionne

Prenons l’addition modulo 59. Les nombres reviennent à zéro après 58, comme les heures après 12. Un réseau entraîné ne garde pas en mémoire un tableau des 3 481 sommes possibles. Il place chaque nombre sur quelques cercles, à un angle qui dépend du nombre, et il additionne deux nombres en additionnant leurs angles.

Score de chaque réponse possible, de 0 à 58

(23 + 41) mod 59 = 5 Meilleur score: 5

Fig. 1 Une version idéalisée de ce que font les réseaux entraînés. Chaque cercle transforme un nombre en angle, à sa propre vitesse k. Additionner a et b revient à additionner leurs angles. Les barres donnent le score de chaque réponse possible. Avec un seul cercle, plusieurs mauvaises réponses obtiennent presque le même score que la bonne. Activez d’autres cercles et seule la bonne réponse reste.

Un seul cercle ne suffit pas, car plusieurs mauvaises réponses se trouvent presque aussi près du bon angle que la bonne réponse. Le réseau utilise quelques cercles qui tournent à des vitesses différentes, et seule la bonne réponse obtient un bon score sur tous. Dans notre article à NeurIPS 2025, nous avons montré qu’il s’agit d’une forme approchée du théorème des restes chinois, une vieille méthode de théorie des nombres qui découpe un calcul en calculs plus petits puis combine les résultats. Les deux types de réseaux les plus courants, les perceptrons multicouches et les transformeurs, l’apprennent tous les deux. Dans les réseaux profonds, le nombre de cercles ne croît qu’avec le logarithme du module.

La même forme dans des réseaux différents

Deux études antérieures avaient trouvé deux circuits différents pour cette tâche dans deux types de transformeurs. Elles les avaient appelés Clock et Pizza, et en avaient conclu que la conception du réseau décide de l’algorithme qu’il apprend.

À TAG-DS 2025, nous avons montré ce qui décide vraiment de la forme. Chaque neurone d’une grappe a deux phases, une pour chaque entrée. Si les deux phases sont égales dans tous les neurones, l’activité de la grappe remplit un disque. Si elles varient indépendamment, elle couvre un tore, la surface d’un beignet. Clock et Pizza gardent tous deux des phases presque égales, donc tous deux apprennent un disque. Un perceptron multicouche qui reçoit les deux entrées côte à côte, que nous avons appelé MLP-Concat, apprend le tore.

Phases de 40 neurones

Leur activité commune forme: un disque β = (1, 0, 0)

Fig. 2 Les phases de 40 neurones d’une même grappe, pour quatre architectures, et la forme que prend leur activité commune. Les points sur la diagonale en pointillés ont des phases égales. Les nombres de Betti β comptent les morceaux connexes de la forme, ses boucles et les vides qu’elle enferme.

Notre article à ICLR 2026 a rendu la comparaison exacte. Au lieu de lire les neurones un par un, nous avons regroupé ceux qui travaillent ensemble et étudié leur activité commune comme un seul objet géométrique, sur des centaines de circuits entraînés. Le disque est une vue aplatie du tore, le même algorithme vu à travers une projection. Clock et Pizza étaient en fait le même circuit.

Couleur selon Faites-le glisser pour le tourner
Fig. 3 Chaque couple (a, b) est un point du tore. En aplatissant le tore, on obtient le disque qu’apprennent les transformeurs. Coloré selon a + b, le disque se découpe en parts, celles qui ont donné son nom au circuit Pizza.

Des grilles de nombres

L’addition modulo un nombre premier peut s’empiler. Dans les p-groupes élémentaires, chaque élément est une liste de nombres modulo un nombre premier p, additionnés position par position. Notre article à TAG-DS 2025 a montré que chaque neurone répond à une classe, un ensemble d’éléments alignés sur une même droite de la grille, et qu’il ordonne les droites voisines selon leur distance sur le tore, appelée métrique de Lee. Le réseau croise les droites de quelques neurones pour trouver la réponse, une version multidimensionnelle du théorème des restes chinois.

Neurones activés

Cases restantes: 7

Cliquez sur une case pour choisir la réponse.

Fig. 4 Les couples de nombres modulo 7, dessinés sur une grille dont les bords se rejoignent. Chaque direction de neurone ξ éclaire une ligne de cases, sa classe, et les lignes voisines pâlissent selon la distance de Lee. Une direction laisse sept candidats. Deux n’en laissent qu’un.

Diviser pour régner

Les rotations et les retournements d’un polygone régulier forment ce que les mathématiciens appellent le groupe diédral. Dans notre article d’atelier à NeurIPS 2025, nous avons étudié des neurones isolés dans des réseaux entraînés sur ce groupe. Un neurone est une onde sur les éléments du groupe. Quand sa fréquence partage un facteur avec le nombre de côtés, ses valeurs se répartissent en quelques niveaux exacts, et chaque niveau est une classe. Sinon, chaque élément reçoit sa propre valeur, une classe approchée.

Niveaux d'activation: 6, classes exactes

Anneau extérieur : les rotations. Anneau intérieur : les réflexions. Les traits pleins multiplient par r, les tirets par s. Survolez un élément pour voir les autres au même niveau.

Fig. 5 Un neurone sur le graphe de Cayley des 36 symétries d’un polygone à 18 côtés. La couleur donne l’activation du neurone. À la fréquence 6, les valeurs se répartissent en trois niveaux pour les rotations et trois pour les réflexions, soit six classes en tout. À la fréquence 5, qui n’a aucun facteur commun avec 18, il n’y a pas de niveaux exacts.

Dans notre article à ICML 2026, nous avons suivi ces neurones jusqu’au réseau entier. Les neurones se regroupent en grappes, l’activité de chaque grappe a la forme d’un graphe de Cayley, et chaque grappe résout un problème plus facile : dans quelle classe se trouve la réponse. Le réseau additionne les votes des grappes en sortie, et l’élément sur lequel elles s’accordent toutes est la réponse. Un nombre logarithmique de grappes suffit, et perceptrons multicouches et transformeurs apprennent la même solution.

Candidats restants: 1

Anneau extérieur : les rotations 0 à 14. Anneau intérieur : les réflexions 15 à 29.

Fig. 6 L’exemple de l’article, dans les 30 symétries d’un polygone à 15 côtés. Une grappe réduit la réponse aux cinq éléments de sa catégorie qui lui correspondent modulo 3. Une autre la réduit aux trois qui correspondent modulo 5. Seule la réponse est dans les deux.

Au-delà des graphes de Cayley

Dans les groupes précédents, l’activité de chaque grappe est un graphe de Cayley. Dans les groupes alternés, les permutations paires d’une liste, ce n’est pas toujours le cas. Notre article à TAG-DS 2026, présenté oralement, a montré que lorsque le sous-groupe d’une grappe est distingué, son activité reste un graphe de Cayley. Lorsqu’il ne l’est pas, ses classes ne forment pas un groupe, et l’activité prend la forme d’un graphe de Schreier des classes, l’objet plus général. Cela vaut dans A4, A5 et A6, pour les perceptrons multicouches comme pour les transformeurs.

Fig. 7 Les 12 éléments de A4, qui se réduisent aux classes d’un sous-groupe. Pour un sous-groupe distingué, on obtient le graphe de Cayley d’un groupe plus petit. Pour un sous-groupe non distingué, on obtient un graphe de Schreier des classes.

Les rotations

Tous ces groupes sont finis. Les rotations dans l’espace ne le sont pas. Il y en a une infinité, et elles varient de façon continue de l’une à l’autre. Dans un article en cours d’évaluation, nous avons entraîné des réseaux à composer des rotations en trois dimensions et plus.

Les réseaux à une ou deux couches cachées n’ont pas trouvé de solution nette. Les réseaux plus profonds ont appris la formule de rotation de Rodrigues, la méthode classique pour faire tourner un vecteur autour d’un axe d’un angle donné. Certains neurones répondent aux rotations autour d’axes particuliers, et les couches suivantes les combinent terme par terme. En dimension plus élevée, les neurones répondent aux rotations dans des plans plutôt qu’autour d’axes.

Faites glisser la sphère pour la tourner
Fig. 8 La formule de rotation de Rodrigues, que les réseaux profonds apprennent quand on les entraîne à composer des rotations. Un vecteur v tourné autour de l’axe k d’un angle θ est la somme des trois parties en couleur.

Les poids entre les couches

La plupart de ces travaux décrivent ce que font les neurones pendant que le réseau fonctionne. Un second article en cours d’évaluation décrit les poids qui relient une couche à la suivante dans des réseaux profonds entraînés sur l’addition modulaire. La difficulté est que les neurones d’une couche peuvent être rangés dans n’importe quel ordre sans changer le réseau, si bien qu’il n’existe pas de façon naturelle d’aligner les poids pour les lire. Nous avons trouvé un ordre caché dans l’activité du réseau lui-même, dans la phase d’une transformée de Fourier à deux dimensions. Rangés dans cet ordre, les poids entre les couches sont des sinusoïdes.

Les poids d'une couche cachée à la suivante

  • poids positif
  • poids négatif
Fig. 9 Les poids entre deux couches cachées, sous la forme décrite dans l’article : des grappes de neurones et, dans chaque grappe, un cosinus de la différence de leurs phases. Dans l’ordre propre du réseau, ils ressemblent à du bruit. Triés par grappe puis par phase, les sinusoïdes apparaissent.

À quoi sert l’interprétabilité

Une explication juste est utile bien au-delà de la recherche. Nous y voyons trois usages.

Des modèles plus petits

Une fois l’algorithme connu, le réseau peut être réduit à quelque chose de beaucoup plus petit. Dans notre article à NeurIPS 2025, remplacer les neurones entraînés par les neurones simples que prédit la théorie n’a pas changé la précision du réseau. Un réseau qui a appris un algorithme connu peut, au bout du compte, être remplacé par cet algorithme.

Des explications pour les opérateurs

Un planificateur minier ou un minéralogiste doit agir à partir de ce que dit un modèle. Si nous savons quel mécanisme a produit une sortie, nous pouvons leur montrer la raison, en des termes qu’ils peuvent vérifier avec ce qu’ils savent. Nos deux autres axes de recherche ont tous quelqu’un comme cela au bout de la chaîne.

Des modèles que l’on peut brider

Un modèle dont on connaît les mécanismes peut être bridé. Une capacité qui ne doit pas servir peut être coupée là où elle est calculée, et un modèle peut être retenu avant son déploiement tant qu’il n’a pas montré qu’il arrive à ses réponses par le bon mécanisme.

Ces trois usages supposent que des réseaux entraînés de façons différentes arrivent aux mêmes algorithmes, pour qu’un outil conçu pour un réseau serve au suivant. Chaque nouveau groupe que nous étudions le met à l’épreuve. Jusqu’ici, c’est le cas, avec une nuance : pour les rotations, les réseaux ont besoin de profondeur avant de découper le problème en morceaux.

Articles

  1. Interpreting SO(n) Multiplication: Deep Networks Generalize by Learning an Algorithm

    Arthur Ayestas Hilgert, Xiangzhuo Zeng, Sihui Wei, Gabriela Moisescu-Pareja, Vincent Létourneau, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) En cours d'évaluation

    Figure interactive

  2. The Form of the Weights in Deep Networks Trained on Modular Addition

    Sihui Wei, Arthur Ayestas Hilgert, Xiangzhuo Zeng, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) En cours d'évaluation

    Figure interactive

  3. Deep neural networks divide and conquer dihedral multiplication

    Sihui Wei, Gavin McCracken, Gabriela Moisescu-Pareja, Harley Wiltzer, Doina Precup, Irina Rish, Jonathan Love

    International Conference on Machine Learning (ICML 2026)

    Figure interactive

  4. On the Geometry and Topology of Representations: The Manifolds of Modular Addition

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    International Conference on Learning Representations (ICLR 2026)

    Figure interactive

  5. Toward a general understanding of neural representations learned by deep neural networks on group multiplications

    Arthur Ayestas Hilgert, Sihui Wei, Doina Precup, Gabriela Moisescu-Pareja, Gavin McCracken

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2026) Présentation orale

    Figure interactive

  6. Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks

    Gavin McCracken, Gabriela Moisescu-Pareja, Vincent Létourneau, Doina Precup, Jonathan Love

    Neural Information Processing Systems (NeurIPS 2025)

    Figure interactive

  7. Interpreting deep neural networks trained on elementary p groups reveals algorithmic structure

    Gavin McCracken, Arthur Ayestas Hilgert, Sihui Wei, Gabriela Moisescu-Pareja, Zhaoyue Wang, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025) Présentation éclair

    Figure interactive

  8. The Geometry and Topology of Modular Addition Representations

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025)

    Figure interactive

  9. The Representations of Deep Neural Networks Trained on Dihedral Group Multiplication

    Gavin McCracken, Sihui Wei, Gabriela Moisescu-Pareja, Harley Wiltzer, Irina Rish, Jonathan Love

    NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations

    Figure interactive