Partir de ce qu’on sait déjà
Les grands modèles de langage sont trop gros pour être démontés neurone par neurone. Sur des données naturelles, il n’existe pas non plus de vérité de référence pour contrôler une explication. Nous commençons donc petit. Nous entraînons des réseaux sur des tâches tirées de la théorie des groupes, les mathématiques de la symétrie, où toutes les solutions possibles peuvent être écrites avant même l’entraînement. Additionner des nombres sur une horloge est l’une de ces tâches. Combiner les rotations et les retournements d’un polygone en est une autre.
Une fois que le réseau a appris la tâche, on peut se demander laquelle des solutions connues il utilise, ou s’il en a trouvé une nouvelle. Chacun des articles ci-dessous est accompagné d’une figure interactive.
Comment un réseau additionne
Prenons l’addition modulo 59. Les nombres reviennent à zéro après 58, comme les heures après 12. Un réseau entraîné ne garde pas en mémoire un tableau des 3 481 sommes possibles. Il place chaque nombre sur quelques cercles, à un angle qui dépend du nombre, et il additionne deux nombres en additionnant leurs angles.
(23 + 41) mod 59 = 5 Meilleur score: 5
Un seul cercle ne suffit pas, car plusieurs mauvaises réponses se trouvent presque aussi près du bon angle que la bonne réponse. Le réseau utilise quelques cercles qui tournent à des vitesses différentes, et seule la bonne réponse obtient un bon score sur tous. Dans notre article à NeurIPS 2025, nous avons montré qu’il s’agit d’une forme approchée du théorème des restes chinois, une vieille méthode de théorie des nombres qui découpe un calcul en calculs plus petits puis combine les résultats. Les deux types de réseaux les plus courants, les perceptrons multicouches et les transformeurs, l’apprennent tous les deux. Dans les réseaux profonds, le nombre de cercles ne croît qu’avec le logarithme du module.
La même forme dans des réseaux différents
Deux études antérieures avaient trouvé deux circuits différents pour cette tâche dans deux types de transformeurs. Elles les avaient appelés Clock et Pizza, et en avaient conclu que la conception du réseau décide de l’algorithme qu’il apprend.
À TAG-DS 2025, nous avons montré ce qui décide vraiment de la forme. Chaque neurone d’une grappe a deux phases, une pour chaque entrée. Si les deux phases sont égales dans tous les neurones, l’activité de la grappe remplit un disque. Si elles varient indépendamment, elle couvre un tore, la surface d’un beignet. Clock et Pizza gardent tous deux des phases presque égales, donc tous deux apprennent un disque. Un perceptron multicouche qui reçoit les deux entrées côte à côte, que nous avons appelé MLP-Concat, apprend le tore.
Phases de 40 neurones
Leur activité commune forme: un disque β = (1, 0, 0)
Notre article à ICLR 2026 a rendu la comparaison exacte. Au lieu de lire les neurones un par un, nous avons regroupé ceux qui travaillent ensemble et étudié leur activité commune comme un seul objet géométrique, sur des centaines de circuits entraînés. Le disque est une vue aplatie du tore, le même algorithme vu à travers une projection. Clock et Pizza étaient en fait le même circuit.
Des grilles de nombres
L’addition modulo un nombre premier peut s’empiler. Dans les p-groupes élémentaires, chaque élément est une liste de nombres modulo un nombre premier p, additionnés position par position. Notre article à TAG-DS 2025 a montré que chaque neurone répond à une classe, un ensemble d’éléments alignés sur une même droite de la grille, et qu’il ordonne les droites voisines selon leur distance sur le tore, appelée métrique de Lee. Le réseau croise les droites de quelques neurones pour trouver la réponse, une version multidimensionnelle du théorème des restes chinois.
Neurones activés
Cases restantes: 7
Cliquez sur une case pour choisir la réponse.
Diviser pour régner
Les rotations et les retournements d’un polygone régulier forment ce que les mathématiciens appellent le groupe diédral. Dans notre article d’atelier à NeurIPS 2025, nous avons étudié des neurones isolés dans des réseaux entraînés sur ce groupe. Un neurone est une onde sur les éléments du groupe. Quand sa fréquence partage un facteur avec le nombre de côtés, ses valeurs se répartissent en quelques niveaux exacts, et chaque niveau est une classe. Sinon, chaque élément reçoit sa propre valeur, une classe approchée.
Anneau extérieur : les rotations. Anneau intérieur : les réflexions. Les traits pleins multiplient par r, les tirets par s. Survolez un élément pour voir les autres au même niveau.
Dans notre article à ICML 2026, nous avons suivi ces neurones jusqu’au réseau entier. Les neurones se regroupent en grappes, l’activité de chaque grappe a la forme d’un graphe de Cayley, et chaque grappe résout un problème plus facile : dans quelle classe se trouve la réponse. Le réseau additionne les votes des grappes en sortie, et l’élément sur lequel elles s’accordent toutes est la réponse. Un nombre logarithmique de grappes suffit, et perceptrons multicouches et transformeurs apprennent la même solution.
Candidats restants: 1
Anneau extérieur : les rotations 0 à 14. Anneau intérieur : les réflexions 15 à 29.
Au-delà des graphes de Cayley
Dans les groupes précédents, l’activité de chaque grappe est un graphe de Cayley. Dans les groupes alternés, les permutations paires d’une liste, ce n’est pas toujours le cas. Notre article à TAG-DS 2026, présenté oralement, a montré que lorsque le sous-groupe d’une grappe est distingué, son activité reste un graphe de Cayley. Lorsqu’il ne l’est pas, ses classes ne forment pas un groupe, et l’activité prend la forme d’un graphe de Schreier des classes, l’objet plus général. Cela vaut dans A4, A5 et A6, pour les perceptrons multicouches comme pour les transformeurs.
Les rotations
Tous ces groupes sont finis. Les rotations dans l’espace ne le sont pas. Il y en a une infinité, et elles varient de façon continue de l’une à l’autre. Dans un article en cours d’évaluation, nous avons entraîné des réseaux à composer des rotations en trois dimensions et plus.
Les réseaux à une ou deux couches cachées n’ont pas trouvé de solution nette. Les réseaux plus profonds ont appris la formule de rotation de Rodrigues, la méthode classique pour faire tourner un vecteur autour d’un axe d’un angle donné. Certains neurones répondent aux rotations autour d’axes particuliers, et les couches suivantes les combinent terme par terme. En dimension plus élevée, les neurones répondent aux rotations dans des plans plutôt qu’autour d’axes.
Les poids entre les couches
La plupart de ces travaux décrivent ce que font les neurones pendant que le réseau fonctionne. Un second article en cours d’évaluation décrit les poids qui relient une couche à la suivante dans des réseaux profonds entraînés sur l’addition modulaire. La difficulté est que les neurones d’une couche peuvent être rangés dans n’importe quel ordre sans changer le réseau, si bien qu’il n’existe pas de façon naturelle d’aligner les poids pour les lire. Nous avons trouvé un ordre caché dans l’activité du réseau lui-même, dans la phase d’une transformée de Fourier à deux dimensions. Rangés dans cet ordre, les poids entre les couches sont des sinusoïdes.
Les poids d'une couche cachée à la suivante
- poids positif
- poids négatif
À quoi sert l’interprétabilité
Une explication juste est utile bien au-delà de la recherche. Nous y voyons trois usages.
Des modèles plus petits
Une fois l’algorithme connu, le réseau peut être réduit à quelque chose de beaucoup plus petit. Dans notre article à NeurIPS 2025, remplacer les neurones entraînés par les neurones simples que prédit la théorie n’a pas changé la précision du réseau. Un réseau qui a appris un algorithme connu peut, au bout du compte, être remplacé par cet algorithme.
Des explications pour les opérateurs
Un planificateur minier ou un minéralogiste doit agir à partir de ce que dit un modèle. Si nous savons quel mécanisme a produit une sortie, nous pouvons leur montrer la raison, en des termes qu’ils peuvent vérifier avec ce qu’ils savent. Nos deux autres axes de recherche ont tous quelqu’un comme cela au bout de la chaîne.
Des modèles que l’on peut brider
Un modèle dont on connaît les mécanismes peut être bridé. Une capacité qui ne doit pas servir peut être coupée là où elle est calculée, et un modèle peut être retenu avant son déploiement tant qu’il n’a pas montré qu’il arrive à ses réponses par le bon mécanisme.
Ces trois usages supposent que des réseaux entraînés de façons différentes arrivent aux mêmes algorithmes, pour qu’un outil conçu pour un réseau serve au suivant. Chaque nouveau groupe que nous étudions le met à l’épreuve. Jusqu’ici, c’est le cas, avec une nuance : pour les rotations, les réseaux ont besoin de profondeur avant de découper le problème en morceaux.