Interpretabilidad mecanicista

Una red neuronal se entrena, no se programa. Al terminar el entrenamiento sabe sumar números o girar objetos en el espacio, pero nadie ha escrito cómo lo hace. Nosotros averiguamos qué algoritmo ha aprendido una red y después comprobamos si esa explicación es correcta.

Empezar donde se conoce la respuesta

Los grandes modelos de lenguaje son demasiado grandes para desarmarlos neurona por neurona. Con datos naturales, además, no hay una verdad de referencia contra la cual comprobar una explicación. Por eso empezamos con algo pequeño. Entrenamos redes en tareas de la teoría de grupos, las matemáticas de la simetría, donde todas las soluciones posibles se pueden escribir antes de que empiece el entrenamiento. Sumar números en un reloj es una de esas tareas. Combinar los giros y las reflexiones de un polígono es otra.

Cuando la red ha aprendido la tarea, podemos preguntar cuál de las soluciones conocidas usa, o si encontró una nueva. Cada artículo de esta página tiene una figura interactiva.

Cómo suma una red

Tomemos la suma módulo 59. Los números vuelven a cero después del 58, igual que las horas después de las 12. Una red entrenada no guarda una tabla con las 3481 sumas posibles. Coloca cada número en unos pocos círculos, en un ángulo que depende del número, y suma dos números sumando sus ángulos.

Puntuación de cada respuesta posible, de 0 a 58

(23 + 41) mod 59 = 5 Puntuación más alta: 5

Fig. 1 Una versión idealizada de lo que hacen las redes entrenadas. Cada círculo convierte un número en un ángulo, a su propia velocidad k. Sumar a y b suma sus ángulos. Las barras puntúan cada respuesta posible. Con un solo círculo, varias respuestas incorrectas puntúan casi tan alto como la correcta. Active más círculos y solo queda la respuesta correcta.

Un círculo no basta, porque varias respuestas incorrectas quedan casi tan cerca del ángulo correcto como la respuesta correcta. La red usa unos pocos círculos que giran a velocidades distintas, y solo la respuesta correcta puntúa bien en todos. En nuestro artículo de NeurIPS 2025 mostramos que se trata de una forma aproximada del teorema chino del resto, un viejo método de la teoría de números que divide un cálculo en cálculos más pequeños y luego combina los resultados. Los dos tipos de red más comunes, los perceptrones multicapa y los transformers, lo aprenden. En las redes profundas, el número de círculos solo crece con el logaritmo del módulo.

La misma forma en redes distintas

Dos estudios anteriores encontraron dos circuitos distintos para esta tarea en dos tipos de transformer. Los llamaron Clock y Pizza, y concluyeron que el diseño de la red decide qué algoritmo aprende.

En TAG-DS 2025 mostramos qué es lo que de verdad decide la forma. Cada neurona de un grupo tiene dos fases, una para cada entrada. Si las dos fases son iguales en todas las neuronas, la actividad del grupo llena un disco. Si varían de forma independiente, cubre un toro, la superficie de una rosquilla. Clock y Pizza mantienen las dos fases casi iguales, así que ambos aprenden un disco. Un perceptrón multicapa que recibe las dos entradas una al lado de la otra, al que llamamos MLP-Concat, aprende el toro.

Fases de 40 neuronas

Su actividad conjunta forma: un disco β = (1, 0, 0)

Fig. 2 Las fases de 40 neuronas de un mismo grupo, para cuatro arquitecturas, y la forma que toma su actividad conjunta. Los puntos sobre la diagonal discontinua tienen fases iguales. Los números de Betti β cuentan las piezas conexas de la forma, sus lazos y los huecos que encierra.

Nuestro artículo de ICLR 2026 hizo exacta la comparación. En lugar de leer las neuronas una por una, reunimos las que trabajan juntas y estudiamos su actividad conjunta como un solo objeto geométrico, en cientos de circuitos entrenados. El disco es una vista aplanada del toro, el mismo algoritmo visto a través de una proyección. Clock y Pizza resultaron ser el mismo circuito.

Color según Arrástrelo para girarlo
Fig. 3 Cada par (a, b) es un punto del toro. Al aplanar el toro se obtiene el disco que aprenden los transformers. Coloreado según a + b, el disco se divide en porciones, las que dieron su nombre al circuito Pizza.

Cuadrículas de números

La suma módulo un número primo se puede apilar. En los p-grupos elementales, cada elemento es una lista de números módulo un primo p, que se suman posición por posición. Nuestro artículo de TAG-DS 2025 encontró que cada neurona responde a una clase lateral, un conjunto de elementos alineados sobre una misma recta de la cuadrícula, y que ordena las rectas vecinas según su distancia sobre el toro, llamada métrica de Lee. La red cruza las rectas de unas pocas neuronas para encontrar la respuesta, una versión multidimensional del teorema chino del resto.

Neuronas activas

Casillas restantes: 7

Haga clic en una casilla para elegir la respuesta.

Fig. 4 Los pares de números módulo 7, dibujados como una cuadrícula cuyos bordes se unen. Cada dirección de neurona ξ ilumina una fila de casillas, su clase lateral, y las filas vecinas se atenúan según la distancia de Lee. Una dirección deja siete candidatos. Dos dejan uno.

Divide y vencerás

Los giros y las reflexiones de un polígono regular forman lo que los matemáticos llaman el grupo diédrico. En nuestro artículo de taller de NeurIPS 2025 estudiamos neuronas individuales en redes entrenadas con este grupo. Una neurona es una onda sobre los elementos del grupo. Cuando su frecuencia comparte un factor con el número de lados, sus valores se reparten en unos pocos niveles exactos, y cada nivel es una clase lateral. Cuando no, cada elemento recibe su propio valor, una clase lateral aproximada.

Niveles de activación: 6, clases laterales exactas

Anillo exterior: rotaciones. Anillo interior: reflexiones. Las líneas continuas multiplican por r, las discontinuas por s. Pase el cursor sobre un elemento para ver los demás del mismo nivel.

Fig. 5 Una neurona sobre el grafo de Cayley de las 36 simetrías de un polígono de 18 lados. El color es la activación de la neurona. Con frecuencia 6, los valores se reparten en tres niveles para las rotaciones y tres para las reflexiones, seis clases laterales en total. Con frecuencia 5, que no comparte ningún factor con 18, no hay niveles exactos.

En nuestro artículo de ICML 2026 seguimos estas neuronas hasta la red completa. Las neuronas se agrupan, la actividad de cada grupo tiene la forma de un grafo de Cayley, y cada grupo resuelve un problema más fácil: en qué clase lateral está la respuesta. La red suma los votos de los grupos en la salida, y el elemento en el que todos coinciden es la respuesta. Basta un número logarítmico de grupos, y los perceptrones multicapa y los transformers aprenden la misma solución.

Candidatos restantes: 1

Anillo exterior: las rotaciones 0 a 14. Anillo interior: las reflexiones 15 a 29.

Fig. 6 El ejemplo del artículo, en las 30 simetrías de un polígono de 15 lados. Un grupo reduce la respuesta a los cinco elementos de su tipo que coinciden con ella módulo 3. Otro la reduce a los tres que coinciden módulo 5. Solo la respuesta está en ambos.

Más allá de los grafos de Cayley

En los grupos anteriores, la actividad de cada grupo de neuronas es un grafo de Cayley. En los grupos alternantes, las reordenaciones pares de una lista, no siempre es así. Nuestro artículo de TAG-DS 2026, presentado en una sesión oral, encontró que cuando el subgrupo de un grupo de neuronas es normal, su actividad sigue siendo un grafo de Cayley. Cuando el subgrupo no es normal, sus clases laterales no forman un grupo, y la actividad toma la forma de un grafo de clases laterales de Schreier, el objeto más general. Esto se cumple en A4, A5 y A6, tanto en perceptrones multicapa como en transformers.

Fig. 7 Los 12 elementos de A4, que se reducen a las clases laterales de un subgrupo. Con un subgrupo normal se obtiene el grafo de Cayley de un grupo más pequeño. Con un subgrupo no normal se obtiene un grafo de clases laterales de Schreier.

Las rotaciones

Todos estos grupos son finitos. Las rotaciones en el espacio no lo son. Hay infinitas, y cambian de forma continua de una a otra. En un artículo que está en revisión, entrenamos redes para componer rotaciones en tres dimensiones y más.

Las redes con una o dos capas ocultas no encontraron una solución limpia. Las redes más profundas aprendieron la fórmula de rotación de Rodrigues, la forma habitual de girar un vector alrededor de un eje un ángulo dado. Algunas neuronas responden a rotaciones alrededor de ejes concretos, y las capas siguientes las combinan término a término. En dimensiones más altas, las neuronas responden a rotaciones dentro de planos en lugar de alrededor de ejes.

Arrastre la esfera para girarla
Fig. 8 La fórmula de rotación de Rodrigues, que aprenden las redes profundas cuando se las entrena para componer rotaciones. Un vector v girado alrededor del eje k un ángulo θ es la suma de las tres partes en color.

Los pesos entre capas

La mayor parte de este trabajo describe lo que hacen las neuronas mientras la red funciona. Un segundo artículo en revisión describe los pesos que conectan una capa con la siguiente en redes profundas entrenadas con la suma modular. La dificultad es que las neuronas de una capa se pueden ordenar de cualquier manera sin cambiar la red, así que no hay una forma natural de alinear los pesos para leerlos. Encontramos un orden escondido en la propia actividad de la red, en la fase de una transformada de Fourier bidimensional. Ordenados así, los pesos entre capas resultan ser ondas sinusoidales.

Los pesos de una capa oculta a la siguiente

  • peso positivo
  • peso negativo
Fig. 9 Los pesos entre dos capas ocultas, con la forma que describe el artículo: grupos de neuronas y, dentro de cada grupo, un coseno de la diferencia entre sus fases. En el orden propio de la red parecen ruido. Ordenados por grupo y por fase, aparecen las ondas.

Para qué sirve la interpretabilidad

Una explicación correcta es útil mucho más allá de la investigación. Vemos tres usos.

Modelos más pequeños

Una vez conocido el algoritmo, la red se puede reducir a algo mucho más pequeño. En nuestro artículo de NeurIPS 2025, sustituir las neuronas entrenadas por las neuronas simples que predice la teoría no cambió la precisión de la red. Una red que ha aprendido un algoritmo conocido puede, al final, sustituirse por ese algoritmo.

Explicaciones para los operadores

Un planificador minero o un mineralogista tiene que actuar según lo que informa un modelo. Si sabemos qué mecanismo produjo una salida, podemos mostrarles la razón, en términos que pueden contrastar con lo que saben. Nuestras otras dos líneas de investigación tienen todas a alguien así al final de la cadena.

Modelos que se pueden limitar

Un modelo cuyos mecanismos se conocen se puede limitar. Una capacidad que no debe usarse se puede desactivar donde se calcula, y un modelo se puede retener antes de su despliegue hasta que demuestre que llega a sus respuestas mediante el mecanismo correcto.

Los tres usos dependen de que redes entrenadas de maneras distintas lleguen a los mismos algoritmos, para que una herramienta hecha para una red sirva para la siguiente. Cada grupo nuevo que estudiamos lo pone a prueba. Hasta ahora se ha cumplido, con un matiz: con las rotaciones, las redes necesitan profundidad antes de dividir el problema en piezas.

Artículos

  1. Interpreting SO(n) Multiplication: Deep Networks Generalize by Learning an Algorithm

    Arthur Ayestas Hilgert, Xiangzhuo Zeng, Sihui Wei, Gabriela Moisescu-Pareja, Vincent Létourneau, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) En revisión

    Figura interactiva

  2. The Form of the Weights in Deep Networks Trained on Modular Addition

    Sihui Wei, Arthur Ayestas Hilgert, Xiangzhuo Zeng, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) En revisión

    Figura interactiva

  3. Deep neural networks divide and conquer dihedral multiplication

    Sihui Wei, Gavin McCracken, Gabriela Moisescu-Pareja, Harley Wiltzer, Doina Precup, Irina Rish, Jonathan Love

    International Conference on Machine Learning (ICML 2026)

    Figura interactiva

  4. On the Geometry and Topology of Representations: The Manifolds of Modular Addition

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    International Conference on Learning Representations (ICLR 2026)

    Figura interactiva

  5. Toward a general understanding of neural representations learned by deep neural networks on group multiplications

    Arthur Ayestas Hilgert, Sihui Wei, Doina Precup, Gabriela Moisescu-Pareja, Gavin McCracken

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2026) Presentación oral

    Figura interactiva

  6. Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks

    Gavin McCracken, Gabriela Moisescu-Pareja, Vincent Létourneau, Doina Precup, Jonathan Love

    Neural Information Processing Systems (NeurIPS 2025)

    Figura interactiva

  7. Interpreting deep neural networks trained on elementary p groups reveals algorithmic structure

    Gavin McCracken, Arthur Ayestas Hilgert, Sihui Wei, Gabriela Moisescu-Pareja, Zhaoyue Wang, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025) Presentación relámpago

    Figura interactiva

  8. The Geometry and Topology of Modular Addition Representations

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025)

    Figura interactiva

  9. The Representations of Deep Neural Networks Trained on Dihedral Group Multiplication

    Gavin McCracken, Sihui Wei, Gabriela Moisescu-Pareja, Harley Wiltzer, Irina Rish, Jonathan Love

    NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations

    Figura interactiva