Empezar donde se conoce la respuesta
Los grandes modelos de lenguaje son demasiado grandes para desarmarlos neurona por neurona. Con datos naturales, además, no hay una verdad de referencia contra la cual comprobar una explicación. Por eso empezamos con algo pequeño. Entrenamos redes en tareas de la teoría de grupos, las matemáticas de la simetría, donde todas las soluciones posibles se pueden escribir antes de que empiece el entrenamiento. Sumar números en un reloj es una de esas tareas. Combinar los giros y las reflexiones de un polígono es otra.
Cuando la red ha aprendido la tarea, podemos preguntar cuál de las soluciones conocidas usa, o si encontró una nueva. Cada artículo de esta página tiene una figura interactiva.
Cómo suma una red
Tomemos la suma módulo 59. Los números vuelven a cero después del 58, igual que las horas después de las 12. Una red entrenada no guarda una tabla con las 3481 sumas posibles. Coloca cada número en unos pocos círculos, en un ángulo que depende del número, y suma dos números sumando sus ángulos.
(23 + 41) mod 59 = 5 Puntuación más alta: 5
Un círculo no basta, porque varias respuestas incorrectas quedan casi tan cerca del ángulo correcto como la respuesta correcta. La red usa unos pocos círculos que giran a velocidades distintas, y solo la respuesta correcta puntúa bien en todos. En nuestro artículo de NeurIPS 2025 mostramos que se trata de una forma aproximada del teorema chino del resto, un viejo método de la teoría de números que divide un cálculo en cálculos más pequeños y luego combina los resultados. Los dos tipos de red más comunes, los perceptrones multicapa y los transformers, lo aprenden. En las redes profundas, el número de círculos solo crece con el logaritmo del módulo.
La misma forma en redes distintas
Dos estudios anteriores encontraron dos circuitos distintos para esta tarea en dos tipos de transformer. Los llamaron Clock y Pizza, y concluyeron que el diseño de la red decide qué algoritmo aprende.
En TAG-DS 2025 mostramos qué es lo que de verdad decide la forma. Cada neurona de un grupo tiene dos fases, una para cada entrada. Si las dos fases son iguales en todas las neuronas, la actividad del grupo llena un disco. Si varían de forma independiente, cubre un toro, la superficie de una rosquilla. Clock y Pizza mantienen las dos fases casi iguales, así que ambos aprenden un disco. Un perceptrón multicapa que recibe las dos entradas una al lado de la otra, al que llamamos MLP-Concat, aprende el toro.
Fases de 40 neuronas
Su actividad conjunta forma: un disco β = (1, 0, 0)
Nuestro artículo de ICLR 2026 hizo exacta la comparación. En lugar de leer las neuronas una por una, reunimos las que trabajan juntas y estudiamos su actividad conjunta como un solo objeto geométrico, en cientos de circuitos entrenados. El disco es una vista aplanada del toro, el mismo algoritmo visto a través de una proyección. Clock y Pizza resultaron ser el mismo circuito.
Cuadrículas de números
La suma módulo un número primo se puede apilar. En los p-grupos elementales, cada elemento es una lista de números módulo un primo p, que se suman posición por posición. Nuestro artículo de TAG-DS 2025 encontró que cada neurona responde a una clase lateral, un conjunto de elementos alineados sobre una misma recta de la cuadrícula, y que ordena las rectas vecinas según su distancia sobre el toro, llamada métrica de Lee. La red cruza las rectas de unas pocas neuronas para encontrar la respuesta, una versión multidimensional del teorema chino del resto.
Neuronas activas
Casillas restantes: 7
Haga clic en una casilla para elegir la respuesta.
Divide y vencerás
Los giros y las reflexiones de un polígono regular forman lo que los matemáticos llaman el grupo diédrico. En nuestro artículo de taller de NeurIPS 2025 estudiamos neuronas individuales en redes entrenadas con este grupo. Una neurona es una onda sobre los elementos del grupo. Cuando su frecuencia comparte un factor con el número de lados, sus valores se reparten en unos pocos niveles exactos, y cada nivel es una clase lateral. Cuando no, cada elemento recibe su propio valor, una clase lateral aproximada.
Anillo exterior: rotaciones. Anillo interior: reflexiones. Las líneas continuas multiplican por r, las discontinuas por s. Pase el cursor sobre un elemento para ver los demás del mismo nivel.
En nuestro artículo de ICML 2026 seguimos estas neuronas hasta la red completa. Las neuronas se agrupan, la actividad de cada grupo tiene la forma de un grafo de Cayley, y cada grupo resuelve un problema más fácil: en qué clase lateral está la respuesta. La red suma los votos de los grupos en la salida, y el elemento en el que todos coinciden es la respuesta. Basta un número logarítmico de grupos, y los perceptrones multicapa y los transformers aprenden la misma solución.
Candidatos restantes: 1
Anillo exterior: las rotaciones 0 a 14. Anillo interior: las reflexiones 15 a 29.
Más allá de los grafos de Cayley
En los grupos anteriores, la actividad de cada grupo de neuronas es un grafo de Cayley. En los grupos alternantes, las reordenaciones pares de una lista, no siempre es así. Nuestro artículo de TAG-DS 2026, presentado en una sesión oral, encontró que cuando el subgrupo de un grupo de neuronas es normal, su actividad sigue siendo un grafo de Cayley. Cuando el subgrupo no es normal, sus clases laterales no forman un grupo, y la actividad toma la forma de un grafo de clases laterales de Schreier, el objeto más general. Esto se cumple en A4, A5 y A6, tanto en perceptrones multicapa como en transformers.
Las rotaciones
Todos estos grupos son finitos. Las rotaciones en el espacio no lo son. Hay infinitas, y cambian de forma continua de una a otra. En un artículo que está en revisión, entrenamos redes para componer rotaciones en tres dimensiones y más.
Las redes con una o dos capas ocultas no encontraron una solución limpia. Las redes más profundas aprendieron la fórmula de rotación de Rodrigues, la forma habitual de girar un vector alrededor de un eje un ángulo dado. Algunas neuronas responden a rotaciones alrededor de ejes concretos, y las capas siguientes las combinan término a término. En dimensiones más altas, las neuronas responden a rotaciones dentro de planos en lugar de alrededor de ejes.
Los pesos entre capas
La mayor parte de este trabajo describe lo que hacen las neuronas mientras la red funciona. Un segundo artículo en revisión describe los pesos que conectan una capa con la siguiente en redes profundas entrenadas con la suma modular. La dificultad es que las neuronas de una capa se pueden ordenar de cualquier manera sin cambiar la red, así que no hay una forma natural de alinear los pesos para leerlos. Encontramos un orden escondido en la propia actividad de la red, en la fase de una transformada de Fourier bidimensional. Ordenados así, los pesos entre capas resultan ser ondas sinusoidales.
Los pesos de una capa oculta a la siguiente
- peso positivo
- peso negativo
Para qué sirve la interpretabilidad
Una explicación correcta es útil mucho más allá de la investigación. Vemos tres usos.
Modelos más pequeños
Una vez conocido el algoritmo, la red se puede reducir a algo mucho más pequeño. En nuestro artículo de NeurIPS 2025, sustituir las neuronas entrenadas por las neuronas simples que predice la teoría no cambió la precisión de la red. Una red que ha aprendido un algoritmo conocido puede, al final, sustituirse por ese algoritmo.
Explicaciones para los operadores
Un planificador minero o un mineralogista tiene que actuar según lo que informa un modelo. Si sabemos qué mecanismo produjo una salida, podemos mostrarles la razón, en términos que pueden contrastar con lo que saben. Nuestras otras dos líneas de investigación tienen todas a alguien así al final de la cadena.
Modelos que se pueden limitar
Un modelo cuyos mecanismos se conocen se puede limitar. Una capacidad que no debe usarse se puede desactivar donde se calcula, y un modelo se puede retener antes de su despliegue hasta que demuestre que llega a sus respuestas mediante el mecanismo correcto.
Los tres usos dependen de que redes entrenadas de maneras distintas lleguen a los mismos algoritmos, para que una herramienta hecha para una red sirva para la siguiente. Cada grupo nuevo que estudiamos lo pone a prueba. Hasta ahora se ha cumplido, con un matiz: con las rotaciones, las redes necesitan profundidad antes de dividir el problema en piezas.