Механистическая интерпретируемость

Нейронную сеть обучают, а не программируют. После обучения она умеет складывать числа или поворачивать объекты в пространстве, но никто не записал, как она это делает. Мы находим алгоритм, который выучила сеть, а затем проверяем, верно ли это объяснение.

Начать там, где ответ известен

Большие языковые модели слишком велики, чтобы разбирать их нейрон за нейроном. К тому же на естественных данных нет эталона, с которым можно сверить объяснение. Поэтому мы начинаем с малого. Мы обучаем сети на задачах из теории групп, математики симметрии, где все возможные решения можно выписать ещё до начала обучения. Сложение чисел на циферблате часов — одна из таких задач. Композиция поворотов и отражений многоугольника — другая.

Когда сеть выучила задачу, можно спросить, каким из известных решений она пользуется и не нашла ли она новое. К каждой статье на этой странице есть интерактивный рисунок.

Как сеть складывает

Возьмём сложение по модулю 59. После 58 числа возвращаются к нулю, как часы после 12. Обученная сеть не хранит таблицу из 3481 возможной суммы. Она помещает каждое число на несколько окружностей, под углом, который зависит от числа, и складывает два числа, складывая их углы.

Балл каждого возможного ответа, от 0 до 58

(23 + 41) mod 59 = 5 Наибольший балл: 5

Рис. 1 Идеализированная версия того, что делают обученные сети. Каждая окружность превращает число в угол со своей скоростью k. Чтобы сложить a и b, складываются их углы. Столбики показывают оценку каждого возможного ответа. С одной окружностью несколько неверных ответов получают почти такую же оценку, как верный. Включите больше окружностей, и останется только верный ответ.

Одной окружности недостаточно, потому что несколько неверных ответов оказываются почти так же близко к нужному углу, как и верный. Сеть использует несколько окружностей, вращающихся с разной скоростью, и высокую оценку на всех получает только верный ответ. В нашей статье на NeurIPS 2025 мы показали, что это приближённая форма китайской теоремы об остатках, старого метода теории чисел, который разбивает вычисление на более мелкие и затем объединяет результаты. Её выучивают оба самых распространённых типа сетей, многослойные перцептроны и трансформеры. В глубоких сетях число окружностей растёт лишь как логарифм модуля.

Одна и та же форма в разных сетях

В двух более ранних работах для этой задачи нашли два разных механизма в двух видах трансформеров. Их назвали Clock и Pizza и заключили, что алгоритм определяется устройством сети.

На TAG-DS 2025 мы показали, что на самом деле определяет форму. У каждого нейрона в кластере две фазы, по одной на каждый вход. Если у всех нейронов эти фазы равны, совместная активность кластера заполняет диск. Если они меняются независимо, она покрывает тор, поверхность бублика. У Clock и Pizza фазы почти равны, поэтому оба выучивают диск. Многослойный перцептрон, получающий два входа рядом, который мы назвали MLP-Concat, выучивает тор.

Фазы 40 нейронов

Их совместная активность образует: диск β = (1, 0, 0)

Рис. 2 Фазы 40 нейронов одного кластера для четырёх архитектур и форма, которую принимает их совместная активность. У точек на пунктирной диагонали фазы равны. Числа Бетти β считают связные куски формы, её петли и замкнутые полости.

Наша статья на ICLR 2026 сделала это сравнение точным. Вместо того чтобы читать нейроны по одному, мы собрали вместе те, что работают сообща, и изучили их совместную активность как единый геометрический объект на сотнях обученных механизмов. Диск — это сплющенный вид тора, тот же алгоритм, увиденный через проекцию. Clock и Pizza оказались одним и тем же механизмом.

Цвет по Перетащите, чтобы повернуть
Рис. 3 Каждая пара (a, b) — точка на торе. Если сплющить тор, получится диск, который выучивают трансформеры. Если раскрасить его по a + b, диск делится на сектора, от которых механизм Pizza и получил своё название.

Сетки чисел

Сложение по модулю простого числа можно складывать в стопку. В элементарных p-группах каждый элемент — это список чисел по модулю простого p, которые складываются поэлементно. В нашей статье на TAG-DS 2025 мы обнаружили, что каждый нейрон отвечает на смежный класс, набор элементов, лежащих на одной прямой сетки, и упорядочивает соседние прямые по расстоянию на торе, которое называется метрикой Ли. Сеть пересекает прямые нескольких нейронов, чтобы найти ответ, и это многомерная версия китайской теоремы об остатках.

Включённые нейроны

Осталось клеток: 7

Нажмите на клетку, чтобы выбрать ответ.

Рис. 4 Пары чисел по модулю 7 в виде сетки, края которой склеены. Каждое направление нейрона ξ подсвечивает ряд клеток, свой смежный класс, а соседние ряды тускнеют по расстоянию Ли. Одно направление оставляет семь кандидатов. Два оставляют одного.

Разделяй и властвуй

Повороты и отражения правильного многоугольника образуют то, что математики называют диэдральной группой. В нашей статье на воркшопе NeurIPS 2025 мы изучили отдельные нейроны в сетях, обученных на этой группе. Нейрон — это волна на элементах группы. Если её частота имеет общий делитель с числом сторон, значения нейрона распадаются на несколько точных уровней, и каждый уровень — смежный класс. Если нет, каждый элемент получает своё значение, приближённый смежный класс.

Уровни активации: 6, точные смежные классы

Внешнее кольцо — повороты. Внутреннее кольцо — отражения. Сплошные линии — умножение на r, пунктирные — на s. Наведите на элемент, чтобы увидеть остальные на том же уровне.

Рис. 5 Нейрон на графе Кэли 36 симметрий 18-угольника. Цвет показывает активацию нейрона. При частоте 6 значения распадаются на три уровня для поворотов и три для отражений, всего шесть смежных классов. Частота 5 не имеет общих делителей с 18, и точных уровней нет.

В нашей статье на ICML 2026 мы проследили эти нейроны до всей сети. Нейроны собираются в кластеры, активность каждого кластера имеет форму графа Кэли, и каждый кластер решает более простую задачу: в каком смежном классе лежит ответ. На выходе сеть складывает голоса кластеров, и элемент, на котором все они сходятся, и есть ответ. Достаточно логарифмического числа кластеров, и многослойные перцептроны и трансформеры выучивают одно и то же решение.

Осталось кандидатов: 1

Внешнее кольцо — повороты от 0 до 14. Внутреннее кольцо — отражения от 15 до 29.

Рис. 6 Пример из статьи на 30 симметриях 15-угольника. Один кластер сужает ответ до пяти элементов того же вида, совпадающих с ним по модулю 3. Другой сужает его до трёх, совпадающих по модулю 5. Только ответ входит в оба набора.

За пределами графов Кэли

В предыдущих группах активность каждого кластера — граф Кэли. В знакопеременных группах, чётных перестановках списка, это не всегда так. В нашей статье на TAG-DS 2026, представленной устным докладом, мы обнаружили, что если подгруппа кластера нормальна, его активность остаётся графом Кэли. Если нет, её смежные классы не образуют группу, и активность принимает форму графа смежных классов Шрайера, более общего объекта. Это верно для A4, A5 и A6, и в многослойных перцептронах, и в трансформерах.

Рис. 7 12 элементов A4, стягивающиеся к смежным классам подгруппы. Нормальная подгруппа даёт граф Кэли меньшей группы. Ненормальная подгруппа даёт граф смежных классов Шрайера.

Повороты

Все эти группы конечны. Повороты в пространстве — нет. Их бесконечно много, и они плавно переходят друг в друга. В статье, которая сейчас на рецензировании, мы обучали сети композиции поворотов в трёх и более измерениях.

Сети с одним или двумя скрытыми слоями не нашли чистого решения. Более глубокие сети выучили формулу поворота Родрига, стандартный способ повернуть вектор вокруг оси на заданный угол. Отдельные нейроны отвечают на повороты вокруг определённых осей, а следующие слои собирают их почленно. В более высоких размерностях нейроны отвечают на повороты в плоскостях, а не вокруг осей.

Перетащите сферу, чтобы повернуть её
Рис. 8 Формула поворота Родрига, которую выучивают глубокие сети, когда их учат композиции поворотов. Вектор v, повёрнутый вокруг оси k на угол θ, равен сумме трёх цветных частей.

Веса между слоями

Большая часть этой работы описывает, что делают нейроны, пока сеть работает. Вторая статья на рецензировании описывает веса, которые связывают один слой со следующим в глубоких сетях, обученных модульному сложению. Трудность в том, что нейроны слоя можно переставить в любом порядке, не изменив сеть, поэтому нет естественного способа выстроить веса, чтобы их прочитать. Мы нашли скрытый порядок в активности самой сети, в фазе двумерного преобразования Фурье. В этом порядке веса между слоями оказываются синусоидами.

Веса от одного скрытого слоя к следующему

  • положительный вес
  • отрицательный вес
Рис. 9 Веса между двумя скрытыми слоями в той форме, которую описывает статья: кластеры нейронов, а внутри каждого кластера — косинус разности их фаз. В исходном порядке сети они выглядят как шум. Если упорядочить их по кластеру и фазе, появляются волны.

Зачем нужна интерпретируемость

Верное объяснение полезно далеко за пределами исследований. Мы видим три применения.

Модели меньше

Когда алгоритм известен, сеть можно свести к чему-то гораздо меньшему. В нашей статье на NeurIPS 2025 замена обученных нейронов простыми нейронами, которые предсказывает теория, не изменила точность сети. Сеть, выучившую известный алгоритм, в конечном счёте можно заменить этим алгоритмом.

Объяснения для операторов

Планировщик горных работ или минералог должны действовать на основе того, что сообщает модель. Если мы знаем, какой механизм дал ответ, мы можем показать им причину в тех терминах, которые они могут сверить со своими знаниями. У каждого из двух других наших направлений в конце цепочки стоит такой человек.

Модели, которые можно ограничить

Модель, механизмы которой известны, можно ограничить. Способность, которой нельзя пользоваться, можно отключить там, где она вычисляется, а модель можно не допускать к работе, пока она не покажет, что приходит к ответам через правильный механизм.

Все три применения зависят от того, приходят ли сети, обученные по-разному, к одним и тем же алгоритмам, чтобы инструмент, сделанный для одной сети, работал и для следующей. Каждая новая группа, которую мы изучаем, это проверяет. Пока это подтверждается, с одной оговоркой: на поворотах сетям нужна глубина, прежде чем они разбивают задачу на части.

Статьи

  1. Interpreting SO(n) Multiplication: Deep Networks Generalize by Learning an Algorithm

    Arthur Ayestas Hilgert, Xiangzhuo Zeng, Sihui Wei, Gabriela Moisescu-Pareja, Vincent Létourneau, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) На рецензировании

    Интерактивный рисунок

  2. The Form of the Weights in Deep Networks Trained on Modular Addition

    Sihui Wei, Arthur Ayestas Hilgert, Xiangzhuo Zeng, Gavin McCracken

    International Conference on Learning Representations (ICLR 2027) На рецензировании

    Интерактивный рисунок

  3. Deep neural networks divide and conquer dihedral multiplication

    Sihui Wei, Gavin McCracken, Gabriela Moisescu-Pareja, Harley Wiltzer, Doina Precup, Irina Rish, Jonathan Love

    International Conference on Machine Learning (ICML 2026)

    Интерактивный рисунок

  4. On the Geometry and Topology of Representations: The Manifolds of Modular Addition

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    International Conference on Learning Representations (ICLR 2026)

    Интерактивный рисунок

  5. Toward a general understanding of neural representations learned by deep neural networks on group multiplications

    Arthur Ayestas Hilgert, Sihui Wei, Doina Precup, Gabriela Moisescu-Pareja, Gavin McCracken

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2026) Устный доклад

    Интерактивный рисунок

  6. Uncovering a Universal Abstract Algorithm for Modular Addition in Neural Networks

    Gavin McCracken, Gabriela Moisescu-Pareja, Vincent Létourneau, Doina Precup, Jonathan Love

    Neural Information Processing Systems (NeurIPS 2025)

    Интерактивный рисунок

  7. Interpreting deep neural networks trained on elementary p groups reveals algorithmic structure

    Gavin McCracken, Arthur Ayestas Hilgert, Sihui Wei, Gabriela Moisescu-Pareja, Zhaoyue Wang, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025) Короткий доклад

    Интерактивный рисунок

  8. The Geometry and Topology of Modular Addition Representations

    Gabriela Moisescu-Pareja, Gavin McCracken, Harley Wiltzer, Vincent Létourneau, Colin Daniels, Doina Precup, Jonathan Love

    Topology, Algebra, and Geometry in Data Science (TAG-DS 2025)

    Интерактивный рисунок

  9. The Representations of Deep Neural Networks Trained on Dihedral Group Multiplication

    Gavin McCracken, Sihui Wei, Gabriela Moisescu-Pareja, Harley Wiltzer, Irina Rish, Jonathan Love

    NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations

    Интерактивный рисунок