Начать там, где ответ известен
Большие языковые модели слишком велики, чтобы разбирать их нейрон за нейроном. К тому же на естественных данных нет эталона, с которым можно сверить объяснение. Поэтому мы начинаем с малого. Мы обучаем сети на задачах из теории групп, математики симметрии, где все возможные решения можно выписать ещё до начала обучения. Сложение чисел на циферблате часов — одна из таких задач. Композиция поворотов и отражений многоугольника — другая.
Когда сеть выучила задачу, можно спросить, каким из известных решений она пользуется и не нашла ли она новое. К каждой статье на этой странице есть интерактивный рисунок.
Как сеть складывает
Возьмём сложение по модулю 59. После 58 числа возвращаются к нулю, как часы после 12. Обученная сеть не хранит таблицу из 3481 возможной суммы. Она помещает каждое число на несколько окружностей, под углом, который зависит от числа, и складывает два числа, складывая их углы.
(23 + 41) mod 59 = 5 Наибольший балл: 5
Одной окружности недостаточно, потому что несколько неверных ответов оказываются почти так же близко к нужному углу, как и верный. Сеть использует несколько окружностей, вращающихся с разной скоростью, и высокую оценку на всех получает только верный ответ. В нашей статье на NeurIPS 2025 мы показали, что это приближённая форма китайской теоремы об остатках, старого метода теории чисел, который разбивает вычисление на более мелкие и затем объединяет результаты. Её выучивают оба самых распространённых типа сетей, многослойные перцептроны и трансформеры. В глубоких сетях число окружностей растёт лишь как логарифм модуля.
Одна и та же форма в разных сетях
В двух более ранних работах для этой задачи нашли два разных механизма в двух видах трансформеров. Их назвали Clock и Pizza и заключили, что алгоритм определяется устройством сети.
На TAG-DS 2025 мы показали, что на самом деле определяет форму. У каждого нейрона в кластере две фазы, по одной на каждый вход. Если у всех нейронов эти фазы равны, совместная активность кластера заполняет диск. Если они меняются независимо, она покрывает тор, поверхность бублика. У Clock и Pizza фазы почти равны, поэтому оба выучивают диск. Многослойный перцептрон, получающий два входа рядом, который мы назвали MLP-Concat, выучивает тор.
Фазы 40 нейронов
Их совместная активность образует: диск β = (1, 0, 0)
Наша статья на ICLR 2026 сделала это сравнение точным. Вместо того чтобы читать нейроны по одному, мы собрали вместе те, что работают сообща, и изучили их совместную активность как единый геометрический объект на сотнях обученных механизмов. Диск — это сплющенный вид тора, тот же алгоритм, увиденный через проекцию. Clock и Pizza оказались одним и тем же механизмом.
Сетки чисел
Сложение по модулю простого числа можно складывать в стопку. В элементарных p-группах каждый элемент — это список чисел по модулю простого p, которые складываются поэлементно. В нашей статье на TAG-DS 2025 мы обнаружили, что каждый нейрон отвечает на смежный класс, набор элементов, лежащих на одной прямой сетки, и упорядочивает соседние прямые по расстоянию на торе, которое называется метрикой Ли. Сеть пересекает прямые нескольких нейронов, чтобы найти ответ, и это многомерная версия китайской теоремы об остатках.
Включённые нейроны
Осталось клеток: 7
Нажмите на клетку, чтобы выбрать ответ.
Разделяй и властвуй
Повороты и отражения правильного многоугольника образуют то, что математики называют диэдральной группой. В нашей статье на воркшопе NeurIPS 2025 мы изучили отдельные нейроны в сетях, обученных на этой группе. Нейрон — это волна на элементах группы. Если её частота имеет общий делитель с числом сторон, значения нейрона распадаются на несколько точных уровней, и каждый уровень — смежный класс. Если нет, каждый элемент получает своё значение, приближённый смежный класс.
Внешнее кольцо — повороты. Внутреннее кольцо — отражения. Сплошные линии — умножение на r, пунктирные — на s. Наведите на элемент, чтобы увидеть остальные на том же уровне.
В нашей статье на ICML 2026 мы проследили эти нейроны до всей сети. Нейроны собираются в кластеры, активность каждого кластера имеет форму графа Кэли, и каждый кластер решает более простую задачу: в каком смежном классе лежит ответ. На выходе сеть складывает голоса кластеров, и элемент, на котором все они сходятся, и есть ответ. Достаточно логарифмического числа кластеров, и многослойные перцептроны и трансформеры выучивают одно и то же решение.
Осталось кандидатов: 1
Внешнее кольцо — повороты от 0 до 14. Внутреннее кольцо — отражения от 15 до 29.
За пределами графов Кэли
В предыдущих группах активность каждого кластера — граф Кэли. В знакопеременных группах, чётных перестановках списка, это не всегда так. В нашей статье на TAG-DS 2026, представленной устным докладом, мы обнаружили, что если подгруппа кластера нормальна, его активность остаётся графом Кэли. Если нет, её смежные классы не образуют группу, и активность принимает форму графа смежных классов Шрайера, более общего объекта. Это верно для A4, A5 и A6, и в многослойных перцептронах, и в трансформерах.
Повороты
Все эти группы конечны. Повороты в пространстве — нет. Их бесконечно много, и они плавно переходят друг в друга. В статье, которая сейчас на рецензировании, мы обучали сети композиции поворотов в трёх и более измерениях.
Сети с одним или двумя скрытыми слоями не нашли чистого решения. Более глубокие сети выучили формулу поворота Родрига, стандартный способ повернуть вектор вокруг оси на заданный угол. Отдельные нейроны отвечают на повороты вокруг определённых осей, а следующие слои собирают их почленно. В более высоких размерностях нейроны отвечают на повороты в плоскостях, а не вокруг осей.
Веса между слоями
Большая часть этой работы описывает, что делают нейроны, пока сеть работает. Вторая статья на рецензировании описывает веса, которые связывают один слой со следующим в глубоких сетях, обученных модульному сложению. Трудность в том, что нейроны слоя можно переставить в любом порядке, не изменив сеть, поэтому нет естественного способа выстроить веса, чтобы их прочитать. Мы нашли скрытый порядок в активности самой сети, в фазе двумерного преобразования Фурье. В этом порядке веса между слоями оказываются синусоидами.
Веса от одного скрытого слоя к следующему
- положительный вес
- отрицательный вес
Зачем нужна интерпретируемость
Верное объяснение полезно далеко за пределами исследований. Мы видим три применения.
Модели меньше
Когда алгоритм известен, сеть можно свести к чему-то гораздо меньшему. В нашей статье на NeurIPS 2025 замена обученных нейронов простыми нейронами, которые предсказывает теория, не изменила точность сети. Сеть, выучившую известный алгоритм, в конечном счёте можно заменить этим алгоритмом.
Объяснения для операторов
Планировщик горных работ или минералог должны действовать на основе того, что сообщает модель. Если мы знаем, какой механизм дал ответ, мы можем показать им причину в тех терминах, которые они могут сверить со своими знаниями. У каждого из двух других наших направлений в конце цепочки стоит такой человек.
Модели, которые можно ограничить
Модель, механизмы которой известны, можно ограничить. Способность, которой нельзя пользоваться, можно отключить там, где она вычисляется, а модель можно не допускать к работе, пока она не покажет, что приходит к ответам через правильный механизм.
Все три применения зависят от того, приходят ли сети, обученные по-разному, к одним и тем же алгоритмам, чтобы инструмент, сделанный для одной сети, работал и для следующей. Каждая новая группа, которую мы изучаем, это проверяет. Пока это подтверждается, с одной оговоркой: на поворотах сетям нужна глубина, прежде чем они разбивают задачу на части.