Анатомия одной мысли
Глава 3. Клетки-фичи поодиночке не думают — они выстраиваются в цепочки. Сегодня пройдём такую цепочку шаг за шагом: как модель внутри сначала «думает» слово «Техас», и только потом — слово «Остин»
Цели урока
К концу этого урока вы:
- Что такое цепь (circuit) — нервный путь из фич, который вместе делает одно вычисление
- Как граф атрибуции рисует атлас одной конкретной мысли
- Как вмешательство в средний шаг доказывает: рассуждение настоящее, а не короткий обходной путь
- Почему Othello-GPT — модель, обученная на настольной игре, — идеальный контрольный пример для этого метода
- Где у метода слабые места: что граф упрощает и когда обходной путь всё-таки побеждает

Сейчас объясню так, что станет очевидно. Слушай.
Анатомия одной мысли
Спроси у модели: «В каком штате находится Даллас?» Она ответит: «Техас». Обычный ответ, ничего особенного. А теперь спроси себя другое: что творилось у неё внутри между твоим вопросом и её ответом? Просто угадала? Вспомнила одним куском из памяти? Или там правда что-то щёлкнуло — сначала одна клетка, потом другая, и сигнал побежал дальше?
Оказывается, это можно подсмотреть. И картина внутри удивляет. Модель не просто выпаливает ответ — она, как настоящий детектив, идёт по шагам. Сначала внутри загорается клетка-детектор «Техас». И только потом — клетка «Остин». Настоящее рассуждение в два шага. И оно оставляет следы, которые можно найти [1].
Что ты поймёшь после этой главы
- Что такое цепь (circuit) — нервный путь из фич, который вместе делает одно вычисление
- Как граф атрибуции рисует атлас одной конкретной мысли
- Как вмешательство в средний шаг доказывает: рассуждение настоящее, а не короткий обходной путь
- Почему Othello-GPT — модель, обученная на настольной игре, — идеальный контрольный пример для этого метода
- Где у метода слабые места: что граф упрощает и когда обходной путь всё-таки побеждает
Часть 1. От клеток — к цепи
В прошлой главе мы нашли чистые клетки-фичи. У каждой — своё понятие, каждая под своим стеклышком микроскопа [2]. Но клетки сами по себе — это ещё не мышление. Клетка сердца в одиночку ничего не делает. Она начинает работать, только когда соединена с соседями в ткань.
С моделью то же самое. Между вопросом и ответом — не случайные вспышки отдельных клеток, а цепь (circuit): несколько фич, соединённых между собой, передающих сигнал по эстафете. Первая фича загорается от вопроса. Её сигнал усиливает вторую. Вторая — третью. В конце цепи стоит ответ.
Карту этих связей называют граф атрибуции. Это анатомический атлас одной конкретной мысли: кто кого зажёг, с какой силой, и кто в итоге решил, каким будет следующее слово. Представь карту метро для одной конкретной поездки — не всю схему целиком, а только те линии, по которым реально проехал поезд.
Часть 2. Вопрос о Далласе — анатомия вживую
Главный пример этой главы прост и показателен. Исследователи задали модели вопрос: «В каком штате находится Даллас?» А потом заглянули в граф атрибуции — в анатомический атлас этого вопроса [1].
Вот что там видно. Сначала загорается целый кластер фич вокруг «Даллас/Техас». Потом — отдельно — включается фича «Техас», средний узел цепи. И только опираясь на неё, включается фича «штат», и выходит ответ «Техас». Два шага. Не один.
Само по себе это уже интересно. Но граф — пока только наблюдение, узор на бумаге. А из первой главы мы помним: одного наблюдения мало. Нужно вмешательство.
Исследователи взяли зонд и вклинились прямо в середину цепи. Насильно подменили активацию фичи «Техас» на «Калифорния». Это как перерезать провод посередине и подать в него другой сигнал.
Модель ответила: «Сакраменто» — столица Калифорнии.
Модель не запуталась. Не выдала случайный набор слов, не вспомнила снова про Даллас. Она аккуратно повела чужой сигнал дальше по цепи — так, будто он был там с самого начала. Значит, средний шаг «Техас» — не украшение для красоты. Это настоящий провод, по которому реально идёт вычисление [1].
Часть 3. Othello-GPT — контрольная группа из настольной игры
Один пример — это красиво, но маловато для науки. Наука любит контрольные группы. Как убедиться, что метод работает не только на вопросах про штаты?
Есть изящная проверка — модель Othello-GPT [5]. Othello — настольная игра, где фишки по очереди ставят на доску 8×8 по строгим правилам. Исследователи обучили маленькую языковую модель только на записях партий — просто на последовательностях ходов, без единого слова о том, что такое доска и как выглядит игра.
А потом проверили: появилась ли у модели своя внутренняя картинка доски? Знают ли её фичи, что стоит в каждой клетке прямо сейчас?
Ответ — да. Исследователи нашли фичи, которые загорались в зависимости от того, что стоит на конкретной клетке доски. И проверили тем же способом: подменили одну такую фичу — и следующий ход модели изменился ровно так, будто на доске и правда встала другая фигура.
Othello-GPT важен не потому, что это игра. А потому, что здесь есть внешняя правда: мы точно знаем, какая позиция на доске правильная. Можно проверить, действительно ли фичи описывают состояние доски — а не что-то смутно похожее на неё. Такая роскошь редко встречается в этой области. В вопросе про Даллас правильный ответ мы тоже знаем заранее. А в игре правда прописана в правилах, и её легко проверить независимо от модели.
Часть 4. Граф атрибуции — что это за инструмент
Пора разобрать наш атлас по косточкам. Граф атрибуции — это математический способ ответить на вопрос: какие части модели повлияли на конкретный ответ, и насколько сильно?
Узлы
Каждый узел — это активация: фича, которая зажглась, пока модель обрабатывала вопрос. Узлы — это клетки на нашем атласе.
Рёбра
Каждое ребро — это влияние: насколько сильно одна активация толкнула другую. Рёбра — это провода, которые соединяют клетки в цепь.
Направление
У графа есть направление: сигнал течёт от ранних слоёв к поздним, от вопроса к ответу. По любому маршруту можно пройти шаг за шагом.
Прореживание
Граф всегда неполный. В нём оставляют только сильные влияния, а слабые провода выбрасывают — иначе атлас превратится в нечитаемую кашу.
Именно этот инструмент Anthropic использовала в своей «биологической» работе [1], разбирая несколько десятков примеров: вопросы о столицах, стихи, арифметику. Каждый раз рисовали атлас — и каждый раз проверяли его вмешательством.
Часть 5. Шорткаты — сосед настоящего рассуждения
Теперь честно о неприятном. Рядом с настоящей цепью в модели часто работает ещё один, совсем другой механизм. Назовём его шорткат — короткий обходной путь: прямая связка «вопрос → ответ» без всякого среднего шага.
В обычных условиях шорткат и цепь дают один и тот же результат. Поэтому они спокойно уживаются рядом. Но если вмешаться в средний узел цепи, шорткат по-прежнему шепчет «Техас», а цепь теперь кричит «Калифорния». Итоговый ответ складывается из обоих голосов. И если шорткат сильнее, ответ вообще не изменится — а мы решим, что никакого среднего шага и не было.
А значит, наш атлас показывает только те примеры, где цепь достаточно сильна и вмешательство заметно. Не все примеры подряд. Скрывать это было бы нечестно [1].
когда метод работает
Цепь достаточно сильна, а средний узел легко понять. Вмешательство даёт предсказуемый результат — атлас прочитан верно.
когда метод работает
Есть внешняя правда (как в Othello-GPT), с которой можно всё сверить. Точность фич проверяется независимо от поведения модели.
ограничения
Граф всегда упрощает. Рядом с цепью могут тихо работать шорткаты и другие параллельные пути. Атлас показывает только самые сильные провода, не все сразу.
ограничения
Метод срабатывает примерно на четверти разобранных примеров — так оценивают сами авторы [1]. Сложные рассуждения из многих шагов пока не разбираются до конца.
А рядом, параллельно, тихо работал нейрон-шорткат «Даллас → сразу Техас», без всяких промежуточных шагов.
Прямо как в настоящем городе: рядом с официальной дорогой всегда есть тропинка через дыру в заборе. Она быстрее — и ни на одном атласе не нарисована.
Итог: что читается на анатомическом атласе
Цепь = нервный путь мысли
Фичи из Главы 2 соединяются в цепи — провода мысли, один за другим. Каждая цепь — это одно вычисление: вопрос шаг за шагом превращается в ответ.
Граф атрибуции = анатомический атлас
Граф показывает, кто на кого повлиял. Но карта — не территория: рядом с настоящими проводами тихо работают шорткаты и другие пути, которых на атласе не видно.
Вмешательство = доказательство
Просто увидеть узел на графе — это корреляция. Подменить его зондом и увидеть, как поехал ответ, — это причинность. Только так красивый атлас превращается в доказанный механизм.
В следующей главе. Сегодня мы видели, как модель рассуждает задним числом — про то, что уже случилось (Даллас → Техас). А умеет ли она заглядывать вперёд? Следующая глава — про модель, которая знает финал ещё до того, как начала писать. Сочиняя стихи, она уже «знает» рифму за несколько слов до того, как произнесёт её вслух. Это называется «планирование» — и оно тоже оставляет следы на анатомическом атласе.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- Peer-reviewedLi, K., Hopkins, A., Bau, D., et al. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. ICLR 2023.
- Peer-reviewedBricken, T., Templeton, A., Batson, J., et al. / Anthropic (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. transformer-circuits.pub.
- FoundationalOlah, C., Cammarata, N., Schubert, L., et al. (2020). Zoom In: An Introduction to Circuits. Distill.
Глава информационно-просветительская. Это рассказ об идеях исследования, а не техническое руководство по машинному обучению.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.