Перейти к содержимому
лоооочВойти
Урок 3

Анатомия одной мысли

Глава 3. Клетки-фичи поодиночке не думают — они выстраиваются в цепочки. Сегодня пройдём такую цепочку шаг за шагом: как модель внутри сначала «думает» слово «Техас», и только потом — слово «Остин»

Цели урока

К концу этого урока вы:

  • Что такое цепь (circuit) — нервный путь из фич, который вместе делает одно вычисление
  • Как граф атрибуции рисует атлас одной конкретной мысли
  • Как вмешательство в средний шаг доказывает: рассуждение настоящее, а не короткий обходной путь
  • Почему Othello-GPT — модель, обученная на настольной игре, — идеальный контрольный пример для этого метода
  • Где у метода слабые места: что граф упрощает и когда обходной путь всё-таки побеждает
Гравитация

Сейчас объясню так, что станет очевидно. Слушай.

0:00 / 0:00
Урок 3 из 10

Анатомия одной мысли

Глава 3. Клетки-фичи поодиночке не думают — они выстраиваются в цепочки. Сегодня пройдём такую цепочку шаг за шагом: как модель внутри сначала «думает» слово «Техас», и только потом — слово «Остин»
Анатомический атлас нервных путей, нарисованный в старинном стиле: несколько светящихся нейронов соединены дугами разных цветов, образуя цепочку от вопроса к ответу, пергаментный фон, акварельная иллюстрация

Спроси у модели: «В каком штате находится Даллас?» Она ответит: «Техас». Обычный ответ, ничего особенного. А теперь спроси себя другое: что творилось у неё внутри между твоим вопросом и её ответом? Просто угадала? Вспомнила одним куском из памяти? Или там правда что-то щёлкнуло — сначала одна клетка, потом другая, и сигнал побежал дальше?

Оказывается, это можно подсмотреть. И картина внутри удивляет. Модель не просто выпаливает ответ — она, как настоящий детектив, идёт по шагам. Сначала внутри загорается клетка-детектор «Техас». И только потом — клетка «Остин». Настоящее рассуждение в два шага. И оно оставляет следы, которые можно найти [1].

Глава 1 — микроскоп Дёрнул за клетку — поведение поехало следом. Так случайный узор превращается в доказанный механизм
Глава 2 — клетки смысла Фича — клетка-детектор, заточенная под одно понятие. Один нейрон может нести сразу много смыслов (суперпозиция). Особый метод обучения умеет распутывать этот клубок на чистые фичи
Глава 3 — сегодня Фичи соединяются в цепочки — и получается вычисление. Граф атрибуции — анатомический атлас одной мысли. Главное доказательство — вмешательство в средний шаг цепи

Что ты поймёшь после этой главы

  • Что такое цепь (circuit) — нервный путь из фич, который вместе делает одно вычисление
  • Как граф атрибуции рисует атлас одной конкретной мысли
  • Как вмешательство в средний шаг доказывает: рассуждение настоящее, а не короткий обходной путь
  • Почему Othello-GPT — модель, обученная на настольной игре, — идеальный контрольный пример для этого метода
  • Где у метода слабые места: что граф упрощает и когда обходной путь всё-таки побеждает

Часть 1. От клеток — к цепи

В прошлой главе мы нашли чистые клетки-фичи. У каждой — своё понятие, каждая под своим стеклышком микроскопа [2]. Но клетки сами по себе — это ещё не мышление. Клетка сердца в одиночку ничего не делает. Она начинает работать, только когда соединена с соседями в ткань.

С моделью то же самое. Между вопросом и ответом — не случайные вспышки отдельных клеток, а цепь (circuit): несколько фич, соединённых между собой, передающих сигнал по эстафете. Первая фича загорается от вопроса. Её сигнал усиливает вторую. Вторая — третью. В конце цепи стоит ответ.

Карту этих связей называют граф атрибуции. Это анатомический атлас одной конкретной мысли: кто кого зажёг, с какой силой, и кто в итоге решил, каким будет следующее слово. Представь карту метро для одной конкретной поездки — не всю схему целиком, а только те линии, по которым реально проехал поезд.

🤔 Предскажи перед чтением
Допустим, ты смотришь на граф атрибуции для вопроса «столица Техаса?» и видишь узел «Техас» между вопросом и ответом «Остин». Как доказать, что этот узел правда участвует в рассуждении, а не просто случайно оказался рядом?
Подсказка: вспомни главный принцип нашего микроскопа из Главы 1. Корреляция или причинность?

Часть 2. Вопрос о Далласе — анатомия вживую

Главный пример этой главы прост и показателен. Исследователи задали модели вопрос: «В каком штате находится Даллас?» А потом заглянули в граф атрибуции — в анатомический атлас этого вопроса [1].

Вот что там видно. Сначала загорается целый кластер фич вокруг «Даллас/Техас». Потом — отдельно — включается фича «Техас», средний узел цепи. И только опираясь на неё, включается фича «штат», и выходит ответ «Техас». Два шага. Не один.

Сначала модель думает «Даллас → Техас». Только потом — «Техас → ответ». Это видно прямо на атласе.

Само по себе это уже интересно. Но граф — пока только наблюдение, узор на бумаге. А из первой главы мы помним: одного наблюдения мало. Нужно вмешательство.

Исследователи взяли зонд и вклинились прямо в середину цепи. Насильно подменили активацию фичи «Техас» на «Калифорния». Это как перерезать провод посередине и подать в него другой сигнал.

Модель ответила: «Сакраменто» — столица Калифорнии.

Модель не запуталась. Не выдала случайный набор слов, не вспомнила снова про Даллас. Она аккуратно повела чужой сигнал дальше по цепи — так, будто он был там с самого начала. Значит, средний шаг «Техас» — не украшение для красоты. Это настоящий провод, по которому реально идёт вычисление [1].

Граф атрибуции: анатомия одного вопроса нормально: вопрос «где Даллас?» фича Техас ответ «Техас» вмешательство: вопрос «где Даллас?» зонд: Калиф. ответ «Сакраменто» ← нормальный путь промеж. шаг работает ← подменили «Техас» на «Калифорния» → ответ сменился!
Сверху — обычный путь сигнала: вопрос о Далласе → фича «Техас» → ответ «Техас». Снизу — вмешательство: ту же фичу насильно подменили на «Калифорния» — и ответ стал «Сакраменто». Значит, средний шаг правда участвует в рассуждении, а не просто стоит рядом.

Часть 3. Othello-GPT — контрольная группа из настольной игры

Один пример — это красиво, но маловато для науки. Наука любит контрольные группы. Как убедиться, что метод работает не только на вопросах про штаты?

Есть изящная проверка — модель Othello-GPT [5]. Othello — настольная игра, где фишки по очереди ставят на доску 8×8 по строгим правилам. Исследователи обучили маленькую языковую модель только на записях партий — просто на последовательностях ходов, без единого слова о том, что такое доска и как выглядит игра.

А потом проверили: появилась ли у модели своя внутренняя картинка доски? Знают ли её фичи, что стоит в каждой клетке прямо сейчас?

Ответ — да. Исследователи нашли фичи, которые загорались в зависимости от того, что стоит на конкретной клетке доски. И проверили тем же способом: подменили одну такую фичу — и следующий ход модели изменился ровно так, будто на доске и правда встала другая фигура.

Othello-GPT важен не потому, что это игра. А потому, что здесь есть внешняя правда: мы точно знаем, какая позиция на доске правильная. Можно проверить, действительно ли фичи описывают состояние доски — а не что-то смутно похожее на неё. Такая роскошь редко встречается в этой области. В вопросе про Даллас правильный ответ мы тоже знаем заранее. А в игре правда прописана в правилах, и её легко проверить независимо от модели.

Связь с Главой 2: фичи Othello-GPT — это те же самые клетки-детекторы. «Клетка E5 занята чёрной фишкой» — моносемантичная фича, заточенная под одну вещь. Метод распутывания дал чистый детектор состояния — и он работает как рычаг.

Часть 4. Граф атрибуции — что это за инструмент

Пора разобрать наш атлас по косточкам. Граф атрибуции — это математический способ ответить на вопрос: какие части модели повлияли на конкретный ответ, и насколько сильно?

1

Узлы

Каждый узел — это активация: фича, которая зажглась, пока модель обрабатывала вопрос. Узлы — это клетки на нашем атласе.

2

Рёбра

Каждое ребро — это влияние: насколько сильно одна активация толкнула другую. Рёбра — это провода, которые соединяют клетки в цепь.

3

Направление

У графа есть направление: сигнал течёт от ранних слоёв к поздним, от вопроса к ответу. По любому маршруту можно пройти шаг за шагом.

4

Прореживание

Граф всегда неполный. В нём оставляют только сильные влияния, а слабые провода выбрасывают — иначе атлас превратится в нечитаемую кашу.

Именно этот инструмент Anthropic использовала в своей «биологической» работе [1], разбирая несколько десятков примеров: вопросы о столицах, стихи, арифметику. Каждый раз рисовали атлас — и каждый раз проверяли его вмешательством.

Часть 5. Шорткаты — сосед настоящего рассуждения

Теперь честно о неприятном. Рядом с настоящей цепью в модели часто работает ещё один, совсем другой механизм. Назовём его шорткат — короткий обходной путь: прямая связка «вопрос → ответ» без всякого среднего шага.

✋ Объясни
Как в одной модели могут одновременно жить и настоящая цепь «Даллас → Техас → ответ», и шорткат «Даллас → сразу Техас»? Ведь результат у них одинаковый. Тогда какая вообще разница, есть шорткат или нет?
Подсказка: подумай, что случится при вмешательстве. Если шорткат окажется сильнее цепи — что будет с ответом?

В обычных условиях шорткат и цепь дают один и тот же результат. Поэтому они спокойно уживаются рядом. Но если вмешаться в средний узел цепи, шорткат по-прежнему шепчет «Техас», а цепь теперь кричит «Калифорния». Итоговый ответ складывается из обоих голосов. И если шорткат сильнее, ответ вообще не изменится — а мы решим, что никакого среднего шага и не было.

А значит, наш атлас показывает только те примеры, где цепь достаточно сильна и вмешательство заметно. Не все примеры подряд. Скрывать это было бы нечестно [1].

когда метод работает

Цепь достаточно сильна, а средний узел легко понять. Вмешательство даёт предсказуемый результат — атлас прочитан верно.

когда метод работает

Есть внешняя правда (как в Othello-GPT), с которой можно всё сверить. Точность фич проверяется независимо от поведения модели.

ограничения

Граф всегда упрощает. Рядом с цепью могут тихо работать шорткаты и другие параллельные пути. Атлас показывает только самые сильные провода, не все сразу.

ограничения

Метод срабатывает примерно на четверти разобранных примеров — так оценивают сами авторы [1]. Сложные рассуждения из многих шагов пока не разбираются до конца.

🗺️
Исследователи нарисовали анатомический атлас мысли «где Даллас?». На нём нашёлся средний нейрон «Техас».
А рядом, параллельно, тихо работал нейрон-шорткат «Даллас → сразу Техас», без всяких промежуточных шагов.
Прямо как в настоящем городе: рядом с официальной дорогой всегда есть тропинка через дыру в заборе. Она быстрее — и ни на одном атласе не нарисована.

Итог: что читается на анатомическом атласе

Цепь = нервный путь мысли

Фичи из Главы 2 соединяются в цепи — провода мысли, один за другим. Каждая цепь — это одно вычисление: вопрос шаг за шагом превращается в ответ.

🗺

Граф атрибуции = анатомический атлас

Граф показывает, кто на кого повлиял. Но карта — не территория: рядом с настоящими проводами тихо работают шорткаты и другие пути, которых на атласе не видно.

Вмешательство = доказательство

Просто увидеть узел на графе — это корреляция. Подменить его зондом и увидеть, как поехал ответ, — это причинность. Только так красивый атлас превращается в доказанный механизм.

В следующей главе. Сегодня мы видели, как модель рассуждает задним числом — про то, что уже случилось (Даллас → Техас). А умеет ли она заглядывать вперёд? Следующая глава — про модель, которая знает финал ещё до того, как начала писать. Сочиняя стихи, она уже «знает» рифму за несколько слов до того, как произнесёт её вслух. Это называется «планирование» — и оно тоже оставляет следы на анатомическом атласе.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Основной источник этой главы: раздел о многошаговом рассуждении (Даллас→Техас→ответ), граф атрибуции как инструмент, эксперимент с подменой промежуточного узла. Честное перечисление ограничений: шорткаты, неполнота графа, четверть успешных примеров.
  2. Peer-reviewedLi, K., Hopkins, A., Bau, D., et al. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. ICLR 2023. Исследование Othello-GPT: модель, обученная только на записях ходов, развила внутреннее линейное представление игровой доски. Вмешательство в фичи состояния клеток доски предсказуемо изменяло следующие ходы. Контрольная группа для метода графов атрибуции.
  3. Peer-reviewedBricken, T., Templeton, A., Batson, J., et al. / Anthropic (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. transformer-circuits.pub. Источник концепции фич-детекторов (Глава 2), на которых строятся цепи этой главы. Фичи, найденные словарным обучением, — узлы в графах атрибуции.
  4. FoundationalOlah, C., Cammarata, N., Schubert, L., et al. (2020). Zoom In: An Introduction to Circuits. Distill. Первые «circuits» в нейросетях: концепция нервных путей из фич, соединённых в вычисление. Ранний пример метода — кривая-детектор → детектор угла → детектор контура. Идейная основа «нервных путей» этой главы. DOI: 10.23915/distill.00024.001

Глава информационно-просветительская. Это рассказ об идеях исследования, а не техническое руководство по машинному обучению.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.