Клетки смысла
Глава 2. Один нейрон модели одновременно думает про лягушку, Канаду и знак вопроса — и это не баг, а необходимость. Разберём, как из этой каши достать чистые клетки
Цели урока
К концу этого урока вы:
- Что такое фича — клетка, которая отвечает только за одно понятие — и чем она отличается от обычного «сырого» нейрона
- Почему один нейрон вспыхивает сразу на несколько несвязанных понятий (полисемантичность) и зачем это модели вообще нужно
- Что такое суперпозиция и почему это не баг, а необходимость геометрии
- Как «словарное обучение» распутывает нейроны в чистые фичи
- Где у этого метода пределы — без прикрас

Смотри сюда внимательно — вот тут вся соль.
Клетки смысла
Открой атлас человеческого тела. Представь, что там нашлась клетка, которая отвечает сразу за зрение, переваривание жиров и ориентацию в пространстве. Один тип клетки — три вообще не связанных дела. Биолог решил бы, что атлас напечатали с ошибкой. Но мозг большой языковой модели устроен именно так: один нейрон загорается и на «лягушку», и на «Канаду», и на знак вопроса — понятия, между которыми нет вообще ничего общего.
И это не ошибка проектировщика. Это следствие жёсткого ограничения: понятий в языке в разы больше, чем нейронов в сети. Ячеек не хватает на все смыслы. Поэтому обучение нашло хитрость: пихать несколько понятий в один нейрон, используя их как разные направления в пространстве. В первой главе мы говорили про микроскоп [1]. Сегодня посмотрим, что он показывает — и почему первая же клетка под стеклом оказалась совсем не такой простой, как мы ждали.
Что ты поймёшь после этой главы
- Что такое фича — клетка, которая отвечает только за одно понятие — и чем она отличается от обычного «сырого» нейрона
- Почему один нейрон вспыхивает сразу на несколько несвязанных понятий (полисемантичность) и зачем это модели вообще нужно
- Что такое суперпозиция и почему это не баг, а необходимость геометрии
- Как «словарное обучение» распутывает нейроны в чистые фичи
- Где у этого метода пределы — без прикрас
Часть 1. Что такое фича — и зачем она нужна
Вспомни образ из первой главы: фича — это клетка, которая отвечает ровно за одно понятие. Клетка зрительного нерва реагирует на свет определённой длины волны — и только на него. Клетка-детектор «Золотые Ворота» загорается, когда в тексте появляется этот мост: его фото, его название, упоминание пролива. На другие мосты, другие города, другие достопримечательности она не реагирует — только на свой объект. Одно понятие, один детектор.
Это идеал. Такую клетку называют моносемантичной: от греческого «моно» — один и «семантика» — смысл. Мечта натуралиста: нашёл клетку, понял, за что она отвечает, нанёс на атлас. Готово, следующая.
Беда в том, что большинство нейронов модели устроены иначе. Исследователи из Anthropic заглянули в сырые нейроны и увидели: один и тот же нейрон загорается на совершенно несвязанные вещи — например, на «лягушек», «Канаду» и «знак вопроса» [2]. Не родственные понятия, не синонимы — просто три случайных соседа. Такой нейрон называют полисемантичным: у него много значений, и между ними нет ничего общего. Такую клетку в атлас не занесёшь — непонятно, что писать.
Часть 2. Суперпозиция — природная хитрость упаковки
Ответ на вопрос из жёлтой карточки выше — простая математика. Представь комнату с тысячей полок. Тебе нужно расставить миллион книг. Выход один: класть на одну полку по несколько книг. Ровно это и делает нейронная сеть.
У модели Claude, с которой работали исследователи Anthropic, примерно 4 тысячи нейронов в каждом слое. А понятий, которые модель выучила из текстов всего интернета, — десятки миллионов. Разрыв в тысячи раз. Дать каждому понятию свой отдельный нейрон физически невозможно — не хватит места.
Решение называется суперпозиция [4]. Это геометрический трюк. В многомерном пространстве помещается много направлений, которые почти перпендикулярны друг другу — и почти не мешают. Редкие понятия, которые в тексте встречаются нечасто и почти никогда не стоят рядом, можно упаковать в одно направление. Если «лягушки» и «Канада» в текстах для обучения ни разу не встретились вместе, небольшое пересечение их направлений в нейроне почти не портит ответы модели.
Это не просто теория — эффект предсказали и проверили ещё в работе 2022 года [4]. Авторы показали: если понятий много, а нейронов мало, обучение само находит суперпозицию — потому что это лучший компромисс между вместимостью и точностью. Полисемантичность нейрона — не глюк. Это оптимальная упаковка.
Часть 3. «Распутывание» — как сделать чистые клетки из каши
Итак, на предметном стекле у нас клетки-каша. Один нейрон загорается сразу на три несвязанных понятия. Как натуралисту разглядеть в этом хоть что-то осмысленное? Есть метод. Называется словарное обучение (dictionary learning).
Представь, что ты попал в библиотеку, где книги стоят вразнобой: детективы вперемешку с поваренными, учебники — с поэзией. Тебе нужно разобраться, что где лежит. Словарное обучение — это алгоритм, который берёт хаотичные вспышки нейронов и ищет в них скрытые направления. Каждое такое направление отвечает за одно понятие [2].
Инструмент называется разреженным автокодировщиком (sparse autoencoder). Он берёт шумный сигнал от тысяч нейронов и выдаёт набор фич — чистых клеток-детекторов. Каждая фича молчит почти всё время и вспыхивает редко, но метко: только когда её понятие правда есть в тексте. Отсюда и слово «разреженный» в названии.
Пример, который вошёл в учебники. В 2024 году исследователи применили словарное обучение к модели Claude 3 Sonnet и нашли миллионы таких фич [3]. Одну из них ты уже знаешь: детектор «Золотые Ворота». Из каши активаций вырезалась чистая клетка — со своей специализацией, своим порогом, своей реакцией.
Часть 4. Разглядываем клетку вблизи
Что именно мы видим, когда фича найдена? Разберём по кусочкам одну клетку-детектор — ту самую, что стала самой знаменитой во всей истории интерпретируемости.
Объект реакции
Мост Золотые Ворота в Сан-Франциско: его фото, слова «Golden Gate», упоминания пролива и тумана над ним.
Разреженность
Фича почти всегда молчит. Загорается только когда понятие правда есть в тексте — не на любое слово про мосты, не на любое упоминание Калифорнии.
Причинность
Если зонд принудительно усиливает фичу — вся речь модели съезжает на Золотые Ворота. Это не совпадение, а настоящий рычаг.
Связи с другими фичами
У фичи есть соседи: детекторы «Сан-Франциско», «туман», «мост». Вместе они образуют кластер — будущую цепь из главы 3.
Часть 5. Честно о пределах препарата
Фичи — это наша реконструкция, а не «настоящие клетки» модели. Помнишь из первой главы: препарат — это чучело, удобная копия [1]. Сама модель никогда не «думала» фичами как чем-то отдельным. Словарное обучение — это наш способ на неё смотреть, а не её способ думать. Карту с территорией путать не стоит.
что работает
Фичи реально влияют на поведение модели — это доказано прямым вмешательством. Найденные детекторы понятны человеку и воспроизводятся раз за разом.
что работает
Метод масштабируется: в 2024 году Templeton и коллеги нашли миллионы понятных фич в Claude 3 Sonnet [3].
ограничения
Не все найденные фичи получается объяснить. Часть остаётся «тёмной материей»: активируется на что-то, а на что именно — непонятно.
ограничения
Распутывание неполное. Суперпозицию убрали не всю: часть фич всё ещё путает понятия. Микроскоп по-прежнему грубоват — как и в главе 1.
Правильный ответ — в. Но гипотезу (а) до сих пор никто формально не опроверг.
Итог: что мы нашли в клетках
Нейрон — это не клетка. Клетка — это фича. Нейроны полисемантичны не случайно, а по математической необходимости: понятий в языке в разы больше, чем нейронов. Обучение упаковывает их в суперпозицию — почти-перпендикулярные направления в многомерном пространстве. Словарное обучение эту упаковку распутывает и выдаёт чистые клетки-детекторы — фичи, каждая при своей специализации.
Эти фичи — только первый уровень анатомии: отдельные клетки, каждая на своём стекле. Но один детектор «Золотые Ворота» — это ещё не мышление. Мышление начинается там, где клетки соединяются и начинают работать цепью.
В следующей главе. Берём набор чистых фич и смотрим, как они соединяются в цепь — нервный путь одной мысли. Главный пример: вопрос «столица штата, где находится Даллас?». Внутри модель сначала зажигает «Техас», потом «Остин» — и вмешательство в этот промежуточный шаг доказывает, что рассуждение настоящее, а не выдумка задним числом. Это будет анатомический атлас одной мысли.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- Peer-reviewedBricken, T., Templeton, A., Batson, J., et al. / Anthropic (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. transformer-circuits.pub.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
- FoundationalElhage, N., Henighan, T., Joseph, N., et al. / Anthropic (2022). Toy Models of Superposition. transformer-circuits.pub.
Глава информационно-просветительская. Это рассказ об идеях исследования, а не техническое руководство по машинному обучению.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.