Перейти к содержимому
лоооочВойти
Урок 2

Клетки смысла

Глава 2. Один нейрон модели одновременно думает про лягушку, Канаду и знак вопроса — и это не баг, а необходимость. Разберём, как из этой каши достать чистые клетки

Цели урока

К концу этого урока вы:

  • Что такое фича — клетка, которая отвечает только за одно понятие — и чем она отличается от обычного «сырого» нейрона
  • Почему один нейрон вспыхивает сразу на несколько несвязанных понятий (полисемантичность) и зачем это модели вообще нужно
  • Что такое суперпозиция и почему это не баг, а необходимость геометрии
  • Как «словарное обучение» распутывает нейроны в чистые фичи
  • Где у этого метода пределы — без прикрас
Гравитация

Смотри сюда внимательно — вот тут вся соль.

0:00 / 0:00
Урок 2 из 10

Клетки смысла

Глава 2. Один нейрон модели одновременно думает про лягушку, Канаду и знак вопроса — и это не баг, а необходимость. Разберём, как из этой каши достать чистые клетки
Натуралист рассматривает под микроскопом предметное стекло с несколькими светящимися клетками разных цветов; каждая клетка выделяет один цветовой сигнал, старинная лаборатория, акварельная иллюстрация

Открой атлас человеческого тела. Представь, что там нашлась клетка, которая отвечает сразу за зрение, переваривание жиров и ориентацию в пространстве. Один тип клетки — три вообще не связанных дела. Биолог решил бы, что атлас напечатали с ошибкой. Но мозг большой языковой модели устроен именно так: один нейрон загорается и на «лягушку», и на «Канаду», и на знак вопроса — понятия, между которыми нет вообще ничего общего.

И это не ошибка проектировщика. Это следствие жёсткого ограничения: понятий в языке в разы больше, чем нейронов в сети. Ячеек не хватает на все смыслы. Поэтому обучение нашло хитрость: пихать несколько понятий в один нейрон, используя их как разные направления в пространстве. В первой главе мы говорили про микроскоп [1]. Сегодня посмотрим, что он показывает — и почему первая же клетка под стеклом оказалась совсем не такой простой, как мы ждали.

Глава 1 — микроскоп ИИ — неведомый организм. Спросить нельзя, только вскрывать. Дёрнул клетку — поведение поехало: так отличаем настоящий механизм от случайного узора
Глава 2 — сегодня Что такое фича — клетка-детектор. Почему один нейрон путает разные понятия. Что такое суперпозиция. Как «словарное обучение» распутывает нейроны обратно в чистые клетки

Что ты поймёшь после этой главы

  • Что такое фича — клетка, которая отвечает только за одно понятие — и чем она отличается от обычного «сырого» нейрона
  • Почему один нейрон вспыхивает сразу на несколько несвязанных понятий (полисемантичность) и зачем это модели вообще нужно
  • Что такое суперпозиция и почему это не баг, а необходимость геометрии
  • Как «словарное обучение» распутывает нейроны в чистые фичи
  • Где у этого метода пределы — без прикрас

Часть 1. Что такое фича — и зачем она нужна

Вспомни образ из первой главы: фича — это клетка, которая отвечает ровно за одно понятие. Клетка зрительного нерва реагирует на свет определённой длины волны — и только на него. Клетка-детектор «Золотые Ворота» загорается, когда в тексте появляется этот мост: его фото, его название, упоминание пролива. На другие мосты, другие города, другие достопримечательности она не реагирует — только на свой объект. Одно понятие, один детектор.

Это идеал. Такую клетку называют моносемантичной: от греческого «моно» — один и «семантика» — смысл. Мечта натуралиста: нашёл клетку, понял, за что она отвечает, нанёс на атлас. Готово, следующая.

Беда в том, что большинство нейронов модели устроены иначе. Исследователи из Anthropic заглянули в сырые нейроны и увидели: один и тот же нейрон загорается на совершенно несвязанные вещи — например, на «лягушек», «Канаду» и «знак вопроса» [2]. Не родственные понятия, не синонимы — просто три случайных соседа. Такой нейрон называют полисемантичным: у него много значений, и между ними нет ничего общего. Такую клетку в атлас не занесёшь — непонятно, что писать.

🤔 Угадай заранее
Как думаешь, почему нейрон в модели вообще может загораться сразу на несвязанные понятия? Что это говорит об устройстве сети?
Подсказка: подумай о количестве. Нейронов — миллиарды. Но понятий, которые нужно хранить, ещё больше. Куда их девать?

Часть 2. Суперпозиция — природная хитрость упаковки

Ответ на вопрос из жёлтой карточки выше — простая математика. Представь комнату с тысячей полок. Тебе нужно расставить миллион книг. Выход один: класть на одну полку по несколько книг. Ровно это и делает нейронная сеть.

У модели Claude, с которой работали исследователи Anthropic, примерно 4 тысячи нейронов в каждом слое. А понятий, которые модель выучила из текстов всего интернета, — десятки миллионов. Разрыв в тысячи раз. Дать каждому понятию свой отдельный нейрон физически невозможно — не хватит места.

Решение называется суперпозиция [4]. Это геометрический трюк. В многомерном пространстве помещается много направлений, которые почти перпендикулярны друг другу — и почти не мешают. Редкие понятия, которые в тексте встречаются нечасто и почти никогда не стоят рядом, можно упаковать в одно направление. Если «лягушки» и «Канада» в текстах для обучения ни разу не встретились вместе, небольшое пересечение их направлений в нейроне почти не портит ответы модели.

Идеал: 1 нейрон = 1 понятие понятие A понятие B 2 нейрона, 2 понятия Реальность: суперпозиция понятие C понятие D 2 нейрона, 4 понятия (почти-перпенд.)
Слева — идеал: направления строго перпендикулярны, у каждого понятия свой нейрон. Справа — реальность: четыре почти-перпендикулярных направления в двух нейронах. Каждый нейрон немного «слышит» сразу несколько понятий — это и есть суперпозиция.

Это не просто теория — эффект предсказали и проверили ещё в работе 2022 года [4]. Авторы показали: если понятий много, а нейронов мало, обучение само находит суперпозицию — потому что это лучший компромисс между вместимостью и точностью. Полисемантичность нейрона — не глюк. Это оптимальная упаковка.

Часть 3. «Распутывание» — как сделать чистые клетки из каши

Итак, на предметном стекле у нас клетки-каша. Один нейрон загорается сразу на три несвязанных понятия. Как натуралисту разглядеть в этом хоть что-то осмысленное? Есть метод. Называется словарное обучение (dictionary learning).

Представь, что ты попал в библиотеку, где книги стоят вразнобой: детективы вперемешку с поваренными, учебники — с поэзией. Тебе нужно разобраться, что где лежит. Словарное обучение — это алгоритм, который берёт хаотичные вспышки нейронов и ищет в них скрытые направления. Каждое такое направление отвечает за одно понятие [2].

Инструмент называется разреженным автокодировщиком (sparse autoencoder). Он берёт шумный сигнал от тысяч нейронов и выдаёт набор фич — чистых клеток-детекторов. Каждая фича молчит почти всё время и вспыхивает редко, но метко: только когда её понятие правда есть в тексте. Отсюда и слово «разреженный» в названии.

Пример, который вошёл в учебники. В 2024 году исследователи применили словарное обучение к модели Claude 3 Sonnet и нашли миллионы таких фич [3]. Одну из них ты уже знаешь: детектор «Золотые Ворота». Из каши активаций вырезалась чистая клетка — со своей специализацией, своим порогом, своей реакцией.

Связь с главой 1: именно эту чистую фичу потом взяли зондом и выкрутили на максимум. Сначала нужно найти клетку — для этого и нужно «распутывание». Потом уже можно за неё дёргать.
Одна полупрозрачная живая клетка, ярко светящаяся изнутри силуэтом большого подвесного моста, словно одна клетка одержима единственной идеей, тёмный созерцательный фон
Одна клетка, одержимая одним понятием. Усиль её принудительно — и всё существо начнёт думать только о мосте.

Часть 4. Разглядываем клетку вблизи

Что именно мы видим, когда фича найдена? Разберём по кусочкам одну клетку-детектор — ту самую, что стала самой знаменитой во всей истории интерпретируемости.

🌁

Объект реакции

Мост Золотые Ворота в Сан-Франциско: его фото, слова «Golden Gate», упоминания пролива и тумана над ним.

📊

Разреженность

Фича почти всегда молчит. Загорается только когда понятие правда есть в тексте — не на любое слово про мосты, не на любое упоминание Калифорнии.

Причинность

Если зонд принудительно усиливает фичу — вся речь модели съезжает на Золотые Ворота. Это не совпадение, а настоящий рычаг.

🔗

Связи с другими фичами

У фичи есть соседи: детекторы «Сан-Франциско», «туман», «мост». Вместе они образуют кластер — будущую цепь из главы 3.

✋ Объясни своими словами
Чем чистая фича (после словарного обучения) лучше сырого нейрона для натуралиста-исследователя? Попробуй сформулировать в 1–2 предложениях, не подглядывая наверх.
Подсказка: что было не так с полисемантичным нейроном с точки зрения анатомического атласа? Что теперь изменилось?

Часть 5. Честно о пределах препарата

Фичи — это наша реконструкция, а не «настоящие клетки» модели. Помнишь из первой главы: препарат — это чучело, удобная копия [1]. Сама модель никогда не «думала» фичами как чем-то отдельным. Словарное обучение — это наш способ на неё смотреть, а не её способ думать. Карту с территорией путать не стоит.

что работает

Фичи реально влияют на поведение модели — это доказано прямым вмешательством. Найденные детекторы понятны человеку и воспроизводятся раз за разом.

что работает

Метод масштабируется: в 2024 году Templeton и коллеги нашли миллионы понятных фич в Claude 3 Sonnet [3].

ограничения

Не все найденные фичи получается объяснить. Часть остаётся «тёмной материей»: активируется на что-то, а на что именно — непонятно.

ограничения

Распутывание неполное. Суперпозицию убрали не всю: часть фич всё ещё путает понятия. Микроскоп по-прежнему грубоват — как и в главе 1.

🧫
Исследователи нашли нейрон, который реагирует и на «лягушек», и на «Канаду», и на «знак вопроса». Выдвинули три гипотезы: (а) лягушки оказались канадскими и очень любили задавать вопросы, (б) модель выучила один-единственный учебник из Квебека, (в) суперпозиция.
Правильный ответ — в. Но гипотезу (а) до сих пор никто формально не опроверг.

Итог: что мы нашли в клетках

Нейрон — это не клетка. Клетка — это фича. Нейроны полисемантичны не случайно, а по математической необходимости: понятий в языке в разы больше, чем нейронов. Обучение упаковывает их в суперпозицию — почти-перпендикулярные направления в многомерном пространстве. Словарное обучение эту упаковку распутывает и выдаёт чистые клетки-детекторы — фичи, каждая при своей специализации.

Эти фичи — только первый уровень анатомии: отдельные клетки, каждая на своём стекле. Но один детектор «Золотые Ворота» — это ещё не мышление. Мышление начинается там, где клетки соединяются и начинают работать цепью.

В следующей главе. Берём набор чистых фич и смотрим, как они соединяются в цепь — нервный путь одной мысли. Главный пример: вопрос «столица штата, где находится Даллас?». Внутри модель сначала зажигает «Техас», потом «Остин» — и вмешательство в этот промежуточный шаг доказывает, что рассуждение настоящее, а не выдумка задним числом. Это будет анатомический атлас одной мысли.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Главный источник всего курса. Разбор фич, цепей, графов атрибуции в Claude. Честный список ограничений метода.
  2. Peer-reviewedBricken, T., Templeton, A., Batson, J., et al. / Anthropic (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. transformer-circuits.pub. Работа, в которой словарное обучение (разреженный автокодировщик) применено к MLP-нейронам языковой модели. Доказано, что в одном нейроне упаковано множество несвязанных понятий (суперпозиция), и их можно «распутать» в моносемантичные фичи.
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Масштабирование метода на большую модель: миллионы фич, в том числе знаменитая фича «Золотые Ворота». Доказательство, что усиление фичи зондом изменяет поведение всей модели.
  4. FoundationalElhage, N., Henighan, T., Joseph, N., et al. / Anthropic (2022). Toy Models of Superposition. transformer-circuits.pub. Теоретическое и экспериментальное исследование суперпозиции: почему нейронные сети упаковывают несколько понятий в одни и те же нейроны, как это зависит от разреженности понятий и ёмкости сети.

Глава информационно-просветительская. Это рассказ об идеях исследования, а не техническое руководство по машинному обучению.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.