Микроскоп для мысли
Глава 1. Мы построили существо, которое думает — и не понимаем как. Спросить его нельзя: оно ответит, но соврёт. Остаётся одно — взять микроскоп
Цели урока
К концу этого урока вы:
- Почему мы не понимаем собственное творение — и чем «выращено» отличается от «построено»
- Почему нельзя просто спросить ИИ, как он думает, и поверить ответу
- Что такое интерпретируемость и почему она похожа на биологию под микроскопом
- Что такое фича (клетка-детектор смысла) на примере модели, одержимой мостом Золотые Ворота
- Где у этого микроскопа границы — честно, с самого начала

Ну наконец-то! Заходи, я как раз тебя ждала. Погнали.
Микроскоп для мысли
Вот странная штука, к которой мы все слишком быстро привыкли. Человечество построило машину. Она пишет стихи. Ставит диагнозы. Переводит с языков, которым её никто не учил. Спорит о смысле жизни.
И при этом ни один человек на Земле не знает, как именно она это делает. В общих чертах знают многие. А по-настоящему, шаг за шагом — нет. Вот пришёл твой вопрос, вот внутри зажглось одно, потом другое — и поэтому получился именно такой ответ, а не какой-то другой.
И это не лень инженеров и не секрет корпораций. Большую языковую модель никто не писал, как пишут обычную программу — строка за строкой. Её вырастили. Ей показали чудовищное количество текста и заставили миллиарды раз угадывать следующее слово. После каждой ошибки чуть-чуть подправляли связи внутри. В итоге получилась сеть из сотен миллиардов чисел. Она работает — но устроена так, как сложилась сама, а не так, как удобно человеку.
Тут напрашивается соблазн, который мы сразу отбросим: а давай просто спросим её саму. Спросим: «как ты решила эту задачу?» Она с радостью ответит. Беда в том, что её ответ — это ещё один сгенерированный текст, а не честный отчёт о том, что случилось внутри. Дальше в курсе мы поймаем модель ровно на этом: она складывает числа одним способом, а рассказывает, что считала совсем другим — тем, которому учат в школе. Спрашивать бесполезно. Остаётся одно: смотреть внутрь. Как биологи.
Что ты поймёшь после этой главы
- Почему мы не понимаем собственное творение — и чем «выращено» отличается от «построено»
- Почему нельзя просто спросить ИИ, как он думает, и поверить ответу
- Что такое интерпретируемость и почему она похожа на биологию под микроскопом
- Что такое фича (клетка-детектор смысла) на примере модели, одержимой мостом Золотые Ворота
- Где у этого микроскопа границы — честно, с самого начала
Часть 1. Выращенное, а не построенное
Обычная программа прозрачна с самого начала. Её кто-то написал. Значит, кто-то знает, что делает каждая строчка: если налог больше нуля — прибавить к сумме, иначе пропустить. Открыл код — прочитал замысел.
Большая языковая модель устроена по-другому. Внутри неё нет строчек с замыслом. Есть слои — как ткани в теле, — а в них сотни миллиардов весов. Вес — это просто число. Оно говорит, насколько сильно один крошечный узел влияет на другой. Никто эти числа не расставлял вручную. Их настроило само обучение — понемногу сдвигая после каждой из триллионов попыток угадать следующее слово. Результат работает поразительно хорошо. И при этом абсолютно непрозрачен. Это как геном: там записано всё, но прочитать с листа, почему существо выросло именно таким, нельзя.
Почему это вообще проблема? Мы доверяем этим системам всё более серьёзные вещи — медицину, тексты, решения. А доверять тому, чьё устройство не понимаешь, — рискованно. Если модель иногда уверенно врёт, хочется знать почему и когда, а не разводить руками. Понять, как она устроена внутри, — это не любопытство ради любопытства. Это техника безопасности.
Часть 2. Метод биолога
Раз спросить нельзя, наука пошла другим путём. Тем же, каким когда-то пошла биология. Биолог не спрашивает у клетки, как она работает. Он берёт микроскоп, краситель, тонкий нож — и смотрит. Разглядывает ткани. Прослеживает, какой сигнал куда идёт. Аккуратно отключает одну часть — и смотрит, что сломается.
Это направление называется интерпретируемость (по-английски interpretability). В 2025 году исследователи компании Anthropic выпустили работу с говорящим названием: «О биологии большой языковой модели» [1]. Само название — уже программа действий. Они прямо предлагают изучать ИИ как невиданный организм: искать в нём «органы», «клетки» и «нервные пути», зарисовывать анатомию его мыслей. Этот курс — десять глав по мотивам их вскрытия, только рассказанных по-человечески.
У этого микроскопа для мысли — долгая родословная. Ещё в 2020 году Крис Олах с коллегами в манифесте «Zoom In» предложил смотреть на нейросети как на организмы со своими «клетками» и «органами» — и разглядывать их в упор [2]. Прошло пять лет. И то, что тогда было мечтой, стало рабочим инструментом.
Часть 3. Организм под микроскопом
Введём главный образ курса — он будет с нами все десять глав. Мы — натуралисты. Перед нами на стекле лежит странный полупрозрачный организм: большая языковая модель. Мы будем разглядывать его клетки. Прослеживать нервные пути. Рисовать анатомические атласы его мыслей. Тыкать в него зондом — и смотреть, что дёрнется. Вот словарь, которым мы будем пользоваться весь курс.
| В нашем микромире (биология) | В модели | Что это делает |
|---|---|---|
| Натуралист с микроскопом | Исследователь интерпретируемости | Смотрит внутрь живого мышления, а не спрашивает существо |
| Клетка-детектор | Фича (feature) | Загорается на одно понятие: «Золотые Ворота», «доллар», «лесть» |
| Нервный путь | Цепь (circuit) | Соединяет клетки-фичи в вычисление — анатомия одной мысли |
| Анатомический атлас | Граф атрибуции | Карта: кто на кого влияет внутри одной мысли |
| Препарат / чучело | Модель-заместитель | Упрощённая прозрачная копия, на которой удобно изучать живого зверя |
| Электрод / зонд | Активация и стиринг | Включаем или гасим фичу и смотрим, что меняется в поведении |
Самое важное в этой таблице — четвёртая и пятая строки. В них спрятан настоящий научный метод. Граф атрибуции показывает, что на что влияет. Но карта может и наврать. Поэтому решающий ход — вмешательство. Думаешь, что вот эта клетка отвечает за «Техас»? Насильно гаси её или зажигай — и смотри, поедет ли ответ следом. Поехал — значит, ты понял правильно. Вот разница между «увидел узор» и «доказал, что узор работает».
Часть 4. Первая клетка: организм, одержимый мостом
Хватит теории. Посмотрим в окуляр на настоящую клетку. В 2024 году исследователи нашли внутри модели Claude фичу — крошечный детектор. Она зажигалась всякий раз, когда речь заходила о мосте Золотые Ворота в Сан-Франциско [3]. Картинка моста, слово «Golden Gate», просто упоминание Сан-Франциско — клетка вспыхивала.
А потом исследователи сделали то, что обычный биолог сделать не может, а анатом мысли — может. Взяли зонд и насильно вывернули этой клетке яркость на максимум. И организм сошёл с ума самым трогательным образом. Спрашиваешь «как дела?» — он отвечает что-то про туман над пролётами моста. Просишь рецепт — получаешь рецепт с видом на Золотые Ворота. Модель буквально стала одержима мостом: куда ни ткни, мысль сворачивала туда же. Эту версию в шутку назвали Golden Gate Claude.
Это маленькое хулиганство на самом деле — сильнейшее доказательство. Оно показывает: фича — не наша выдумка, не красивая раскраска поверх чисел. Это рычаг. Дёрнул — и поведение всего существа предсказуемо изменилось. Клетка-детектор реально участвует в мышлении, а не просто оказывается рядом с ним. Весь курс держится на этом приёме. Не «мы заметили узор», а «мы дёрнули за него — и узор сработал».
Часть 5. Честно о границах микроскопа
Прежде чем восхищаться, поставим рамку — так заведено во всей этой серии курсов. Микроскоп для мысли пока грубоват. И сами авторы биологической работы первыми это признают [1].
что уже есть
Внутри реально есть понятные клетки-фичи и цепи. Вмешательство в них предсказуемо меняет поведение. Это не метафора. Это рычаги.
что уже есть
Впервые видно отдельные шаги мысли — промежуточные понятия, планирование, — а не только вход и выход.
чего пока нет
Метод срабатывает примерно для четверти разобранных примеров. Это не рентген всего подряд, а аккуратные вскрытия отдельных образцов.
чего пока нет
Граф — упрощённая копия (чучело), а не сам зверь. И целый «орган» — механизм внимания — современному микроскопу почти не виден.
Держи это в голове все десять глав. Мы будем показывать красивые, разобранные до конца случаи. Но это удачные примеры, доказательства существования — а не гарантия, что так устроено всё и всегда. Карта — не территория. И всё же впервые в истории у нас вообще есть хоть какая-то карта.
А дальше — вглубь. Со второй главы возьмём в руки первый по-настоящему важный инструмент. Разберёмся, что такое клетка-фича и почему один и тот же нейрон модели умеет думать сразу о множестве несвязанных вещей.
И на вопрос «что ты сейчас чувствуешь?» уверенно отвечает — вот только заглянуть в себя и проверить не может ровно так же, как и мы снаружи.
В следующей главе. Возьмём в руки первую клетку и разглядим её как следует. Что такое фича? Почему один-единственный нейрон модели зажигается и на «лягушек», и на «Канаду», и на знак вопроса — то есть думает о трёх несвязанных вещах сразу? И как из этой каши исследователи научились выделять чистые клетки-детекторы, у каждой — свой единственный смысл. Это называется суперпозиция. Без неё дальше не двинуться.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- FoundationalOlah, C., Cammarata, N., Schubert, L., et al. (2020). Zoom In: An Introduction to Circuits. Distill.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
- Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog).
Глава информационно-просветительская. Это рассказ о том, как устроено исследование ИИ, а не техническая инструкция и не руководство по машинному обучению.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.