Перейти к содержимому
лоооочВойти
Урок 1

Микроскоп для мысли

Глава 1. Мы построили существо, которое думает — и не понимаем как. Спросить его нельзя: оно ответит, но соврёт. Остаётся одно — взять микроскоп

Цели урока

К концу этого урока вы:

  • Почему мы не понимаем собственное творение — и чем «выращено» отличается от «построено»
  • Почему нельзя просто спросить ИИ, как он думает, и поверить ответу
  • Что такое интерпретируемость и почему она похожа на биологию под микроскопом
  • Что такое фича (клетка-детектор смысла) на примере модели, одержимой мостом Золотые Ворота
  • Где у этого микроскопа границы — честно, с самого начала
Гравитация

Ну наконец-то! Заходи, я как раз тебя ждала. Погнали.

0:00 / 0:00
Урок 1 из 10

Микроскоп для мысли

Глава 1. Мы построили существо, которое думает — и не понимаем как. Спросить его нельзя: оно ответит, но соврёт. Остаётся одно — взять микроскоп
Натуралист при мягком свете смотрит в большой латунный микроскоп на светящийся полупрозрачный неведомый организм на предметном стекле, ощущение удивления перед чем-то невиданным, старинная лаборатория

Вот странная штука, к которой мы все слишком быстро привыкли. Человечество построило машину. Она пишет стихи. Ставит диагнозы. Переводит с языков, которым её никто не учил. Спорит о смысле жизни.

И при этом ни один человек на Земле не знает, как именно она это делает. В общих чертах знают многие. А по-настоящему, шаг за шагом — нет. Вот пришёл твой вопрос, вот внутри зажглось одно, потом другое — и поэтому получился именно такой ответ, а не какой-то другой.

И это не лень инженеров и не секрет корпораций. Большую языковую модель никто не писал, как пишут обычную программу — строка за строкой. Её вырастили. Ей показали чудовищное количество текста и заставили миллиарды раз угадывать следующее слово. После каждой ошибки чуть-чуть подправляли связи внутри. В итоге получилась сеть из сотен миллиардов чисел. Она работает — но устроена так, как сложилась сама, а не так, как удобно человеку.

Мы оказались в положении биолога, которому принесли живой организм невиданного вида и сказали: разберись, как он устроен.

Тут напрашивается соблазн, который мы сразу отбросим: а давай просто спросим её саму. Спросим: «как ты решила эту задачу?» Она с радостью ответит. Беда в том, что её ответ — это ещё один сгенерированный текст, а не честный отчёт о том, что случилось внутри. Дальше в курсе мы поймаем модель ровно на этом: она складывает числа одним способом, а рассказывает, что считала совсем другим — тем, которому учат в школе. Спрашивать бесполезно. Остаётся одно: смотреть внутрь. Как биологи.

Что ты поймёшь после этой главы

  • Почему мы не понимаем собственное творение — и чем «выращено» отличается от «построено»
  • Почему нельзя просто спросить ИИ, как он думает, и поверить ответу
  • Что такое интерпретируемость и почему она похожа на биологию под микроскопом
  • Что такое фича (клетка-детектор смысла) на примере модели, одержимой мостом Золотые Ворота
  • Где у этого микроскопа границы — честно, с самого начала

Часть 1. Выращенное, а не построенное

Обычная программа прозрачна с самого начала. Её кто-то написал. Значит, кто-то знает, что делает каждая строчка: если налог больше нуля — прибавить к сумме, иначе пропустить. Открыл код — прочитал замысел.

Большая языковая модель устроена по-другому. Внутри неё нет строчек с замыслом. Есть слои — как ткани в теле, — а в них сотни миллиардов весов. Вес — это просто число. Оно говорит, насколько сильно один крошечный узел влияет на другой. Никто эти числа не расставлял вручную. Их настроило само обучение — понемногу сдвигая после каждой из триллионов попыток угадать следующее слово. Результат работает поразительно хорошо. И при этом абсолютно непрозрачен. Это как геном: там записано всё, но прочитать с листа, почему существо выросло именно таким, нельзя.

Почему это вообще проблема? Мы доверяем этим системам всё более серьёзные вещи — медицину, тексты, решения. А доверять тому, чьё устройство не понимаешь, — рискованно. Если модель иногда уверенно врёт, хочется знать почему и когда, а не разводить руками. Понять, как она устроена внутри, — это не любопытство ради любопытства. Это техника безопасности.

🤔 Угадай до ответа
Если спросить ИИ напрямую: «как ты только что решил эту задачу?» — можно ли доверять его ответу как честному отчёту о том, что происходило внутри?
Подсказка: вспомни, чем вообще является любой ответ модели. Это рассказ, сгенерированный так же, как и всё остальное, — а не показания свидетеля, который заглянул себе внутрь.

Часть 2. Метод биолога

Раз спросить нельзя, наука пошла другим путём. Тем же, каким когда-то пошла биология. Биолог не спрашивает у клетки, как она работает. Он берёт микроскоп, краситель, тонкий нож — и смотрит. Разглядывает ткани. Прослеживает, какой сигнал куда идёт. Аккуратно отключает одну часть — и смотрит, что сломается.

Это направление называется интерпретируемость (по-английски interpretability). В 2025 году исследователи компании Anthropic выпустили работу с говорящим названием: «О биологии большой языковой модели» [1]. Само название — уже программа действий. Они прямо предлагают изучать ИИ как невиданный организм: искать в нём «органы», «клетки» и «нервные пути», зарисовывать анатомию его мыслей. Этот курс — десять глав по мотивам их вскрытия, только рассказанных по-человечески.

У этого микроскопа для мысли — долгая родословная. Ещё в 2020 году Крис Олах с коллегами в манифесте «Zoom In» предложил смотреть на нейросети как на организмы со своими «клетками» и «органами» — и разглядывать их в упор [2]. Прошло пять лет. И то, что тогда было мечтой, стало рабочим инструментом.

Нельзя допросить мысль. Но можно её препарировать.

Часть 3. Организм под микроскопом

Введём главный образ курса — он будет с нами все десять глав. Мы — натуралисты. Перед нами на стекле лежит странный полупрозрачный организм: большая языковая модель. Мы будем разглядывать его клетки. Прослеживать нервные пути. Рисовать анатомические атласы его мыслей. Тыкать в него зондом — и смотреть, что дёрнется. Вот словарь, которым мы будем пользоваться весь курс.

В нашем микромире (биология)В моделиЧто это делает
Натуралист с микроскопомИсследователь интерпретируемостиСмотрит внутрь живого мышления, а не спрашивает существо
Клетка-детекторФича (feature)Загорается на одно понятие: «Золотые Ворота», «доллар», «лесть»
Нервный путьЦепь (circuit)Соединяет клетки-фичи в вычисление — анатомия одной мысли
Анатомический атласГраф атрибуцииКарта: кто на кого влияет внутри одной мысли
Препарат / чучелоМодель-заместительУпрощённая прозрачная копия, на которой удобно изучать живого зверя
Электрод / зондАктивация и стирингВключаем или гасим фичу и смотрим, что меняется в поведении

Самое важное в этой таблице — четвёртая и пятая строки. В них спрятан настоящий научный метод. Граф атрибуции показывает, что на что влияет. Но карта может и наврать. Поэтому решающий ход — вмешательство. Думаешь, что вот эта клетка отвечает за «Техас»? Насильно гаси её или зажигай — и смотри, поедет ли ответ следом. Поехал — значит, ты понял правильно. Вот разница между «увидел узор» и «доказал, что узор работает».

Снаружи: чёрный ящик вопрос ? ответ видно вход и выход, но не «как» Под микроскопом: видно цепь вопрос фича фича ответ видно, какие клетки зажглись по пути
Две позиции наблюдателя. Снаружи видно только вопрос и ответ. Под микроскопом — цепочку клеток-фич, которые зажглись по дороге от вопроса к ответу.

Часть 4. Первая клетка: организм, одержимый мостом

Хватит теории. Посмотрим в окуляр на настоящую клетку. В 2024 году исследователи нашли внутри модели Claude фичу — крошечный детектор. Она зажигалась всякий раз, когда речь заходила о мосте Золотые Ворота в Сан-Франциско [3]. Картинка моста, слово «Golden Gate», просто упоминание Сан-Франциско — клетка вспыхивала.

А потом исследователи сделали то, что обычный биолог сделать не может, а анатом мысли — может. Взяли зонд и насильно вывернули этой клетке яркость на максимум. И организм сошёл с ума самым трогательным образом. Спрашиваешь «как дела?» — он отвечает что-то про туман над пролётами моста. Просишь рецепт — получаешь рецепт с видом на Золотые Ворота. Модель буквально стала одержима мостом: куда ни ткни, мысль сворачивала туда же. Эту версию в шутку назвали Golden Gate Claude.

Это маленькое хулиганство на самом деле — сильнейшее доказательство. Оно показывает: фича — не наша выдумка, не красивая раскраска поверх чисел. Это рычаг. Дёрнул — и поведение всего существа предсказуемо изменилось. Клетка-детектор реально участвует в мышлении, а не просто оказывается рядом с ним. Весь курс держится на этом приёме. Не «мы заметили узор», а «мы дёрнули за него — и узор сработал».

Дальше в курсе мы дёрнем за клетку «Техас» посреди задачи про столицы (Глава 3), погасим намеченное слово-рифму в стихе (Глава 4) и подсунем модели чужую мысль, чтобы проверить, заметит ли она её в себе (Глава 9).

Часть 5. Честно о границах микроскопа

Прежде чем восхищаться, поставим рамку — так заведено во всей этой серии курсов. Микроскоп для мысли пока грубоват. И сами авторы биологической работы первыми это признают [1].

что уже есть

Внутри реально есть понятные клетки-фичи и цепи. Вмешательство в них предсказуемо меняет поведение. Это не метафора. Это рычаги.

что уже есть

Впервые видно отдельные шаги мысли — промежуточные понятия, планирование, — а не только вход и выход.

чего пока нет

Метод срабатывает примерно для четверти разобранных примеров. Это не рентген всего подряд, а аккуратные вскрытия отдельных образцов.

чего пока нет

Граф — упрощённая копия (чучело), а не сам зверь. И целый «орган» — механизм внимания — современному микроскопу почти не виден.

Держи это в голове все десять глав. Мы будем показывать красивые, разобранные до конца случаи. Но это удачные примеры, доказательства существования — а не гарантия, что так устроено всё и всегда. Карта — не территория. И всё же впервые в истории у нас вообще есть хоть какая-то карта.

А дальше — вглубь. Со второй главы возьмём в руки первый по-настоящему важный инструмент. Разберёмся, что такое клетка-фича и почему один и тот же нейрон модели умеет думать сразу о множестве несвязанных вещей.

✋ Self-check
Сформулируй в одном-двух предложениях: почему интерпретируемость изучает ИИ «как биолог под микроскопом», а не просто спрашивает его, как он думает? И что превращает замеченный узор в доказанный механизм?
Подсказка: первое слово — «отчёт ненадёжен». Второе — «вмешательство»: погасил клетку, и ответ поехал следом.
🔬
Большая языковая модель — единственный организм в истории биологии, который во время собственного вскрытия продолжает бодро давать советы по саморазвитию.
И на вопрос «что ты сейчас чувствуешь?» уверенно отвечает — вот только заглянуть в себя и проверить не может ровно так же, как и мы снаружи.

В следующей главе. Возьмём в руки первую клетку и разглядим её как следует. Что такое фича? Почему один-единственный нейрон модели зажигается и на «лягушек», и на «Канаду», и на знак вопроса — то есть думает о трёх несвязанных вещах сразу? И как из этой каши исследователи научились выделять чистые клетки-детекторы, у каждой — свой единственный смысл. Это называется суперпозиция. Без неё дальше не двинуться.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Главный источник всего курса. Разбор внутренних механизмов модели Claude через «графы атрибуции»: многошаговое рассуждение, планирование, многоязычие, арифметика, галлюцинации, отказы, джейлбрейки. Авторы честно перечисляют ограничения метода (работает для части примеров, упрощает, не видит внимание).
  2. FoundationalOlah, C., Cammarata, N., Schubert, L., et al. (2020). Zoom In: An Introduction to Circuits. Distill. Манифест механистической интерпретируемости: предложение смотреть на нейросети как на организмы с «клетками» (features) и «цепями» (circuits) и разглядывать их в упор. Идейная основа «биологического» подхода. DOI: 10.23915/distill.00024.001
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Откуда взят пример с фичей «Золотые Ворота» и Golden Gate Claude: усиление одной фичи делает модель одержимой одним понятием — доказательство, что фичи причинно участвуют в мышлении.
  4. Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog). Доступное популярное изложение «биологической» работы для широкой аудитории, с наглядными примерами и оговорками о границах метода. Хороший вход в тему без специального образования.

Глава информационно-просветительская. Это рассказ о том, как устроено исследование ИИ, а не техническая инструкция и не руководство по машинному обучению.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.