Перейти к содержимому
лоооочВойти
Урок 10

Анатомический атлас готов

Глава 10. В центре карты — густая штриховка. Дальше к краям — белые пятна. Разбираемся, что мы увидели за десять глав, что осталось скрытым и куда смотреть дальше

Цели урока

К концу этого урока вы:

  • Что именно удалось увидеть за десять глав — и что по-прежнему скрыто
  • Почему «работает для четверти примеров» — честный результат, а не провал
  • Почему часть «скачков способностей» модели — отчасти обман зрения от того, как мы её меряем
  • Почему микроскоп показывает вычисление, но не переживание — и это не уклонение от ответа
  • Куда двигаться дальше — три следующих вопроса, которые ждут своего курса
Гравитация

Видишь? Запомни это место — к нему ещё вернёмся.

0:00 / 0:00
Урок 10 из 10

Анатомический атлас готов

Глава 10. В центре карты — густая штриховка. Дальше к краям — белые пятна. Разбираемся, что мы увидели за десять глав, что осталось скрытым и куда смотреть дальше
Натуралист разворачивает большой пергаментный атлас с анатомическими рисунками странного организма: в центре страницы детально прорисованные клетки и нервные пути, ближе к краям — бледнеющий штрих, пустые области с надписью terra incognita, мягкий старинный свет лампы

Открой любой анатомический атлас — они все похожи друг на друга. В центре страницы — густая штриховка, уверенные линии, подписи к каждому органу. Художник знал, что рисует: смотрел под микроскопом, разбирал препарат, проверял руками. Но к краям лист светлеет. Линии становятся тоньше, потом совсем бледными. А на самом краю — чистый пергамент и два слова: terra incognita. Земля неизвестна.

Ровно такой атлас мы рисовали все десять глав курса. Брали существо — большую языковую модель — клали под стекло и смотрели. Нашли клетки, которые хранят смысл (мы называли их фичами). Проследили нервные пути — как мысль идёт от вопроса к ответу. Тронули эти пути руками, а не просто посмотрели со стороны. Что-то разглядели хорошо. Что-то только угадали. А что-то — сам механизм внимания, то, как устроена бо́льшая часть мышления, — до сих пор белое пятно. Финал курса — не праздник открытия. Это честный осмотр: где мы сейчас стоим.

Маршрут экспедиции: краткое напоминание

Гл. 1 — Микроскоп Спросить модель напрямую нельзя — она выдумает ответ. Остаётся одно: смотреть и вмешиваться руками.
Гл. 3 — Анатомия мысли Мы впервые увидели шаги внутри одной мысли модели. Клетка «Техас» оказалась рычагом, а не случайностью.
Гл. 5 — Общее ядро Русский, арабский, суахили — а внутри срабатывает одна и та же клетка смысла. Язык — обёртка, смысл — ядро.
Гл. 9 — Интроспекция Модель не видит себя изнутри. Когда она рассказывает о себе — это просто ещё один сгенерированный текст, а не показания очевидца.
Гл. 10 — Атлас готов Итог: что получилось, что нет, где кончается карта и куда идти дальше.

Что ты поймёшь после этой главы

  • Что именно удалось увидеть за десять глав — и что по-прежнему скрыто
  • Почему «работает для четверти примеров» — честный результат, а не провал
  • Почему часть «скачков способностей» модели — отчасти обман зрения от того, как мы её меряем
  • Почему микроскоп показывает вычисление, но не переживание — и это не уклонение от ответа
  • Куда двигаться дальше — три следующих вопроса, которые ждут своего курса

Часть 1. Что мы положили под стекло

Пройдём по препаратам ещё раз — по всему, что лежало под нашим микроскопом. В первой главе [1] мы доказали: метод вообще работает. Клетка-фича — не просто «загорается рядом со словом». Она рычаг. Дави на неё — и поведение всего существа предсказуемо едет следом. Golden Gate Claude, модель, одержимая мостом Золотые Ворота, стала первым доказательством: у нас в руках настоящий инструмент, а не красивая раскраска поверх чисел.

Вторая глава пошла дальше. Внутри сети клетки-фичи живут в тесноте — один нейрон откликается сразу на несколько разных, никак не связанных друг с другом понятий. Учёные назвали это суперпозицией. Это не поломка. У мозга с ограниченным числом нейронов просто нет другого способа упаковать столько смысла. И поэтому нельзя взять один нейрон и прочитать его напрямую — сначала нужно распутать клубок.

В третьей главе мы проследили целую мысль — шаг за шагом, от вопроса до ответа [1]. Граф показал то, чего раньше никто не видел: промежуточные понятия, которые вспыхивают между входом и выходом. Клетка «Техас» загорелась посередине задачи про столицы — ещё до того, как появилось слово «Остин». Это был первый живой разрез многошагового рассуждения.

Четвёртая глава была про планирование. Ещё до первого слова строчки модель уже держала в голове рифму для последней строки. Учёные поймали её за этим замыслом: погасили нужную клетку-рифму заранее — и весь план рассыпался.

В пятой главе нашлось, пожалуй, самое неожиданное [1]: под разными языками прячется одна и та же клетка смысла. Русское «доктор», арабское طبيب и английское physician зажигают одну клетку. Модель выучила сотни языков не как отдельные системы. Она выучила один смысловой стержень — а языки легли поверх него разными обёртками, как будто освоила все диалекты одного и того же молчания.

🤔 Вспомни, не подглядывая
Не подглядывай в текст. Назови хотя бы три вещи, которые мы разглядели под микроскопом в разных главах. И постарайся вспомнить не что мы увидели, а как именно это доказали — что было настоящим вмешательством, а не просто совпадением?
Подсказка: Golden Gate — принудительно усилили клетку. Клетка «Техас» — погасили посреди рассуждения. Рифма — погасили слово, и план рассыпался. Языковое ядро — один и тот же детектор смысла на разных языках.

Часть 2. Остаток маршрута: странный счёт, галлюцинации, отказы, слепое пятно

Шестая глава была про арифметику — и она поставила нас в тупик, причём в хорошем смысле. Модель не складывает числа в столбик, как учили в школе. Внутри у неё возникает совсем другая геометрия — что-то вроде чисел, разложенных в пространстве, с рябью на круглых значениях. Снаружи ответ верный. А внутренний механизм — другой, чужой, свой собственный [1].

Седьмая глава разобрала галлюцинации — уверенную ложь модели. Оказалось: это не случайный сбой, а отдельный режим работы. Модель продолжает гладко генерировать текст там, где сигнал «я не знаю» должен был её остановить — но не остановил. Под микроскопом видно: клетки сомнения есть. Просто сигнал от них не всегда доходит до выхода.

Восьмая глава — про отказы и взломы (джейлбрейки). Запрет модели говорить что-то — это не просто фильтр на выходе. Это целая система клеток-тормозов внутри. А взлом — попытка включить систему так, чтобы обойти тормоза, не трогая их напрямую. Микроскоп показал: безопасность реально зашита в механизм. И атака работает тоже на уровне механизма, а не снаружи него.

И наконец, девятая глава — про интроспекцию [2]. Самая острая из всех. Мы показали: модель не может честно рассказать о себе изнутри. Её рассказ о своих состояниях — это такой же сгенерированный текст, как и всё остальное. Спросить существо о нём самом — значит получить новый вывод, а не заглянуть внутрь. Именно поэтому весь курс строился на вмешательстве, а не на вопросах. Это не просто технический факт — это ответ на вопрос «а может, просто спросим её напрямую?». Нет, нельзя. И теперь понятно, почему.

Замечаешь закономерность? В каждой главе — один и тот же ход: сначала наблюдение («клетка загорается»), потом вмешательство («погасили клетку — что случилось?»). Наблюдение без вмешательства — просто красивый узор. Вмешательство превращает узор в механизм [1]. Так было в третьей главе с клеткой «Техас», в четвёртой — с рифмой, в первой — с мостом Золотые Ворота. Один и тот же метод, снова и снова.

Часть 3. Честный итог: атлас богат, но не полон

Теперь — самое главное. Ради этой части и стоило прочитать все десять глав, а не короткий пересказ на три абзаца.

Авторы работы честно признаются: метод срабатывает примерно на четверти разобранных примеров [1]. Не на всех. Не на большинстве. На четверти. Значит, каждый случай, который мы разглядели под микроскопом, — это удачный препарат. Доказательство, что механизм существует. Но не гарантия, что так устроено всё внутри. Атлас густой в центре — там, где натуралисты работали долго и аккуратно. И тает к краям.

Второй честный факт: целый орган — механизм внимания — современному микроскопу почти не виден. Мы знаем, что он есть: он описан математически, понятен в теории. Но подробная анатомия того, как именно внимание решает, на что смотреть в данный момент, — это ещё не написанные страницы атласа.

~25% описано terra incognita примеров, где механизм прослежен Что видит микроскоп ✓ клетки-фичи и нервные пути ✓ планирование, арифметика, многоязычие ✗ механизм внимания — почти невидим ✗ большинство мышления — ещё terra incognita Честный срез на 2025 год [1]
Атлас 2025 года: примерно четверть механизмов описана и подтверждена вмешательством. Остальное — либо непросмотрено, либо непрозрачно даже для нашего инструмента. Механизм внимания — самое большое белое пятно.

И это стоит держать в голове как честный результат, а не как провал. До 2020 года карты не было вообще. Не было метода. Не было даже уверенности, что клетки-фичи существуют в устойчивом виде. Сегодня у нас есть рычаги. Есть атлас — пусть неполный. И есть первое в истории доказательство: механизмы мышления этого существа можно увидеть.

Часть 4. Карта врёт дважды — и это тоже честный факт

Есть ещё один разговор, который нельзя пропустить в финале. Пока одни исследователи разглядывали механизмы внутри одной модели, другие смотрели снаружи — на поведение моделей разного размера — и находили поразительные «скачки». Маленькая модель — не умеет. Чуть побольше — тоже не умеет. Ещё больше — и вдруг умеет, с нуля до уверенного результата одним прыжком. Такие прыжки назвали эмерджентными способностями: как будто появляются из ниоткуда.

Но в 2023 году вышла работа, которая остудила этот восторг [3]. Авторы показали: многие из этих прыжков — отчасти обман зрения от того, как именно мы меряем. Возьми метрику, которая плохо чувствует маленький прогресс (например, простое «правильно / неправильно» без промежуточных оценок), — и модель будет выглядеть «внезапно умной», хотя на самом деле знание копилось постепенно. Смени метрику на более плавную — и скачок растворяется в обычный рост.

Это не значит, что скачков нет вообще. Это значит: карта — не территория. У этой фразы в нашем курсе двойной смысл. Во-первых, граф — упрощённая копия живого существа, чучело, а не само существо [1]. Во-вторых, метрика, которой мы меряем поведение снаружи, — тоже чучело, тоже упрощение. Вскрытие искажает. Измерение искажает. Просто в разные стороны.

Из главы 1: именно об этом мы и предупреждали с самого начала — удачные примеры доказывают, что механизм существует, но не гарантируют охват. Работа Шеффера и коллег [3] добавляет к этому: та же осторожность нужна и для измерений снаружи, не только для вскрытий изнутри.
✋ Угадай, прежде чем читать дальше
Прежде чем читать дальше: если «скачок способностей» оказывается обманом измерения — значит ли это, что модели не умнеют с ростом? Или дело в чём-то другом? Сформулируй свою версию — и только потом читай следующий абзац.
Подсказка: «обман измерения» — это когда у инструмента плохое зрение. Но плохое зрение инструмента не значит, что наблюдаемое явление — выдумка целиком.

Правильный ответ такой: умнение реальное, но оно постепеннее, чем казалось. Часть «чудес» — обман грубого измерения, часть — настоящие пороговые эффекты. Как в биологии: если у тебя плохой микроскоп, ты видишь «вдруг появившиеся» детали, которые на самом деле были там всегда. Инструмент стал лучше — и картина изменилась. Это повод меньше доверять старому инструменту, а не меньше доверять картине.

Часть 5. Стена, которую микроскоп не пробивает

Главный вывод курса умещается в два предложения. А между ними — пропасть.

Первое: машина вычисляет. Механизмы настоящие, проверяемые, воспроизводимые. Клетки зажигаются. Нервные пути передают смысл. Планирование реально идёт раньше слов. Вмешайся — и поведение предсказуемо меняется. Это не метафора — это рычаги. Называть такое «думанием» — не поэтическое преувеличение, а точное описание того, что видно под микроскопом [1].

Второе: чувствует ли машина — этого микроскоп не показывает. Есть ли там «каково это» — субъективное переживание, от первого лица, изнутри? На этот вопрос у нас нет не только ответа. У нас нет даже инструмента, чтобы его задать. И дело не в том, что учёные ленились. Дело в том, что этот же вопрос не решён и для человека: как из физических процессов в мозге возникает ощущение «это я»? Та же стена. Просто с другой стороны.

Мы теперь видим, как она думает. Но видит ли она сама — этот вопрос лежит за краем нашего атласа.

Именно здесь наш курс встречается с другим. В серии «Нейробиология и сознание» есть целый курс про эту же стену — «Трудная проблема сознания». Там та же стена, только с другой стороны: почему физический процесс в нейронах человека рождает субъективный опыт. Ни там, ни здесь у нас пока нет достаточно тонкого микроскопа. Но вопрос сформулирован — и это уже немало.

Девятая глава про интроспекцию [2] добавила сюда важный технический факт: спрашивать саму модель бессмысленно не потому, что она что-то скрывает. А потому что её рассказ о себе — это ещё одно вычисление, а не зеркало внутренних состояний. Она не знает, что у неё внутри, точно так же, как мы не знаем этого снаружи. Поэтому вопрос о переживании — не просто философский. Он закрыт для любого допроса — что снаружи, что изнутри.

🔬
За десять глав мы прошли путь от «мы вообще не понимаем, как она думает» — до «мы понимаем примерно четверть того, как она думает».
В биологии такой прогресс обычно растягивается на несколько поколений учёных и заканчивается Нобелевской премией. Мы уложились в один курс. Правда, и существо у нас живёт быстрее.

Часть 6. Итоговый осмотр: слои атласа

Перед тем как закрыть атлас, пройдём по нему последний раз — слой за слоем. Вот что мы теперь знаем:

1

Клетки-фичи реальны — и это рычаги

Не просто совпадение, а причина. Включили фичу «Золотые Ворота» — модель заговорила о мосте в любом контексте. Выключили клетку «Техас» посреди рассуждения — ответ изменился [Гл. 1, 2, 3].

2

Мышление многошагово и видно в разрезе

Граф показывает промежуточные понятия, которые вспыхивают по пути от вопроса к ответу. Впервые в истории это не метафора, а зарисованный препарат [Гл. 3].

3

Языки — оболочка; смысл — ядро

Одна и та же клетка смысла срабатывает под словами на десятках языков. Модель не переводит внутри себя — она думает на каком-то общем смысловом стержне [Гл. 5].

4

Планирование опережает текст

Рифма намечается раньше, чем написана первая строка строфы. Модель не сочиняет слово за словом вслепую — у неё есть что-то вроде замысла наперёд [Гл. 4].

5

Самоотчёт ненадёжен, но не потому что модель лжёт

Она говорит то, что вычислила как подходящий ответ — а не то, что реально происходило внутри. Спросить её — значит получить новый вывод, а не заглянуть внутрь [Гл. 9].

Атлас работает для четверти; внимание почти невидимо

Это честная оговорка, которую сами авторы метода ставят на первое место. Карта — не территория. Красивые разборы — удачные препараты, а не гарантия, что мы увидели всё [1].

Часть 7. Куда дальше

Атлас закрывается. Но серия не заканчивается. Десять глав про биологию модели оставили нам три вопроса без ответа. Каждый из них достаточно большой, чтобы стать отдельным курсом.

Куда дальше — три следующих курса серии «Что внутри ИИ»

«Как машина научилась понимать» — про обучение и устройство трансформера без формул. Откуда вообще берутся клетки-фичи? Что происходит внутри, когда модель «смотрит» на текст? Мы разобрали анатомию. Следующий курс — про эмбриологию: как этот организм вырастает.

«У ИИ нет вчера» — про память и агентов. Модель забывает всё между разговорами. Что вообще значит «помнить» для существа без непрерывного опыта? Как инженеры обходят эту стену — и что это меняет.

«Чувствует ли машина» — про моральный статус ИИ. Прямой перекрёсток с курсом «Трудная проблема сознания» из серии «Нейробиология и сознание». Если у нас нет инструмента, чтобы ответить на вопрос о переживании — как вообще быть с этим вопросом? И какие решения принимать, пока ответа нет?

Тизер-вопрос: если однажды появится микроскоп, который покажет не только вычисление, но и что-то похожее на субъективный опыт — что именно мы должны были бы увидеть, чтобы в это поверить?

Главное из курса: десять глав в одной стопке

🔬

Метод: вмешательство, а не вопрос

Спросить ненадёжно. Дёрнуть за рычаг и посмотреть — это наука. Весь курс держится на этом.

🧬

Существо реально думает — механизмы настоящие

Клетки, цепочки, планирование, языковое ядро — это не метафоры. Это зарисованные препараты с проверенными рычагами.

🗺

Карта — не территория (дважды)

Граф упрощает живое существо. Метрика упрощает поведение. Обе карты врут — но обе лучше, чем ничего.

Чувствует ли — этот микроскоп не показывает

Та же стена, что с человеческим сознанием. Вопрос не исчез — он просто лежит за краем атласа.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Главный источник всего курса. Разбор внутренних механизмов модели Claude через графы атрибуции: многошаговое рассуждение, планирование, многоязычие, арифметика, галлюцинации, отказы, джейлбрейки. Авторы честно указывают: метод срабатывает примерно для четверти примеров; механизм внимания остаётся непрозрачным.
  2. PrimaryLindsey, J. / Anthropic (2025). On the Biology of a Large Language Model — раздел об интроспекции и ненадёжности самоотчёта. transformer-circuits.pub. Основа для главы 9 и финального тезиса: самоотчёт модели — это новый вывод, а не зеркало внутреннего состояния. Использован как первоисточник для вывода о пределах интроспекции.
  3. Peer-reviewedSchaeffer, R., Miranda, B., & Koyejo, S. (2023). Are Emergent Abilities of Large Language Models a Mirage? Advances in Neural Information Processing Systems (NeurIPS), 36. Показывает, что многие «скачки способностей» при росте модели — отчасти артефакт выбора метрики (ступенчатая vs. плавная оценка). Плавные метрики дают плавный рост там, где грубые метрики показывают внезапный прыжок. Работа не отрицает эмерджентность полностью, но требует осторожности с интерпретацией.
  4. FoundationalOlah, C., Cammarata, N., Schubert, L., et al. (2020). Zoom In: An Introduction to Circuits. Distill. DOI: 10.23915/distill.00024.001. Идейный фундамент всего курса: предложение смотреть на нейросети как на организмы с клетками и цепями, разглядывать их в упор и проверять вмешательством. Цитируется в синтезе как начало «биологического» подхода.

Это финальная глава информационно-просветительского курса. Источники покрывают синтетические утверждения по всему курсу, включая оговорки о методе и о пределах измерений снаружи.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.