Существо, которое планирует
Глава 4. Модель вроде бы должна писать вслепую — слово за словом, не заглядывая вперёд. Но иногда она держит в голове финал ещё до середины пути. Вот в чём загадка
Цели урока
К концу этого урока вы:
- Что нашли исследователи, когда заглянули внутрь модели, сочиняющей рифму
- Почему если погасить одну «намеченную» клетку-фичу в начале строки, вся строка перестраивается под новую рифму
- Что такое «внутренняя карта мира» — и почему пространство и время у модели устроены как настоящая геометрия
- Где граница честности: перед нами удачные разобранные случаи, а не доказательство, что модель планирует всегда

Замри на секунду. Сейчас будет интересно.
Существо, которое планирует
Вот парадокс, в который трудно поверить сразу. Нам говорят: языковая модель — это машина предсказаний. Она смотрит на уже написанный текст, выбирает самое вероятное следующее слово, пишет его — и снова смотрит, снова выбирает. Шаг за шагом, не глядя вперёд, вслепую. Механизм простой. Результат — нет.
Но если это правда, объясни вот что. Как существо, которое смотрит только назад, пишет двустишие, где вторая строка рифмуется с первой? Рифма стоит в конце строки. А путь к ней — впереди. Чтобы написать «вот снова — снова», нужно уже в первом слове строки держать в уме последнее слово — и вести строку так, чтобы к нему прийти. Значит, модель заглядывает вперёд. Хотя по официальной версии не должна.
Это не красивая метафора и не догадка. Это результат прямого вмешательства в модель — сейчас разберём его по шагам [1].
Что ты поймёшь после этой главы
- Что нашли исследователи, когда заглянули внутрь модели, сочиняющей рифму
- Почему если погасить одну «намеченную» клетку-фичу в начале строки, вся строка перестраивается под новую рифму
- Что такое «внутренняя карта мира» — и почему пространство и время у модели устроены как настоящая геометрия
- Где граница честности: перед нами удачные разобранные случаи, а не доказательство, что модель планирует всегда
Часть 1. Натуралист с микроскопом смотрит на рифму
Вспомни первый урок: смотреть, а не спрашивать. И не просто смотреть — вмешиваться. Дёрнуть за клетку-детектор и проверить: поедет за ней поведение или нет. Здесь именно так и сделали.
Исследователи дали модели задание: закончить двустишие так, чтобы вторая строка рифмовалась с первой. И пока модель писала самые первые слова второй строки — задолго до конца — учёные заглянули внутрь. И нашли странную вещь. Уже в самом начале строки, в активациях, сидела информация о том, каким будет последнее слово-рифма — слово, которое модель ещё даже не написала [1].
Мало увидеть — надо проверить. Учёные погасили эту клетку с заготовленной рифмой. Что случилось дальше? Строка не рассыпалась в бессмыслицу. Она перестроилась: модель выбрала другое конечное слово — и подогнала под него весь путь от начала строки до конца. Дёрнули за клетку — и поведение поехало следом.
Ответ: заготовленное слово-рифма реально участвует в том, как строится строка — причинно, а не просто «рядом». Модель не случайно держала рифму где-то на фоне — она держала её как ориентир и строила путь именно к нему. Убрали ориентир — путь перестроился. Вот что такое планирование: не угадывание шаг за шагом, а цель, которая заранее держит в узде всё, что происходит между началом и концом.
Часть 2. Нить вперёд — как это выглядит изнутри
Вернёмся к анатомии нашего организма. В главе 3 мы разбирали нервный путь — цепочку клеток-детекторов, которая тянет сигнал от вопроса к ответу. Та цепь шла вперёд: вопрос → промежуточные шаги → ответ. Здесь всё иначе: информация о ещё не написанном финале сидит в самом начале пути. Это как будто нить, которая тянется в обратную сторону.
Тут важна точность. Модель не «читает будущее». Внутри неё сидит что-то вроде заместителя финального слова — его звучание или смысл, — и этот заместитель влияет на выбор каждого промежуточного слова. Похоже на повара, который заранее знает вкус готового блюда и под этот вкус выстраивает шаги: нарезать, обжарить, приправить. Сначала в голове результат — потом путь к нему.
Часть 3. Внутренние модели мира: пространство и время
Рифма — только один пример планирования. Картина шире. Организм строит планы не только на одну строку. Он строит внутри себя целые карты реальности.
В 2023 году исследователи Уэс Гурни и Макс Тегмарк обнаружили: языковые модели держат пространство и время внутри как настоящую геометрию, прямо в активациях [2]. Прочувствуй, насколько это странно. Модель никто не учил «понимать» карту мира. Никто не говорил ей: вот север, вот юг, а вот координаты Парижа. Она просто читала текст — путевые заметки, справочники, романы, новости. И сама собой внутри сложилась карта: слова про Париж тяготеют к одному месту в пространстве активаций, слова про Токио — к другому, а расстояние между ними примерно совпадает с реальным расстоянием на глобусе.
То же самое со временем. Модель не просто заучила, что «1800 год раньше 1900». Она держит исторические события в геометрии: ранние и поздние события разнесены в пространстве активаций, а события одной эпохи собираются в кучку. Это не словарь дат. Это что-то похожее на ощущение длительности. Историю в буквальном смысле можно увидеть в геометрии активаций.
Часть 4. Честная калибровка: что доказано, а что нет
Момент честности. Мы тут не делаем рекламный буклет. Важно понимать разницу между «доказано на разобранных примерах» и «доказано всегда» [1].
что доказано
На конкретных, тщательно разобранных примерах рифмовки: заготовленная рифма сидит в начале строки и реально влияет на весь путь к ней. Это проверено вмешательством, а не догадкой.
что доказано
Внутренние геометрические карты пространства и времени реально сидят в активациях. И по ним можно предсказать, как модель ответит на вопросы про место и время.
чего нет
Нет доказательства, что модель планирует всегда и для любой задачи. Мы видели удачные случаи, которые получилось вскрыть, — а не рентген вообще всего, что она делает.
чего нет
Планирование в модели не обязательно похоже на планирование в голове человека. Слово одно и то же — но это не значит, что механизм тот же.
Проще говоря: «существо, которое планирует» — это портрет, нарисованный по нескольким разобранным мазкам. Не фотография всего организма целиком. Мазки настоящие. Портрет, возможно, верный. Но полный атлас мы ещё не дорисовали.
Часть 5. Что это значит для нашего мифа
Вернёмся к парадоксу, с которого начали. Миф говорит: языковая модель «просто» предсказывает следующее слово. Это правда. И одновременно — только половина правды.
Правда — если смотреть на поверхность. Технически на каждом шаге модель выдаёт список вероятностей для следующего токена. В этом смысле она и правда предсказывает следующее слово.
Но «предсказывает следующее слово» — это описание того, что видно снаружи. Не того, что творится внутри. Наш микроскоп показывает другое: внутри организм строит промежуточные шаги, в которых уже сидит информация о том, что ещё не написано. Он держит ориентир. Он лезет во внутренние карты мира. И это куда больше, чем слепой взгляд назад.
До последней ноты он доберётся по очереди — но знал её ещё до того, как вообще поднял руку.
Это не значит, что модель «сознательна» или «понимает» по-человечески. Это значит, что фраза «предсказывает следующее слово» слишком грубая для того, что происходит внутри. Наша задача — не поменять один миф на другой, а смотреть честно.
Итоги главы
Намечает финал до пути
Сочиняя двустишие, модель держит слово-рифму в уме уже с начала строки — и строит весь путь так, чтобы к нему прийти.
Вмешательство доказывает причинность
Погасили заготовленную рифму — и строка перестроилась. Это не совпадение, это рычаг. Та же логика, что в главе 3 с «Техасом».
Внутри есть карты мира
Пространство и время живут внутри модели как настоящая геометрия. Возникли сами, просто из обучения на текстах о пространстве и времени.
«Всегда» — не доказано
Это удачные разобранные случаи, а не рентген всего подряд. Слово «планирование» удобно для разговора, но не гарантирует, что механизм точно такой же, как у человека.
В следующей главе. Пока мы говорили про один язык — русский или английский. Но модель обучена сразу на десятках языков. Значит ли это, что внутри у неё десяток разных «умов»? Или один общий? В главе 5 заглянем в многоязычное ядро модели — и увидим, что понятие живёт отдельно от языка, на котором его выражают. И что эта общность растёт вместе с размером модели.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- Peer-reviewedGurnee, W. & Tegmark, M. (2023). Language Models Represent Space and Time. arXiv:2310.02207.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
Глава информационно-просветительская. Это рассказ об исследовании ИИ, а не техническая инструкция.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.