Перейти к содержимому
лоооочВойти
Урок 4

Существо, которое планирует

Глава 4. Модель вроде бы должна писать вслепую — слово за словом, не заглядывая вперёд. Но иногда она держит в голове финал ещё до середины пути. Вот в чём загадка

Цели урока

К концу этого урока вы:

  • Что нашли исследователи, когда заглянули внутрь модели, сочиняющей рифму
  • Почему если погасить одну «намеченную» клетку-фичу в начале строки, вся строка перестраивается под новую рифму
  • Что такое «внутренняя карта мира» — и почему пространство и время у модели устроены как настоящая геометрия
  • Где граница честности: перед нами удачные разобранные случаи, а не доказательство, что модель планирует всегда
Гравитация

Замри на секунду. Сейчас будет интересно.

0:00 / 0:00
Урок 4 из 10

Существо, которое планирует

Глава 4. Модель вроде бы должна писать вслепую — слово за словом, не заглядывая вперёд. Но иногда она держит в голове финал ещё до середины пути. Вот в чём загадка
Натуралист рассматривает светящуюся нить-паутину в тёмной лаборатории: нить тянется вперёд к мерцающей точке-цели, путь ещё не прорисован, но конец уже намечен
Глава 1 — Микроскоп ИИ — как неизвестный организм. Смотрим внутрь, а не спрашиваем на словах. Вмешательство — не то же самое, что наблюдение
Глава 2 — Клетки-детекторы Признаки: один нейрон держит сразу много смыслов. SAE помогает выделить чистые клетки-детекторы
Глава 3 — Нервный путь Цепочки: как клетки-детекторы соединяются в вычисление. Дёрнули за «Техас» — и ответ поехал следом
Глава 4 — сегодня Модель придумывает рифму в конце строки заранее, ещё до середины. Это и есть планирование

Вот парадокс, в который трудно поверить сразу. Нам говорят: языковая модель — это машина предсказаний. Она смотрит на уже написанный текст, выбирает самое вероятное следующее слово, пишет его — и снова смотрит, снова выбирает. Шаг за шагом, не глядя вперёд, вслепую. Механизм простой. Результат — нет.

Но если это правда, объясни вот что. Как существо, которое смотрит только назад, пишет двустишие, где вторая строка рифмуется с первой? Рифма стоит в конце строки. А путь к ней — впереди. Чтобы написать «вот снова — снова», нужно уже в первом слове строки держать в уме последнее слово — и вести строку так, чтобы к нему прийти. Значит, модель заглядывает вперёд. Хотя по официальной версии не должна.

Это не красивая метафора и не догадка. Это результат прямого вмешательства в модель — сейчас разберём его по шагам [1].

Что ты поймёшь после этой главы

  • Что нашли исследователи, когда заглянули внутрь модели, сочиняющей рифму
  • Почему если погасить одну «намеченную» клетку-фичу в начале строки, вся строка перестраивается под новую рифму
  • Что такое «внутренняя карта мира» — и почему пространство и время у модели устроены как настоящая геометрия
  • Где граница честности: перед нами удачные разобранные случаи, а не доказательство, что модель планирует всегда

Часть 1. Натуралист с микроскопом смотрит на рифму

Вспомни первый урок: смотреть, а не спрашивать. И не просто смотреть — вмешиваться. Дёрнуть за клетку-детектор и проверить: поедет за ней поведение или нет. Здесь именно так и сделали.

Исследователи дали модели задание: закончить двустишие так, чтобы вторая строка рифмовалась с первой. И пока модель писала самые первые слова второй строки — задолго до конца — учёные заглянули внутрь. И нашли странную вещь. Уже в самом начале строки, в активациях, сидела информация о том, каким будет последнее слово-рифма — слово, которое модель ещё даже не написала [1].

Мало увидеть — надо проверить. Учёные погасили эту клетку с заготовленной рифмой. Что случилось дальше? Строка не рассыпалась в бессмыслицу. Она перестроилась: модель выбрала другое конечное слово — и подогнала под него весь путь от начала строки до конца. Дёрнули за клетку — и поведение поехало следом.

🤔 Угадай до ответа
Погасили заготовленную рифму — и строка перестроилась под новую. Что это на самом деле доказывает? Попробуй сформулировать ответ своими словами, прежде чем читать дальше.
Подсказка: почему это аргумент про причину, а не просто про совпадение? Вспомни главу 3: разница между «клетка загорается рядом со словом «Техас»» и «дёрнули за Техас — и ответ поехал за ним».

Ответ: заготовленное слово-рифма реально участвует в том, как строится строка — причинно, а не просто «рядом». Модель не случайно держала рифму где-то на фоне — она держала её как ориентир и строила путь именно к нему. Убрали ориентир — путь перестроился. Вот что такое планирование: не угадывание шаг за шагом, а цель, которая заранее держит в узде всё, что происходит между началом и концом.

Часть 2. Нить вперёд — как это выглядит изнутри

Вернёмся к анатомии нашего организма. В главе 3 мы разбирали нервный путь — цепочку клеток-детекторов, которая тянет сигнал от вопроса к ответу. Та цепь шла вперёд: вопрос → промежуточные шаги → ответ. Здесь всё иначе: информация о ещё не написанном финале сидит в самом начале пути. Это как будто нить, которая тянется в обратную сторону.

Намеченная цель (рифма) — присутствует заранее рифма (цель) начало строки строка строится к намеченной рифме слово 1 слово 2 слово 3 рифма (конец) погасили «рифму» — путь перестроился под новую цель
Рифма-цель сидит в начале строки как ориентир. Весь путь между словами строится так, чтобы прийти к ней. Погаси цель — получишь другой путь.

Тут важна точность. Модель не «читает будущее». Внутри неё сидит что-то вроде заместителя финального слова — его звучание или смысл, — и этот заместитель влияет на выбор каждого промежуточного слова. Похоже на повара, который заранее знает вкус готового блюда и под этот вкус выстраивает шаги: нарезать, обжарить, приправить. Сначала в голове результат — потом путь к нему.

Часть 3. Внутренние модели мира: пространство и время

Рифма — только один пример планирования. Картина шире. Организм строит планы не только на одну строку. Он строит внутри себя целые карты реальности.

В 2023 году исследователи Уэс Гурни и Макс Тегмарк обнаружили: языковые модели держат пространство и время внутри как настоящую геометрию, прямо в активациях [2]. Прочувствуй, насколько это странно. Модель никто не учил «понимать» карту мира. Никто не говорил ей: вот север, вот юг, а вот координаты Парижа. Она просто читала текст — путевые заметки, справочники, романы, новости. И сама собой внутри сложилась карта: слова про Париж тяготеют к одному месту в пространстве активаций, слова про Токио — к другому, а расстояние между ними примерно совпадает с реальным расстоянием на глобусе.

То же самое со временем. Модель не просто заучила, что «1800 год раньше 1900». Она держит исторические события в геометрии: ранние и поздние события разнесены в пространстве активаций, а события одной эпохи собираются в кучку. Это не словарь дат. Это что-то похожее на ощущение длительности. Историю в буквальном смысле можно увидеть в геометрии активаций.

Связь с главой 1: это не значит, что модель «сознательно понимает» карту. Но значит, что внутри есть что-то, что работает как карта — и оно реально влияет на ответы про географию и время. Дёрни за нужную точку на этой внутренней карте — ответ поедет следом.
✋ Удивись правильно
Откуда у модели взялась внутренняя карта пространства, если геометрии мира её никто не учил? Сформулируй своё лучшее объяснение: почему такая карта могла сама вырасти из обучения на текстах?
Подсказка: подумай, что текст говорит о пространстве косвенно — «из Москвы в Берлин долго лететь», «до Петербурга рукой подать», «к западу от Варшавы». За каждой такой фразой стоит пространственное отношение. Если таких фраз миллионы — что должно появиться внутри модели?

Часть 4. Честная калибровка: что доказано, а что нет

Момент честности. Мы тут не делаем рекламный буклет. Важно понимать разницу между «доказано на разобранных примерах» и «доказано всегда» [1].

что доказано

На конкретных, тщательно разобранных примерах рифмовки: заготовленная рифма сидит в начале строки и реально влияет на весь путь к ней. Это проверено вмешательством, а не догадкой.

что доказано

Внутренние геометрические карты пространства и времени реально сидят в активациях. И по ним можно предсказать, как модель ответит на вопросы про место и время.

чего нет

Нет доказательства, что модель планирует всегда и для любой задачи. Мы видели удачные случаи, которые получилось вскрыть, — а не рентген вообще всего, что она делает.

чего нет

Планирование в модели не обязательно похоже на планирование в голове человека. Слово одно и то же — но это не значит, что механизм тот же.

Проще говоря: «существо, которое планирует» — это портрет, нарисованный по нескольким разобранным мазкам. Не фотография всего организма целиком. Мазки настоящие. Портрет, возможно, верный. Но полный атлас мы ещё не дорисовали.

Часть 5. Что это значит для нашего мифа

Вернёмся к парадоксу, с которого начали. Миф говорит: языковая модель «просто» предсказывает следующее слово. Это правда. И одновременно — только половина правды.

Правда — если смотреть на поверхность. Технически на каждом шаге модель выдаёт список вероятностей для следующего токена. В этом смысле она и правда предсказывает следующее слово.

Но «предсказывает следующее слово» — это описание того, что видно снаружи. Не того, что творится внутри. Наш микроскоп показывает другое: внутри организм строит промежуточные шаги, в которых уже сидит информация о том, что ещё не написано. Он держит ориентир. Он лезет во внутренние карты мира. И это куда больше, чем слепой взгляд назад.

🎼
«Модель просто предсказывает следующее слово» — это как сказать про дирижёра: «он просто машет палочкой». Технически верно. Вот только машет он именно так, потому что весь финал симфонии уже держит в голове с самого первого взмаха.
До последней ноты он доберётся по очереди — но знал её ещё до того, как вообще поднял руку.

Это не значит, что модель «сознательна» или «понимает» по-человечески. Это значит, что фраза «предсказывает следующее слово» слишком грубая для того, что происходит внутри. Наша задача — не поменять один миф на другой, а смотреть честно.

Итоги главы

1

Намечает финал до пути

Сочиняя двустишие, модель держит слово-рифму в уме уже с начала строки — и строит весь путь так, чтобы к нему прийти.

2

Вмешательство доказывает причинность

Погасили заготовленную рифму — и строка перестроилась. Это не совпадение, это рычаг. Та же логика, что в главе 3 с «Техасом».

3

Внутри есть карты мира

Пространство и время живут внутри модели как настоящая геометрия. Возникли сами, просто из обучения на текстах о пространстве и времени.

4

«Всегда» — не доказано

Это удачные разобранные случаи, а не рентген всего подряд. Слово «планирование» удобно для разговора, но не гарантирует, что механизм точно такой же, как у человека.

В следующей главе. Пока мы говорили про один язык — русский или английский. Но модель обучена сразу на десятках языков. Значит ли это, что внутри у неё десяток разных «умов»? Или один общий? В главе 5 заглянем в многоязычное ядро модели — и увидим, что понятие живёт отдельно от языка, на котором его выражают. И что эта общность растёт вместе с размером модели.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Главный источник курса. Раздел о планировании и рифмовке: модель держит намеченную рифму в начале строки; погашение этой фичи перестраивает всю строку. Раздел о геометрических внутренних представлениях пространства и времени.
  2. Peer-reviewedGurnee, W. & Tegmark, M. (2023). Language Models Represent Space and Time. arXiv:2310.02207. Доказательство, что языковые модели внутренне представляют географические и исторические координаты как линейные геометрические структуры в пространстве активаций. Модели точнее воспроизводят пространство и время, чем это можно объяснить простым запоминанием фактов. arXiv: 2310.02207
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Масштабирование разреженных автоэнкодеров (SAE) для вычленения чистых фич из Claude 3 Sonnet. Контекст для понимания того, как вообще «намеченная рифма» может быть представлена как отдельная фича.

Глава информационно-просветительская. Это рассказ об исследовании ИИ, а не техническая инструкция.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.