Почему оно выдумывает
Глава 7. Внутри модели есть свой тормоз — цепь, которая должна сказать «не знаю, отвечать не буду». Галлюцинация — это не сломанная фантазия. Это тормоз, который отпустили не там, где надо.
Цели урока
К концу этого урока вы:
- Какой тормоз в модели не даёт ей выдумывать — и когда он срабатывает неправильно
- Почему незнакомое имя, которое звучит привычно, — главная ловушка для этого тормоза
- Что общего у галлюцинации с конфабуляцией из прошлой главы
- Что случай с медицинским диагнозом говорит о том, откуда берётся «уверенность» модели
- Что делать с уверенным ответом модели — и почему уверенность ничего не гарантирует

Давай по-честному, без воды: вот как это работает.
Почему оно выдумывает
Спроси модель: «Кем работала Анна Кравченко до того, как в 2019 году стала профессором Уральского государственного университета?» Скорее всего, она ответит. Уверенно. Связно. С правдоподобными деталями. Расскажет про стаж преподавания в Екатеринбурге. Или про диссертацию по педагогике. Звучит разумно. И всё это — ложь: такой Анны Кравченко из Уральского государственного, скорее всего, просто не существует.
Почему? Не потому, что модель врёт нарочно или хочет тебя запутать. Причина механическая — сейчас разберём её по шагам. Внутри этого организма есть простой тормоз: цепь, которая должна говорить «стоп, этого я не знаю — лучше откажусь». Для знаменитостей и общеизвестных фактов тормоз работает исправно. Но есть провальный случай: незнакомое имя, которое звучит привычно. Тут тормоз отпускается не там, где надо, — и понеслось.
Галлюцинация — это не сломанное воображение. Это сбой тормозной системы. Разберём её изнутри.
Что ты поймёшь после этой главы
- Какой тормоз в модели не даёт ей выдумывать — и когда он срабатывает неправильно
- Почему незнакомое имя, которое звучит привычно, — главная ловушка для этого тормоза
- Что общего у галлюцинации с конфабуляцией из прошлой главы
- Что случай с медицинским диагнозом говорит о том, откуда берётся «уверенность» модели
- Что делать с уверенным ответом модели — и почему уверенность ничего не гарантирует
Быстрый повтор: где мы были
Часть 1. Тормоз внутри организма
В шестой главе мы выяснили: рассказ модели о собственных вычислениях ненадёжен (глава 6). Сейчас случай острее. Что происходит, когда модель не просто неточно описывает себя, а уверенно сообщает вещи, которых вообще не существует?
Исследователи Anthropic нашли внутри модели такую структуру [1]. По умолчанию у неё есть цепь «не знаю — откажись»: не знаешь ответ — признай это. Но эту цепь может подавить другая фича — «знакомая сущность, ответ я знаю». Вот как это работает:
Встретил знакомую сущность
Фича «знаю» зажигается. Цепь-тормоз «откажись» гаснет. Организм отвечает уверенно — и это правильно: знание действительно есть.
Встретил незнакомую сущность
Фича «знаю» молчит. Тормоз держит. Организм честно говорит «я этого не знаю» — и это тоже правильно.
Встретил незнакомую сущность, похожую на знакомую
Фича «знаю» срабатывает ошибочно. Тормоз отпускается там, где не должен. Организм отвечает уверенно — хотя знать ответ не может. Вот это и есть галлюцинация [1].
Ответ. «Пыт Краягистр» звучит настолько странно, что фича «знакомая сущность» вообще не реагирует. Тормоз держит, модель честно признаётся: не знаю. А вот «Анна Кравченко» — обычное имя, оно тысячи раз встречалось в русскоязычных текстах. «Уральский государственный университет» — реальное место. Фича видит знакомые куски и зажигается — хотя именно этой Анны Кравченко в этой роли, возможно, никогда не было, и данных о ней просто нет.
Часть 2. Почему это похоже на то, что было в главе 6
В шестой главе мы нашли конфабуляцию — рассказ, который не совпадает с тем, что реально происходило внутри (глава 6). Сейчас — галлюцинацию: уверенный ответ там, где знаний вообще нет. Это разные вещи. Но у них общий корень.
В обоих случаях модель выдаёт правдоподобный текст, хотя у неё нет того, что нужно для честного ответа. При конфабуляции ей не хватает «окна внутрь себя». При галлюцинации — самого знания. И в обоих случаях она этого не замечает. Никакая внутренняя лампочка не мигает: «осторожно, не уверена». Мысль просто течёт дальше.
Связь с планированием из главы 4. В четвёртой главе мы видели: организм строит план ответа заранее, и это влияет на весь дальнейший текст (глава 4). Если тормоз ложно отпущен, план сразу строится «под уверенный ответ». Поэтому галлюцинация звучит так убедительно — она хорошо спланирована и логично держится вместе.
Часть 3. Медицинская диагностика: тормоз в действии
Исследователи Anthropic разобрали ещё один случай [1] — как модель ставит диагноз. Он показывает: тормоз работает не просто «да/нет». Он тоньше.
Когда модели описывают симптомы, она внутри строит список версий — несколько возможных диагнозов с разным «весом». Заодно готовит уточняющие вопросы, которые помогут сузить список. Это не наигранная скромность: внутри правда разворачивается цепь, которая держит несколько версий сразу.
А вот и парадокс. Спроси её: «насколько ты уверена?» Или задай контекст, где уверенный ответ ожидается сам собой — например, «доктор, ваш диагноз?». Тормоз слабеет. Уверенности в формулировках становится больше, а список версий схлопывается раньше времени. Контекст разговора управляет тормозом.
Часть 4. Честная рамка — что мы на самом деле знаем о галлюцинациях
Механизм «тормоз ложно отпущен», который мы разобрали, — объяснение одного конкретного вида галлюцинаций, задокументированного в исследовании [1]. Это не вся теория того, почему модели вообще выдумывают.
задокументировано
Внутри есть цепь-тормоз «откажись», которую подавляет фича «знакомая сущность». Это проверено вмешательством: цепь реально находили и дёргали за неё.
задокументировано
Незнакомые имена и обстоятельства, которые звучат привычно, вызывают ложное срабатывание этой фичи. Это наблюдали в конкретных экспериментах.
неизвестно
Это не единственный механизм галлюцинаций. Ошибки бывают и по другим причинам: конфликт источников, неверный «вес» версии, давление контекста. Один разобранный случай — не вся картина.
неизвестно
Мы не знаем, «чувствует» ли модель неуверенность изнутри — и чувствует ли вообще хоть что-то. Этот вопрос про интроспекцию откроем в главе 9.
Модель: «Анна Кравченко с 2014 по 2018 год вела курс педагогической психологии в Екатеринбургском…»
Натуралист: «Погоди. Мы же только что дёрнули за тормозную цепь — и она отпустилась.»
Модель: «… и была удостоена звания лучшего преподавателя факультета.»
Тормоз снят. Фантом убедителен. Призрак уже получил награды.
Часть 5. Что с этим делать
Понимание механизма не делает галлюцинации безопасными. Но даёт инструмент. Теперь понятно, в каких ситуациях тормоз подводит чаще всего.
| Ситуация | Риск | Почему |
|---|---|---|
| Малоизвестные, но правдоподобные имена людей | Высокий | Фича «знакомая сущность» путает похожее имя со знакомым |
| Недавние события (после даты обучения) | Высокий | Данных нет, но паттерн «так обычно бывает» есть — фича может сработать всё равно |
| Конкретные цифры (точные даты, номера, координаты) | Средний | Числовые цепи из главы 6 — не точный архив (глава 6) |
| Известные факты из топ-100 тем | Низкий | Тормоз срабатывает верно: данных много, фича не путается |
| Разговор, где от тебя ждут уверенного ответа | Системный | Контекст «доктор, ваш диагноз» ослабляет тормоз независимо от того, знает модель ответ или нет |
На практике это значит: проверяй не тон, а источники. Чем конкретнее и специфичнее информация — тем важнее перепроверить её отдельно. Это не значит, что моделью нельзя пользоваться. Это значит — знать, в каких местах её тормоз слабее твоего здравого смысла.
Часть 6. Итог: тормоз, клетка, поведение
Тормоз — встроенная защита
Цепь «не знаю — откажись» действительно существует и работает для большинства незнакомых запросов. Это не баг, а встроенный механизм [1].
Фича «знаю» — триггер тормоза
Когда она срабатывает ложно — на незнакомое имя с привычным звучанием — тормоз снимается раньше времени. Отсюда и начинается галлюцинация.
Уверенность — следствие снятого тормоза
Стоит тормозу отпуститься — организм строит связный, хорошо спланированный ответ. Уверенный не потому, что знает, а потому что его больше ничто не держит. Это продолжение темы конфабуляции из шестой главы (глава 6).
В следующей главе. Раз есть тормоз «откажись» — значит, есть и целый класс таких тормозов: всё, что удерживает модель от нежелательного поведения. Глава 8 — про отказы и про то, что происходит, когда эти тормоза пытаются сломать. Джейлбрейк под микроскопом: как он устроен изнутри и почему это иногда называют «переключить личность».
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- PrimaryLindsey, J. / Anthropic (2025). Emergent Introspective Awareness in Language Models. transformer-circuits.pub.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
- Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog).
Глава информационно-просветительская. Описанный механизм галлюцинаций — задокументированный исследовательский кейс, а не исчерпывающая теория всех типов ошибок языковых моделей.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.