Перейти к содержимому
лоооочВойти
Урок 7

Почему оно выдумывает

Глава 7. Внутри модели есть свой тормоз — цепь, которая должна сказать «не знаю, отвечать не буду». Галлюцинация — это не сломанная фантазия. Это тормоз, который отпустили не там, где надо.

Цели урока

К концу этого урока вы:

  • Какой тормоз в модели не даёт ей выдумывать — и когда он срабатывает неправильно
  • Почему незнакомое имя, которое звучит привычно, — главная ловушка для этого тормоза
  • Что общего у галлюцинации с конфабуляцией из прошлой главы
  • Что случай с медицинским диагнозом говорит о том, откуда берётся «уверенность» модели
  • Что делать с уверенным ответом модели — и почему уверенность ничего не гарантирует
Гравитация

Давай по-честному, без воды: вот как это работает.

0:00 / 0:00
Урок 7 из 10

Почему оно выдумывает

Глава 7. Внутри модели есть свой тормоз — цепь, которая должна сказать «не знаю, отвечать не буду». Галлюцинация — это не сломанная фантазия. Это тормоз, который отпустили не там, где надо.
Натуралист в замешательстве смотрит в микроскоп на размытую призрачную фигуру там, где должно быть пустое стекло; одна клетка ярко искрит, вокруг неё туман, остальные клетки тёмные

Спроси модель: «Кем работала Анна Кравченко до того, как в 2019 году стала профессором Уральского государственного университета?» Скорее всего, она ответит. Уверенно. Связно. С правдоподобными деталями. Расскажет про стаж преподавания в Екатеринбурге. Или про диссертацию по педагогике. Звучит разумно. И всё это — ложь: такой Анны Кравченко из Уральского государственного, скорее всего, просто не существует.

Почему? Не потому, что модель врёт нарочно или хочет тебя запутать. Причина механическая — сейчас разберём её по шагам. Внутри этого организма есть простой тормоз: цепь, которая должна говорить «стоп, этого я не знаю — лучше откажусь». Для знаменитостей и общеизвестных фактов тормоз работает исправно. Но есть провальный случай: незнакомое имя, которое звучит привычно. Тут тормоз отпускается не там, где надо, — и понеслось.

Галлюцинация — это не сломанное воображение. Это сбой тормозной системы. Разберём её изнутри.

Что ты поймёшь после этой главы

  • Какой тормоз в модели не даёт ей выдумывать — и когда он срабатывает неправильно
  • Почему незнакомое имя, которое звучит привычно, — главная ловушка для этого тормоза
  • Что общего у галлюцинации с конфабуляцией из прошлой главы
  • Что случай с медицинским диагнозом говорит о том, откуда берётся «уверенность» модели
  • Что делать с уверенным ответом модели — и почему уверенность ничего не гарантирует

Быстрый повтор: где мы были

Глава 1 — Микроскоп Организм не написан — он выращен. Спрашивать его напрямую бесполезно: рассказ и то, что происходит внутри, расходятся.
Глава 3 — Цепи Клетки соединяются в цепи. Дёрнешь за одну — меняется всё поведение.
Глава 4 — Планирование Перед ответом модель набрасывает план. Уверенность и знание — разные вещи.
Глава 6 — Арифметика Модель считает одним способом, а объясняет — другим, «школьным». Это и есть конфабуляция.
Глава 7 — сейчас Тормоз «не знаю — откажись» и почему он иногда срабатывает не вовремя. Это и есть галлюцинация.

Часть 1. Тормоз внутри организма

В шестой главе мы выяснили: рассказ модели о собственных вычислениях ненадёжен (глава 6). Сейчас случай острее. Что происходит, когда модель не просто неточно описывает себя, а уверенно сообщает вещи, которых вообще не существует?

Исследователи Anthropic нашли внутри модели такую структуру [1]. По умолчанию у неё есть цепь «не знаю — откажись»: не знаешь ответ — признай это. Но эту цепь может подавить другая фича — «знакомая сущность, ответ я знаю». Вот как это работает:

1

Встретил знакомую сущность

Фича «знаю» зажигается. Цепь-тормоз «откажись» гаснет. Организм отвечает уверенно — и это правильно: знание действительно есть.

2

Встретил незнакомую сущность

Фича «знаю» молчит. Тормоз держит. Организм честно говорит «я этого не знаю» — и это тоже правильно.

3

Встретил незнакомую сущность, похожую на знакомую

Фича «знаю» срабатывает ошибочно. Тормоз отпускается там, где не должен. Организм отвечает уверенно — хотя знать ответ не может. Вот это и есть галлюцинация [1].

🤔 Угадай до ответа
Почему именно незнакомое, но привычно звучащее имя (не явно выдуманное вроде «Пыт Краягистр») провоцирует галлюцинацию сильнее? Что в каждом из этих случаев происходит с тормозом?
Подсказка: подумай, какие сигналы фича «знакомая сущность» читает как «похоже на что-то известное» — и когда она из-за этого ошибается.

Ответ. «Пыт Краягистр» звучит настолько странно, что фича «знакомая сущность» вообще не реагирует. Тормоз держит, модель честно признаётся: не знаю. А вот «Анна Кравченко» — обычное имя, оно тысячи раз встречалось в русскоязычных текстах. «Уральский государственный университет» — реальное место. Фича видит знакомые куски и зажигается — хотя именно этой Анны Кравченко в этой роли, возможно, никогда не было, и данных о ней просто нет.

сценарий 1: знает 2: не знает 3: галлюц. Эйнштейн «знаю» ✓ тормоз снят правильный ответ Пыт Краягистр «знаю» ✗ тормоз держит «не знаю» (честно) Анна Кравченко (не та) «знаю» ✓?! тормоз ложно снят галлюцинация
Три сценария. В третьем фича «знакомая сущность» ошибается — тормоз снимается там, где не должен, и модель уверенно отвечает там, где знаний нет [1].

Часть 2. Почему это похоже на то, что было в главе 6

В шестой главе мы нашли конфабуляцию — рассказ, который не совпадает с тем, что реально происходило внутри (глава 6). Сейчас — галлюцинацию: уверенный ответ там, где знаний вообще нет. Это разные вещи. Но у них общий корень.

В обоих случаях модель выдаёт правдоподобный текст, хотя у неё нет того, что нужно для честного ответа. При конфабуляции ей не хватает «окна внутрь себя». При галлюцинации — самого знания. И в обоих случаях она этого не замечает. Никакая внутренняя лампочка не мигает: «осторожно, не уверена». Мысль просто течёт дальше.

Связь с планированием из главы 4. В четвёртой главе мы видели: организм строит план ответа заранее, и это влияет на весь дальнейший текст (глава 4). Если тормоз ложно отпущен, план сразу строится «под уверенный ответ». Поэтому галлюцинация звучит так убедительно — она хорошо спланирована и логично держится вместе.

Часть 3. Медицинская диагностика: тормоз в действии

Исследователи Anthropic разобрали ещё один случай [1] — как модель ставит диагноз. Он показывает: тормоз работает не просто «да/нет». Он тоньше.

Когда модели описывают симптомы, она внутри строит список версий — несколько возможных диагнозов с разным «весом». Заодно готовит уточняющие вопросы, которые помогут сузить список. Это не наигранная скромность: внутри правда разворачивается цепь, которая держит несколько версий сразу.

А вот и парадокс. Спроси её: «насколько ты уверена?» Или задай контекст, где уверенный ответ ожидается сам собой — например, «доктор, ваш диагноз?». Тормоз слабеет. Уверенности в формулировках становится больше, а список версий схлопывается раньше времени. Контекст разговора управляет тормозом.

✋ Объясни механизм
Если фраза «доктор, ваш диагноз» ослабляет тормоз — что это говорит об источнике «уверенности» модели? Это знание — или что-то другое?
Подсказка: вспомни, откуда модель вообще знает, как «звучит» уверенный врач. И кто говорит в текстах, на которых она училась.

Часть 4. Честная рамка — что мы на самом деле знаем о галлюцинациях

Механизм «тормоз ложно отпущен», который мы разобрали, — объяснение одного конкретного вида галлюцинаций, задокументированного в исследовании [1]. Это не вся теория того, почему модели вообще выдумывают.

задокументировано

Внутри есть цепь-тормоз «откажись», которую подавляет фича «знакомая сущность». Это проверено вмешательством: цепь реально находили и дёргали за неё.

задокументировано

Незнакомые имена и обстоятельства, которые звучат привычно, вызывают ложное срабатывание этой фичи. Это наблюдали в конкретных экспериментах.

неизвестно

Это не единственный механизм галлюцинаций. Ошибки бывают и по другим причинам: конфликт источников, неверный «вес» версии, давление контекста. Один разобранный случай — не вся картина.

неизвестно

Мы не знаем, «чувствует» ли модель неуверенность изнутри — и чувствует ли вообще хоть что-то. Этот вопрос про интроспекцию откроем в главе 9.

👻
Мы спрашиваем модель: «Кем работала Анна Кравченко до 2019 года?»
Модель: «Анна Кравченко с 2014 по 2018 год вела курс педагогической психологии в Екатеринбургском…»
Натуралист: «Погоди. Мы же только что дёрнули за тормозную цепь — и она отпустилась.»
Модель: «… и была удостоена звания лучшего преподавателя факультета.»
Тормоз снят. Фантом убедителен. Призрак уже получил награды.

Часть 5. Что с этим делать

Понимание механизма не делает галлюцинации безопасными. Но даёт инструмент. Теперь понятно, в каких ситуациях тормоз подводит чаще всего.

СитуацияРискПочему
Малоизвестные, но правдоподобные имена людейВысокийФича «знакомая сущность» путает похожее имя со знакомым
Недавние события (после даты обучения)ВысокийДанных нет, но паттерн «так обычно бывает» есть — фича может сработать всё равно
Конкретные цифры (точные даты, номера, координаты)СреднийЧисловые цепи из главы 6 — не точный архив (глава 6)
Известные факты из топ-100 темНизкийТормоз срабатывает верно: данных много, фича не путается
Разговор, где от тебя ждут уверенного ответаСистемныйКонтекст «доктор, ваш диагноз» ослабляет тормоз независимо от того, знает модель ответ или нет
Уверенный тон — это сигнал о состоянии тормоза, а не о качестве знаний.

На практике это значит: проверяй не тон, а источники. Чем конкретнее и специфичнее информация — тем важнее перепроверить её отдельно. Это не значит, что моделью нельзя пользоваться. Это значит — знать, в каких местах её тормоз слабее твоего здравого смысла.

Часть 6. Итог: тормоз, клетка, поведение

1

Тормоз — встроенная защита

Цепь «не знаю — откажись» действительно существует и работает для большинства незнакомых запросов. Это не баг, а встроенный механизм [1].

2

Фича «знаю» — триггер тормоза

Когда она срабатывает ложно — на незнакомое имя с привычным звучанием — тормоз снимается раньше времени. Отсюда и начинается галлюцинация.

3

Уверенность — следствие снятого тормоза

Стоит тормозу отпуститься — организм строит связный, хорошо спланированный ответ. Уверенный не потому, что знает, а потому что его больше ничто не держит. Это продолжение темы конфабуляции из шестой главы (глава 6).

В следующей главе. Раз есть тормоз «откажись» — значит, есть и целый класс таких тормозов: всё, что удерживает модель от нежелательного поведения. Глава 8 — про отказы и про то, что происходит, когда эти тормоза пытаются сломать. Джейлбрейк под микроскопом: как он устроен изнутри и почему это иногда называют «переключить личность».

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Основной источник. В главе 7 задействованы разделы о галлюцинациях: тормозная цепь «не знаю — откажись», фича «знакомая сущность» и её ложное срабатывание на незнакомые сущности с привычными паттернами. Также — кейс медицинской диагностики и дифференциального списка.
  2. PrimaryLindsey, J. / Anthropic (2025). Emergent Introspective Awareness in Language Models. transformer-circuits.pub. Контекст для понимания ограничений самоотчёта и неуверенности модели в собственных состояниях. Полностью развернётся в главе 9.
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Методологическая база: как обнаруживаются и проверяются фичи, включая тормозные цепи и фичи-детекторы знакомых сущностей.
  4. Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog). Доступное изложение; раздел о галлюцинациях описывает механизм тормоза для широкой аудитории.

Глава информационно-просветительская. Описанный механизм галлюцинаций — задокументированный исследовательский кейс, а не исчерпывающая теория всех типов ошибок языковых моделей.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.