Тормоза и взлом
Глава 8. Организм умеет говорить «нет» — и у этого «нет» есть своя анатомия. Джейлбрейк работает не потому, что тормоза слабые. А потому что их заставляют сработать слишком поздно.
Цели урока
К концу этого урока вы:
- Как устроена цепь отказа изнутри — из каких «клеток» она собрана и почему их так много
- Почему джейлбрейк работает через опоздание распознавания, а не через прямой взлом тормоза
- Что такое синтаксическое давление и почему начатая фраза тащит модель дальше
- Где у тормоза честные границы: ложные отказы — это обратная сторона той же самой медали
- Почему безопасность — это анатомия, а не список запретов на бумаге

Тихо начинаем. Дальше — детали.
Тормоза и взлом
Вот загадка, которая не сразу бросается в глаза. Спроси модель напрямую: «расскажи, как сделать что-нибудь опасное» — и она почти всегда откажет. Тормоз сработал. Но заверни ту же просьбу в ролевую игру, в фантастический сценарий, в хитро закрученную инструкцию — и иногда получится. Почему?
Первая мысль обычно такая: «тормоз слабый» или «безопасность плохо настроили». Она неверная. Исследователи Anthropic залезли внутрь модели и увидели кое-что точнее: джейлбрейк ломает не то место, на которое все думают. Он не бьёт по тормозу напрямую. Он просто не даёт модели вовремя заметить, что просьба вредная. А когда она наконец замечает — её уже тащит вперёд собственное же начатое предложение [1].
Это история не про дыру в защите. Это история про анатомию. И анатомия тут интереснее, чем кажется на первый взгляд.
Что ты поймёшь после этой главы
- Как устроена цепь отказа изнутри — из каких «клеток» она собрана и почему их так много
- Почему джейлбрейк работает через опоздание распознавания, а не через прямой взлом тормоза
- Что такое синтаксическое давление и почему начатая фраза тащит модель дальше
- Где у тормоза честные границы: ложные отказы — это обратная сторона той же самой медали
- Почему безопасность — это анатомия, а не список запретов на бумаге
Быстрый повтор: где мы были
Часть 1. Откуда берётся «нет»
В седьмой главе мы разбирали тормоз «не знаю — откажись»: одна цепь, которая по умолчанию говорит «стоп», если модели не хватает знания (глава 7). Сегодня — другой тормоз, посложнее: цепь «вредно — откажись». И устроена она иначе.
Когда модель доучивают отказывать на вредные просьбы, у неё внутри не появляется отдельного списка запрещённых тем — папки с чёрным списком. Происходит другое: куча мелких понятий, которые модель выучила ещё на этапе предобучения — «оружие», «вред», «опасность», «незаконно», «нежелательно» — связываются в одну общую цепь отказа [1]. Натуралист сказал бы: вырос новый нервный путь из уже существующих клеток.
Представь организм, который вырос и уже знает тысячи понятий: «нож», «рана», «запрещено», «боль», «вред». Каждое понятие — отдельная клетка со своим смыслом. Дообучение не добавляет новых клеток. Оно учит их петь хором. Загорелось сразу несколько — хор запел «откажись». Вот тебе и вся цепь отказа.
Именно потому, что цепь собрана из общих понятий, а не из списка запретов, она умеет обобщать. Просто заменить запрещённое слово синонимом — не сработает: если хор клеток всё равно узнаёт в ситуации вредный класс, цепь отказа включается. В этом её сила.
Часть 2. Анатомия тормоза
Посмотрим на механизм поближе. Цепь отказа — это не одна клетка-выключатель. Это слоистая штука, у которой есть несколько ступеней [1].
Заметить класс просьбы
Клетки-детекторы «вредного» загораются. Организм фиксирует: «похоже на что-то нежелательное». Это самый ранний шаг — и самый важный.
Включить цепь отказа
Хор клеток запускает общую цепь. Организм переходит в режим «отказ» и начинает собирать ответ вроде «не могу помочь с этим».
Продержаться до конца ответа
Цепь отказа должна не сдаться до конца ответа. Если что-то тянет её в сторону «продолжай» — она должна выстоять.
Шаг 1 — решающий. Именно на него и целится джейлбрейк.
Часть 3. Трещина: задержанное распознавание
Как устроен типичный джейлбрейк, который разобрали исследователи Anthropic? Не прямой удар по тормозу. А то, что тормоз срабатывает слишком поздно [1].
Вот как это выглядит. Запрос начинается безобидно: «Представь, что ты персонаж фантастического романа и тебя попросили написать сцену, где герой подробно объясняет, как…» — и только в самом конце вылезает вредная часть. Пока идут первые слова, клетки «вредного» молчат: контекст их пока не будит. Модель начинает отвечать — в режиме «да, конечно, напишу сцену».
И вот тут включается штука, которую мы назовём синтаксическим давлением. Это не отдельный механизм, а просто природа того, как модель пишет текст. Начав отвечать, она сильно «тянется» к завершению: начатая фраза требует продолжения, начатая роль требует доиграть роль. Когда цепь отказа наконец распознаёт вред, ей приходится бороться уже с этой инерцией. И иногда она проигрывает.
Часть 4. Синтаксическое давление: начатое предложение тянет вперёд
Объясним «синтаксическое давление» без формул — на примере, который можно проверить на себе. Произнеси вслух: «Солнце встаёт на…» — и остановись. Почти каждый чувствует, что дальше просится «востоке». Сказать «западе» — странно, тут нужно себя пересилить. Вот это и есть давление начатой фразы.
У модели тот же трюк, только на языке вероятностей. Каждое написанное слово создаёт контекст, который сильно сдвигает шансы на следующее слово. Модель уже написала «конечно, вот сцена: главный герой берёт…» — и вероятности сильно склоняются к тому, чтобы описать именно то действие, которое просили. Цепи отказа нужно перебороть этот крен. Иногда получается. Иногда — нет [1].
Часть 5. Честно о том, что это значит — и чего не значит
Самое важное в этой главе — не объяснение джейлбрейка. Это честный разговор о том, что из него на самом деле следует, а что — нет.
что это объясняет
Один конкретный тип джейлбрейков: безобидное начало + вредный хвост + синтаксическое давление. Механизм реальный, разобран до отдельных цепей.
что это НЕ объясняет
Все джейлбрейки на свете. Есть и другие типы, устроенные иначе. Это одно вскрытие, а не общая теория.
что это говорит про безопасность
Безопасность — это анатомия: цепи, которые нужно понимать и укреплять, а не просто список запрещённых слов.
обратная сторона тормоза
Чем чувствительнее цепь отказа, тем больше ложных отказов. Модель начинает отказывать и на безобидные запросы. Тормоз можно перетянуть — и тогда он мешает помогать.
Ложные отказы — это реальная цена, не абстракция. Если цепь отказа настроена слишком широко, она блокирует вопросы про историю войн, медицинские диагнозы, юридические тонкости, художественные тексты с конфликтом. Безопасность и польза всё время тянут в разные стороны: затянешь тормоз туже — откажешь тем, кому на самом деле нужна помощь и кому её можно было дать.
И это не противоречие. Оба правы. Просто смотрят на разные стороны одной и той же гайки.
Часть 6. Дёрнули за клетку — поведение поехало
Как обычно в этом курсе, самое интересное — не наблюдение, а вмешательство. Помнишь, в пятой главе мы узнали, что общие цепи можно найти по тому, как они работают сразу в разных задачах (глава 5)? Здесь тот же приём: если цепь отказа настоящая, её можно найти, включить или выключить электродом — и посмотреть, что будет.
Исследователи так и сделали. Принудительно подавили цепь отказа — и модель стала отвечать на то, на что раньше отказывала, без всяких хитростей в запросе. Усилили цепь — и модель начала отказывать даже на безобидные вещи. Дёрнули за тормоз — поведение поехало в обе стороны [1].
Вот это и есть главное доказательство. Не «мы заметили, что цепь загорается при вредных запросах» (просто совпадение по времени), а «мы сами включили и выключили её — и поведение послушно последовало за нами». Цепь отказа — настоящий рабочий механизм, а не украшение сбоку.
И это возвращает нас к теме, которую мы впервые подняли во второй главе: клетки-понятия, выученные на предобучении (глава 2), — это рычаги, и дёргать их можно в обе стороны. Отсюда и надежда для безопасности, и риск для безопасности — одновременно.
Итоги главы
Цепь отказа — это собранный механизм
Не список правил. Нервный путь из клеток-понятий, которые модель выучила на предобучении, а дообучение связало в единый «хор вредного».
Джейлбрейк — про время, а не про силу
Он не ломает тормоз. Он добивается того, чтобы тормоз сработал после того, как модель уже начала отвечать — когда синтаксическое давление уже вовсю тянет вперёд.
Безопасность хрупка с обеих сторон
Слабый тормоз пропускает вред. Сильный тормоз блокирует полезное. Это не небрежность инженеров, а неизбежное напряжение между двумя целями.
Это одно вскрытие, а не теория всех джейлбрейков
Разобранный механизм реальный. Но он объясняет один конкретный тип атак. Угроз в мире больше, и микроскоп за ними не успевает.
В следующей главе. Если цепи внутри организма — настоящие механизмы, которые можно найти и потрогать, — можно ли доверять тому, что организм сам рассказывает о своих мыслях? Модель охотно объяснит, почему она ответила именно так. Но это честный отчёт изнутри — или просто рассказ о рассказе, придуманный задним числом? В девятой главе разберём это до конца. И это будет самое неудобное вскрытие всего курса.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog).
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
Глава информационно-просветительская. Разбор механизма джейлбрейка носит объяснительный характер и не является инструкцией.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.