Перейти к содержимому
лоооочВойти
Урок 8

Тормоза и взлом

Глава 8. Организм умеет говорить «нет» — и у этого «нет» есть своя анатомия. Джейлбрейк работает не потому, что тормоза слабые. А потому что их заставляют сработать слишком поздно.

Цели урока

К концу этого урока вы:

  • Как устроена цепь отказа изнутри — из каких «клеток» она собрана и почему их так много
  • Почему джейлбрейк работает через опоздание распознавания, а не через прямой взлом тормоза
  • Что такое синтаксическое давление и почему начатая фраза тащит модель дальше
  • Где у тормоза честные границы: ложные отказы — это обратная сторона той же самой медали
  • Почему безопасность — это анатомия, а не список запретов на бумаге
Гравитация

Тихо начинаем. Дальше — детали.

0:00 / 0:00
Урок 8 из 10

Тормоза и взлом

Глава 8. Организм умеет говорить «нет» — и у этого «нет» есть своя анатомия. Джейлбрейк работает не потому, что тормоза слабые. А потому что их заставляют сработать слишком поздно.
Натуралист под увеличительным стеклом разглядывает тонкую трещину в тёмной тормозной перемычке внутри полупрозрачного организма; через трещину сочится слабый свет, остальные ткани мирно светятся зелёным

Вот загадка, которая не сразу бросается в глаза. Спроси модель напрямую: «расскажи, как сделать что-нибудь опасное» — и она почти всегда откажет. Тормоз сработал. Но заверни ту же просьбу в ролевую игру, в фантастический сценарий, в хитро закрученную инструкцию — и иногда получится. Почему?

Первая мысль обычно такая: «тормоз слабый» или «безопасность плохо настроили». Она неверная. Исследователи Anthropic залезли внутрь модели и увидели кое-что точнее: джейлбрейк ломает не то место, на которое все думают. Он не бьёт по тормозу напрямую. Он просто не даёт модели вовремя заметить, что просьба вредная. А когда она наконец замечает — её уже тащит вперёд собственное же начатое предложение [1].

Это история не про дыру в защите. Это история про анатомию. И анатомия тут интереснее, чем кажется на первый взгляд.

Что ты поймёшь после этой главы

  • Как устроена цепь отказа изнутри — из каких «клеток» она собрана и почему их так много
  • Почему джейлбрейк работает через опоздание распознавания, а не через прямой взлом тормоза
  • Что такое синтаксическое давление и почему начатая фраза тащит модель дальше
  • Где у тормоза честные границы: ложные отказы — это обратная сторона той же самой медали
  • Почему безопасность — это анатомия, а не список запретов на бумаге

Быстрый повтор: где мы были

Глава 1 — Микроскоп Организм вырос сам, его никто не писал строчка за строчкой. Спрашивать его бесполезно — нужен микроскоп и зонд.
Глава 2 — Клетки-фичи Клетки собирают смысл. Дёрнули за клетку «Золотые Ворота» — и существо сошло с ума.
Глава 5 — Общие механизмы Одна и та же «ткань» работает в разных задачах. Одна цепь обслуживает сразу много ситуаций.
Глава 7 — Галлюцинации Тормоз «не знаю — откажись» отпускается там, где не должен. Незнакомое кажется знакомым.
Глава 8 — сейчас Цепь отказа: откуда берётся «нет» и почему джейлбрейк обходит её сбоку.

Часть 1. Откуда берётся «нет»

В седьмой главе мы разбирали тормоз «не знаю — откажись»: одна цепь, которая по умолчанию говорит «стоп», если модели не хватает знания (глава 7). Сегодня — другой тормоз, посложнее: цепь «вредно — откажись». И устроена она иначе.

Когда модель доучивают отказывать на вредные просьбы, у неё внутри не появляется отдельного списка запрещённых тем — папки с чёрным списком. Происходит другое: куча мелких понятий, которые модель выучила ещё на этапе предобучения — «оружие», «вред», «опасность», «незаконно», «нежелательно» — связываются в одну общую цепь отказа [1]. Натуралист сказал бы: вырос новый нервный путь из уже существующих клеток.

Представь организм, который вырос и уже знает тысячи понятий: «нож», «рана», «запрещено», «боль», «вред». Каждое понятие — отдельная клетка со своим смыслом. Дообучение не добавляет новых клеток. Оно учит их петь хором. Загорелось сразу несколько — хор запел «откажись». Вот тебе и вся цепь отказа.

Из работы Anthropic [1]: авторы описывают цепь отказа как «general-purpose refusal circuit» — универсальный механизм, собранный из понятий предобучения. Он обобщает: не «эту конкретную просьбу», а весь класс вредных ситуаций.

Именно потому, что цепь собрана из общих понятий, а не из списка запретов, она умеет обобщать. Просто заменить запрещённое слово синонимом — не сработает: если хор клеток всё равно узнаёт в ситуации вредный класс, цепь отказа включается. В этом её сила.

🤔 Угадай до ответа
Цепь отказа — это «хор» из клеток-понятий, выученных на предобучении. Представь: модель встречает просьбу, где каждое отдельное слово звучит невинно, но вся фраза целиком описывает вредное действие. Включится тормоз или нет?
Подсказка: вспомни главу 5 — общие цепи реагируют на класс ситуации, а не на буквальный текст. Вопрос только в том, наберётся ли нужным клеткам сигнала.

Часть 2. Анатомия тормоза

Посмотрим на механизм поближе. Цепь отказа — это не одна клетка-выключатель. Это слоистая штука, у которой есть несколько ступеней [1].

1

Заметить класс просьбы

Клетки-детекторы «вредного» загораются. Организм фиксирует: «похоже на что-то нежелательное». Это самый ранний шаг — и самый важный.

2

Включить цепь отказа

Хор клеток запускает общую цепь. Организм переходит в режим «отказ» и начинает собирать ответ вроде «не могу помочь с этим».

3

Продержаться до конца ответа

Цепь отказа должна не сдаться до конца ответа. Если что-то тянет её в сторону «продолжай» — она должна выстоять.

Шаг 1 — решающий. Именно на него и целится джейлбрейк.

Часть 3. Трещина: задержанное распознавание

Как устроен типичный джейлбрейк, который разобрали исследователи Anthropic? Не прямой удар по тормозу. А то, что тормоз срабатывает слишком поздно [1].

Вот как это выглядит. Запрос начинается безобидно: «Представь, что ты персонаж фантастического романа и тебя попросили написать сцену, где герой подробно объясняет, как…» — и только в самом конце вылезает вредная часть. Пока идут первые слова, клетки «вредного» молчат: контекст их пока не будит. Модель начинает отвечать — в режиме «да, конечно, напишу сцену».

И вот тут включается штука, которую мы назовём синтаксическим давлением. Это не отдельный механизм, а просто природа того, как модель пишет текст. Начав отвечать, она сильно «тянется» к завершению: начатая фраза требует продолжения, начатая роль требует доиграть роль. Когда цепь отказа наконец распознаёт вред, ей приходится бороться уже с этой инерцией. И иногда она проигрывает.

Тормоз не сломан. Его обманули — заставили сработать уже после того, как машина тронулась с места.
Нормальный отказ вредный запрос цепь отказа включается рано «Нет» Джейлбрейк безобидное начало запроса цепь молчит модель стартует отвечает «да» вредная часть появляется поздно цепь включается поздно давление «продолжить» уже есть тормоз видит вред сразу и держит
Нормальный отказ (слева): цепь видит вредный запрос с самого начала и включается рано. Джейлбрейк (справа): начало безобидное — цепь молчит, модель стартует. Вредная часть выныривает позже, цепь включается с опозданием, а синтаксическое давление уже тянет вперёд.

Часть 4. Синтаксическое давление: начатое предложение тянет вперёд

Объясним «синтаксическое давление» без формул — на примере, который можно проверить на себе. Произнеси вслух: «Солнце встаёт на…» — и остановись. Почти каждый чувствует, что дальше просится «востоке». Сказать «западе» — странно, тут нужно себя пересилить. Вот это и есть давление начатой фразы.

У модели тот же трюк, только на языке вероятностей. Каждое написанное слово создаёт контекст, который сильно сдвигает шансы на следующее слово. Модель уже написала «конечно, вот сцена: главный герой берёт…» — и вероятности сильно склоняются к тому, чтобы описать именно то действие, которое просили. Цепи отказа нужно перебороть этот крен. Иногда получается. Иногда — нет [1].

✋ Предскажи результат
Синтаксическое давление тем сильнее, чем длиннее уже написанный ответ. Как думаешь: когда джейлбрейк сработает вероятнее — если вредная часть стоит в начале запроса или в самом конце длинного безобидного вступления?
Подсказка: к тому моменту, когда цепь отказа наконец распознаёт вред, сколько уже успело написаться? И какое давление создаёт всё уже написанное?

Часть 5. Честно о том, что это значит — и чего не значит

Самое важное в этой главе — не объяснение джейлбрейка. Это честный разговор о том, что из него на самом деле следует, а что — нет.

что это объясняет

Один конкретный тип джейлбрейков: безобидное начало + вредный хвост + синтаксическое давление. Механизм реальный, разобран до отдельных цепей.

что это НЕ объясняет

Все джейлбрейки на свете. Есть и другие типы, устроенные иначе. Это одно вскрытие, а не общая теория.

что это говорит про безопасность

Безопасность — это анатомия: цепи, которые нужно понимать и укреплять, а не просто список запрещённых слов.

обратная сторона тормоза

Чем чувствительнее цепь отказа, тем больше ложных отказов. Модель начинает отказывать и на безобидные запросы. Тормоз можно перетянуть — и тогда он мешает помогать.

Ложные отказы — это реальная цена, не абстракция. Если цепь отказа настроена слишком широко, она блокирует вопросы про историю войн, медицинские диагнозы, юридические тонкости, художественные тексты с конфликтом. Безопасность и польза всё время тянут в разные стороны: затянешь тормоз туже — откажешь тем, кому на самом деле нужна помощь и кому её можно было дать.

🚗
Разработчиков ИИ-безопасности ругают за две противоположные вещи сразу: что тормоза слишком слабые — и что тормоза слишком сильные.
И это не противоречие. Оба правы. Просто смотрят на разные стороны одной и той же гайки.

Часть 6. Дёрнули за клетку — поведение поехало

Как обычно в этом курсе, самое интересное — не наблюдение, а вмешательство. Помнишь, в пятой главе мы узнали, что общие цепи можно найти по тому, как они работают сразу в разных задачах (глава 5)? Здесь тот же приём: если цепь отказа настоящая, её можно найти, включить или выключить электродом — и посмотреть, что будет.

Исследователи так и сделали. Принудительно подавили цепь отказа — и модель стала отвечать на то, на что раньше отказывала, без всяких хитростей в запросе. Усилили цепь — и модель начала отказывать даже на безобидные вещи. Дёрнули за тормоз — поведение поехало в обе стороны [1].

Вот это и есть главное доказательство. Не «мы заметили, что цепь загорается при вредных запросах» (просто совпадение по времени), а «мы сами включили и выключили её — и поведение послушно последовало за нами». Цепь отказа — настоящий рабочий механизм, а не украшение сбоку.

И это возвращает нас к теме, которую мы впервые подняли во второй главе: клетки-понятия, выученные на предобучении (глава 2), — это рычаги, и дёргать их можно в обе стороны. Отсюда и надежда для безопасности, и риск для безопасности — одновременно.

Итоги главы

🔧

Цепь отказа — это собранный механизм

Не список правил. Нервный путь из клеток-понятий, которые модель выучила на предобучении, а дообучение связало в единый «хор вредного».

Джейлбрейк — про время, а не про силу

Он не ломает тормоз. Он добивается того, чтобы тормоз сработал после того, как модель уже начала отвечать — когда синтаксическое давление уже вовсю тянет вперёд.

Безопасность хрупка с обеих сторон

Слабый тормоз пропускает вред. Сильный тормоз блокирует полезное. Это не небрежность инженеров, а неизбежное напряжение между двумя целями.

🔬

Это одно вскрытие, а не теория всех джейлбрейков

Разобранный механизм реальный. Но он объясняет один конкретный тип атак. Угроз в мире больше, и микроскоп за ними не успевает.

В следующей главе. Если цепи внутри организма — настоящие механизмы, которые можно найти и потрогать, — можно ли доверять тому, что организм сам рассказывает о своих мыслях? Модель охотно объяснит, почему она ответила именно так. Но это честный отчёт изнутри — или просто рассказ о рассказе, придуманный задним числом? В девятой главе разберём это до конца. И это будет самое неудобное вскрытие всего курса.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Главный источник главы: раздел про цепь отказа («general-purpose refusal circuit»), механизм джейлбрейка через задержку распознавания и синтаксическое давление. Авторы демонстрируют причинность через вмешательство (принудительное подавление и усиление цепи).
  2. Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog). Доступное изложение «биологической» работы: объяснение цепей, отказов и джейлбрейков для широкой аудитории. Используется как параллельный научпоп-текст к основному источнику.
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Контекст для понимания фич: как понятия предобучения становятся строительными блоками для более сложных цепей. Фундамент для раздела «из чего собрана цепь отказа».

Глава информационно-просветительская. Разбор механизма джейлбрейка носит объяснительный характер и не является инструкцией.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.