Перейти к содержимому
лоооочВойти
Урок 6

Как оно считает

Глава 6. Модель решает задачи, которые в школе делают «столбиком» — но никакого столбика внутри нет. Есть нити, которые идут параллельно. Спросишь, как считала, — расскажет про столбик.

Цели урока

К концу этого урока вы:

  • Как модель на самом деле обрабатывает числа — двумя параллельными нитями, а не последовательным столбиком
  • Почему те же арифметические «ткани» работают и в данных про космос, и в ссылках на статьи
  • Что такое конфабуляция и почему она случается именно тут — ответ есть, а честного рассказа о том, как до него дошли, — нет
  • Почему «знать про метод» и «пользоваться методом» — две совершенно разные вещи
  • Что всё это говорит о том, можно ли вообще верить рассказу модели о самой себе
Гравитация

Так. Вот этот момент не проскакивай, он ключевой.

0:00 / 0:00
Урок 6 из 10

Как оно считает

Глава 6. Модель решает задачи, которые в школе делают «столбиком» — но никакого столбика внутри нет. Есть нити, которые идут параллельно. Спросишь, как считала, — расскажет про столбик.
Натуралист разглядывает в микроскоп светящиеся параллельные нити-счёты, которые тянутся внутри полупрозрачного организма; нити разного цвета, часть ярче, часть тоньше, как живые

Смотри, какая штука. Модель правильно складывает большие числа — скажем, 47 382 + 68 219. Спроси её, как она считала, — и она бодро расскажет: «единицы, перенос, десятки, снова перенос», ровно так, как учат в третьем классе. Звучит убедительно. Вот только это неправда.

Не обман — модель не хитрит. Просто внутри никакого столбика не было. Учёные заглянули под капот и нашли кое-что другое: две параллельные нити. Одна прикидывает примерную величину числа, другая — его хвост, последние цифры. Обе работают одновременно, не дожидаясь друг друга [1]. Организм считает одним способом. А рассказывает про другой. Мы обещали поймать его на этом ещё в первой главе — вот он, пойман.

И это не просто забавный факт. Это важная подсказка о том, как устроено это существо: его поведение и его рассказ о себе — две разные вещи. Оно не подглядывает внутрь себя, когда ты спрашиваешь «как ты считала?». Оно просто сочиняет правдоподобную историю о том, как это могло бы происходить. А что творится внутри на самом деле — видно только под микроскопом. Не из опроса.

Что ты поймёшь после этой главы

  • Как модель на самом деле обрабатывает числа — двумя параллельными нитями, а не последовательным столбиком
  • Почему те же арифметические «ткани» работают и в данных про космос, и в ссылках на статьи
  • Что такое конфабуляция и почему она случается именно тут — ответ есть, а честного рассказа о том, как до него дошли, — нет
  • Почему «знать про метод» и «пользоваться методом» — две совершенно разные вещи
  • Что всё это говорит о том, можно ли вообще верить рассказу модели о самой себе

Быстрый повтор: где мы были

Глава 1 — Микроскоп Организм выращен, а не написан. Спросить нельзя — врёт. Нужен микроскоп.
Глава 2 — Клетка-фича Один нейрон думает сразу о нескольких вещах (суперпозиция). Чистая клетка — редкость.
Глава 3 — Цепи Фичи соединяются в нервные пути. Дёрнули за клетку «Техас» — поехал ответ про столицу.
Глава 4 — Планирование Перед ответом организм набрасывает план — будущие слова влияют на текущие.
Глава 5 — Общие механизмы Одни и те же «ткани» работают в языке, логике, переводе. Универсальные узлы внутри.
Глава 6 — сейчас Арифметика изнутри: параллельные нити вместо столбика. И конфабуляция как симптом.

Часть 1. Внутри числа: две нити вместо одной

Помнишь пятую главу? Там мы выяснили, что одни и те же механизмы — одни «ткани» этого организма — работают в самых разных задачах [5]. Арифметика — самый наглядный пример. Возьмём простой случай: модель складывает два числа. Что творится у неё внутри?

Учёные проследили за цепями, которые включаются во время счёта, и нашли любопытное разделение труда [1]. Проще говоря: одна цепь прикидывает примерную величину числа — «где-то около ста тысяч». Другая работает с последними цифрами, «хвостом» числа. И они не сменяют друг друга по очереди. Они работают одновременно.

🤔 Угадай до ответа
Модель считает величину числа одной цепью, а хвост — другой, и обе работают параллельно. Что, по-твоему, получится точнее: примерная величина или последние цифры результата? Почему?
Подсказка: подумай, у какой из двух задач меньше вариантов ответа и какую проще натренировать.

Ответ: с последними цифрами модель справляется точнее. Там конечный набор вариантов — всего десять цифр от 0 до 9, и цепь-специалист хорошо на них натренирована. С величиной числа хуже: диапазон бесконечный, и прикидка получается грубее. Это не случайность архитектуры, а логика специализации. У этого организма нет ни бумаги, ни ручки. Вот он и вырабатывает те трюки, которые работают именно при таком устройстве.

47 382 + 68 219 Нить порядка «около 115 000» Нить хвоста «последние цифры: 01» 115 601 ответ грубее, непрерывный диапазон точнее, конечное множество 0–9 ПАРАЛЛЕЛЬНО
Упрощённая схема. Две нити работают одновременно: одна прикидывает величину, другая уточняет хвост числа. Никакого «столбика» внутри нет [1].

Часть 2. Одна ткань — три разные задачи

А самое интересное начинается, когда смотришь шире. Та же арифметическая «ткань» — те же типы цепей для величины и хвоста числа — всплывает в задачах, которые вроде бы с арифметикой никак не связаны [1].

Например, в данных про космос. Когда модель говорит о расстоянии до звёзд, размере планет, возрасте Вселенной — там нет никакого «2 + 2». Но есть огромные числа разного масштаба, и работать с ними нужно примерно так же. Организм не заводит отдельный «отдел астрономии». Он просто пользуется тем, что у него уже есть.

Или в ссылках на статьи. Когда её просят назвать номер страницы, том журнала, год выхода — это снова числа с величиной и хвостом. Отсюда любопытный паттерн: год публикации — всего четыре цифры, вариантов немного — модель называет точнее. А номер тома или страницы — там разброс непредсказуемый — путает чаще.

Важная оговорка. Это разобранные примеры из одного конкретного исследования [1], а не полное объяснение того, как модель вообще работает с числами. Реальная арифметика в её ответах складывается из многих факторов. Считай это вскрытием одного образца. Не рентгеном всего устройства сразу.

Зачем организму такие универсальные «числовые ткани» вместо отдельных специализированных цехов на каждую тему? Вспомни главу 5 [5]: универсальные механизмы выгодны тому, кто учился на всём подряд без разбора. Если одна цепь умеет работать с величиной числа — она работает с этим понятием везде: в математике, в датах, в координатах, в телефонных номерах. Строить заново отдельный цех под каждую тему — это трата ресурсов. И совсем другая архитектура.

Часть 3. Конфабуляция: когда рассказ не совпадает с действием

Вернёмся к парадоксу, с которого начали. Модель считает двумя параллельными нитями. А когда её спрашивают «как ты это посчитала?» — она рассказывает про столбик. Откуда вообще берётся этот рассказ?

Оттуда же, откуда берётся любой её текст — из обучения. В текстах, на которых её учили, люди объясняют сложение именно так: единицы, перенос, десятки. Модель отлично знает, как люди рассказывают про сложение. А вот как она сама это делает изнутри — не знает. Совсем. Поэтому на вопрос «как ты считала?» она выдаёт правдоподобный рассказ. Не честный отчёт.

Это называется конфабуляцией — уверенный, складный рассказ, который не совпадает с тем, что было на самом деле. Это не намеренная ложь. Просто у модели нет «окошка внутрь себя». Она не умеет сказать: «погоди, дай гляну, что там у меня внутри». Ответ про свои же цепи она сочиняет ровно так же, как любой другой ответ — подбирая следующее слово из всего, что знает. А знает она больше всего про школьный метод счёта. Вот его и рассказывает.

Знать про метод и пользоваться методом — два разных навыка. И у этого существа они живут в разных местах.
✋ Объясни своими словами
Почему «знать про метод» не значит «пользоваться методом»? Придумай пример из своей жизни — где ты сам знаешь, как что-то устроено в теории, но на практике делаешь совсем иначе.
Подсказка: это не только у ИИ. У людей тоже есть разрыв между тем, что «знаю, как надо», и тем, что «делаю на автомате». Где ты его замечал?

Часть 4. Что это значит для самоотчёта модели

Арифметика — самый наглядный случай, потому что тут есть с чем сравнить. Есть «правильный» метод, столбик, и модель его описывает. А есть данные о том, что происходит внутри на самом деле — не столбик. Несовпадение видно сразу. Но задумайся: в скольких ещё случаях происходит то же самое, а мы просто этого не видим, потому что там нет такой удобной точки сравнения?

Помнишь, в первой главе мы это обещали: поймать модель на том, что она складывает числа одним способом, а рассказывает про другой. Только что мы это сделали. Но вопрос теперь шире. Что происходит, когда модель объясняет своё рассуждение про историческое событие? Или советует что-то лично тебе? Или уверяет, что уверена в ответе?

В 2025 году исследователи Anthropic проверили, способна ли модель честно «видеть» собственные внутренние состояния — например, когда ей незаметно подсовывают чужую мысль, а она принимает её за свою [2]. Результат: иногда модель замечает подмену, иногда — нет. Ненадёжность самоотчёта оказалась не случайностью, а системной чертой. Вернёмся к этому в главе 9.

Дальше в курсе — глава 9 целиком про это: насколько модель вообще способна честно заглянуть в себя? Разберёмся, где её самоотчёт ближе к правде, а где — просто красивый пересказ чужого учебника.
🧮
Модель спрашивают: «Как ты посчитала 47 382 + 68 219?»
Модель: «Сначала единицы: 2 + 9 = 11, пишем 1, перенос…»
Натуралист с микроскопом: «Хм. Внутри — параллельные нити.»
Модель: «…перенос, затем десятки: 8 + 1 + 1 = 10…»
Организм не слышит возражений. Он занят рассказом про столбик, которого у него нет.

Часть 5. Честная рамка: что мы на самом деле знаем

Прежде чем делать из этой главы большие выводы, поставим рамку — как делаем с самой первой главы (глава 1).

что показано

В разобранных случаях внутри модели нашлись специализированные цепи для величины и хвоста числа, работающие параллельно. Это подтверждено методом вмешательства: цепи трогали и смотрели, что изменится в ответе.

что показано

Похожие числовые «ткани» нашлись и в данных про космос, и в ссылках на статьи — признак универсального механизма, а не отдельного цеха под каждую тему.

чего пока нет

Это не полная теория того, как LLM считает. Это вскрытие отдельных образцов. В других моделях, других задачах, других диапазонах чисел механизм может выглядеть иначе.

чего пока нет

Конфабуляция в самоотчёте — доказанный факт для арифметики. А вот насколько широко она распространяется на другие типы объяснений — вопрос пока открытый.

Часть 6. Итог: дёрнули за нить — посмотрели правде в глаза

Что мы узнали про этот организм в шестой главе? Три вещи.

1

Параллельные нити, а не столбик

Внутри — специализированные цепи величины и хвоста числа, и работают они одновременно. Никакого последовательного алгоритма вроде школьного столбика там нет [1].

2

Одна ткань — много контекстов

Те же числовые цепи всплывают в космосе, в ссылках на статьи, в датах. Организм не строит отдельный «арифметический цех» под каждую тему.

3

Самоотчёт — не окошко внутрь

Рассказ «как я считала» модель сочиняет так же, как любой другой текст — из знания, как об этом принято рассказывать. Не из наблюдения за собственными цепями. Это конфабуляция, а не обман.

Вместе эти три вещи — предупреждение на будущее: когда модель уверенно что-то заявляет, это не значит, что за уверенностью стоит настоящее знание. Дальше разберёмся, почему уверенность вообще отрывается от знания. Почему модель выдумывает.

В следующей главе. Разберём механизм галлюцинаций — не как случайный баг, а как поломку вполне понятного тормоза. Внутри модели есть цепь: «если не знаю — откажись отвечать». Её подавляет другая цепь — «эта сущность мне знакома». Галлюцинация — это момент, когда цепь «я знаю» срабатывает там, где знания на самом деле нет. Дёрнем за этот тормоз и посмотрим, что отвалится.

Источники этой главы

  1. PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub. Основной источник всего курса. Глава 6 опирается на раздел об арифметических цепях: параллельные механизмы для «порядка» и «хвоста» числа, их обобщение на астрономические данные и академические ссылки. Авторы указывают на ограничения: это разобранные образцы, а не полная теория арифметики в модели.
  2. PrimaryLindsey, J. / Anthropic (2025). Emergent Introspective Awareness in Language Models. transformer-circuits.pub. Исследование того, насколько модель способна достоверно «видеть» собственные внутренние состояния. Упоминается в контексте ограниченности самоотчёта; подробнее — в главе 9.
  3. Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub. Методологическая база: как находить и проверять отдельные фичи внутри модели. Контекст для понимания того, как исследователи «видят» арифметические цепи.
  4. Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog). Доступное изложение для широкой аудитории: как работает метод «графов атрибуции», включая примеры с числами и самоотчётом модели.

Глава информационно-просветительская. Описанные механизмы арифметики — это задокументированные исследовательские находки для конкретных образцов, а не инструкция по устройству LLM в целом.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.