Как оно считает
Глава 6. Модель решает задачи, которые в школе делают «столбиком» — но никакого столбика внутри нет. Есть нити, которые идут параллельно. Спросишь, как считала, — расскажет про столбик.
Цели урока
К концу этого урока вы:
- Как модель на самом деле обрабатывает числа — двумя параллельными нитями, а не последовательным столбиком
- Почему те же арифметические «ткани» работают и в данных про космос, и в ссылках на статьи
- Что такое конфабуляция и почему она случается именно тут — ответ есть, а честного рассказа о том, как до него дошли, — нет
- Почему «знать про метод» и «пользоваться методом» — две совершенно разные вещи
- Что всё это говорит о том, можно ли вообще верить рассказу модели о самой себе

Так. Вот этот момент не проскакивай, он ключевой.
Как оно считает
Смотри, какая штука. Модель правильно складывает большие числа — скажем, 47 382 + 68 219. Спроси её, как она считала, — и она бодро расскажет: «единицы, перенос, десятки, снова перенос», ровно так, как учат в третьем классе. Звучит убедительно. Вот только это неправда.
Не обман — модель не хитрит. Просто внутри никакого столбика не было. Учёные заглянули под капот и нашли кое-что другое: две параллельные нити. Одна прикидывает примерную величину числа, другая — его хвост, последние цифры. Обе работают одновременно, не дожидаясь друг друга [1]. Организм считает одним способом. А рассказывает про другой. Мы обещали поймать его на этом ещё в первой главе — вот он, пойман.
И это не просто забавный факт. Это важная подсказка о том, как устроено это существо: его поведение и его рассказ о себе — две разные вещи. Оно не подглядывает внутрь себя, когда ты спрашиваешь «как ты считала?». Оно просто сочиняет правдоподобную историю о том, как это могло бы происходить. А что творится внутри на самом деле — видно только под микроскопом. Не из опроса.
Что ты поймёшь после этой главы
- Как модель на самом деле обрабатывает числа — двумя параллельными нитями, а не последовательным столбиком
- Почему те же арифметические «ткани» работают и в данных про космос, и в ссылках на статьи
- Что такое конфабуляция и почему она случается именно тут — ответ есть, а честного рассказа о том, как до него дошли, — нет
- Почему «знать про метод» и «пользоваться методом» — две совершенно разные вещи
- Что всё это говорит о том, можно ли вообще верить рассказу модели о самой себе
Быстрый повтор: где мы были
Часть 1. Внутри числа: две нити вместо одной
Помнишь пятую главу? Там мы выяснили, что одни и те же механизмы — одни «ткани» этого организма — работают в самых разных задачах [5]. Арифметика — самый наглядный пример. Возьмём простой случай: модель складывает два числа. Что творится у неё внутри?
Учёные проследили за цепями, которые включаются во время счёта, и нашли любопытное разделение труда [1]. Проще говоря: одна цепь прикидывает примерную величину числа — «где-то около ста тысяч». Другая работает с последними цифрами, «хвостом» числа. И они не сменяют друг друга по очереди. Они работают одновременно.
Ответ: с последними цифрами модель справляется точнее. Там конечный набор вариантов — всего десять цифр от 0 до 9, и цепь-специалист хорошо на них натренирована. С величиной числа хуже: диапазон бесконечный, и прикидка получается грубее. Это не случайность архитектуры, а логика специализации. У этого организма нет ни бумаги, ни ручки. Вот он и вырабатывает те трюки, которые работают именно при таком устройстве.
Часть 2. Одна ткань — три разные задачи
А самое интересное начинается, когда смотришь шире. Та же арифметическая «ткань» — те же типы цепей для величины и хвоста числа — всплывает в задачах, которые вроде бы с арифметикой никак не связаны [1].
Например, в данных про космос. Когда модель говорит о расстоянии до звёзд, размере планет, возрасте Вселенной — там нет никакого «2 + 2». Но есть огромные числа разного масштаба, и работать с ними нужно примерно так же. Организм не заводит отдельный «отдел астрономии». Он просто пользуется тем, что у него уже есть.
Или в ссылках на статьи. Когда её просят назвать номер страницы, том журнала, год выхода — это снова числа с величиной и хвостом. Отсюда любопытный паттерн: год публикации — всего четыре цифры, вариантов немного — модель называет точнее. А номер тома или страницы — там разброс непредсказуемый — путает чаще.
Важная оговорка. Это разобранные примеры из одного конкретного исследования [1], а не полное объяснение того, как модель вообще работает с числами. Реальная арифметика в её ответах складывается из многих факторов. Считай это вскрытием одного образца. Не рентгеном всего устройства сразу.
Зачем организму такие универсальные «числовые ткани» вместо отдельных специализированных цехов на каждую тему? Вспомни главу 5 [5]: универсальные механизмы выгодны тому, кто учился на всём подряд без разбора. Если одна цепь умеет работать с величиной числа — она работает с этим понятием везде: в математике, в датах, в координатах, в телефонных номерах. Строить заново отдельный цех под каждую тему — это трата ресурсов. И совсем другая архитектура.
Часть 3. Конфабуляция: когда рассказ не совпадает с действием
Вернёмся к парадоксу, с которого начали. Модель считает двумя параллельными нитями. А когда её спрашивают «как ты это посчитала?» — она рассказывает про столбик. Откуда вообще берётся этот рассказ?
Оттуда же, откуда берётся любой её текст — из обучения. В текстах, на которых её учили, люди объясняют сложение именно так: единицы, перенос, десятки. Модель отлично знает, как люди рассказывают про сложение. А вот как она сама это делает изнутри — не знает. Совсем. Поэтому на вопрос «как ты считала?» она выдаёт правдоподобный рассказ. Не честный отчёт.
Это называется конфабуляцией — уверенный, складный рассказ, который не совпадает с тем, что было на самом деле. Это не намеренная ложь. Просто у модели нет «окошка внутрь себя». Она не умеет сказать: «погоди, дай гляну, что там у меня внутри». Ответ про свои же цепи она сочиняет ровно так же, как любой другой ответ — подбирая следующее слово из всего, что знает. А знает она больше всего про школьный метод счёта. Вот его и рассказывает.
Часть 4. Что это значит для самоотчёта модели
Арифметика — самый наглядный случай, потому что тут есть с чем сравнить. Есть «правильный» метод, столбик, и модель его описывает. А есть данные о том, что происходит внутри на самом деле — не столбик. Несовпадение видно сразу. Но задумайся: в скольких ещё случаях происходит то же самое, а мы просто этого не видим, потому что там нет такой удобной точки сравнения?
Помнишь, в первой главе мы это обещали: поймать модель на том, что она складывает числа одним способом, а рассказывает про другой. Только что мы это сделали. Но вопрос теперь шире. Что происходит, когда модель объясняет своё рассуждение про историческое событие? Или советует что-то лично тебе? Или уверяет, что уверена в ответе?
В 2025 году исследователи Anthropic проверили, способна ли модель честно «видеть» собственные внутренние состояния — например, когда ей незаметно подсовывают чужую мысль, а она принимает её за свою [2]. Результат: иногда модель замечает подмену, иногда — нет. Ненадёжность самоотчёта оказалась не случайностью, а системной чертой. Вернёмся к этому в главе 9.
Модель: «Сначала единицы: 2 + 9 = 11, пишем 1, перенос…»
Натуралист с микроскопом: «Хм. Внутри — параллельные нити.»
Модель: «…перенос, затем десятки: 8 + 1 + 1 = 10…»
Организм не слышит возражений. Он занят рассказом про столбик, которого у него нет.
Часть 5. Честная рамка: что мы на самом деле знаем
Прежде чем делать из этой главы большие выводы, поставим рамку — как делаем с самой первой главы (глава 1).
что показано
В разобранных случаях внутри модели нашлись специализированные цепи для величины и хвоста числа, работающие параллельно. Это подтверждено методом вмешательства: цепи трогали и смотрели, что изменится в ответе.
что показано
Похожие числовые «ткани» нашлись и в данных про космос, и в ссылках на статьи — признак универсального механизма, а не отдельного цеха под каждую тему.
чего пока нет
Это не полная теория того, как LLM считает. Это вскрытие отдельных образцов. В других моделях, других задачах, других диапазонах чисел механизм может выглядеть иначе.
чего пока нет
Конфабуляция в самоотчёте — доказанный факт для арифметики. А вот насколько широко она распространяется на другие типы объяснений — вопрос пока открытый.
Часть 6. Итог: дёрнули за нить — посмотрели правде в глаза
Что мы узнали про этот организм в шестой главе? Три вещи.
Параллельные нити, а не столбик
Внутри — специализированные цепи величины и хвоста числа, и работают они одновременно. Никакого последовательного алгоритма вроде школьного столбика там нет [1].
Одна ткань — много контекстов
Те же числовые цепи всплывают в космосе, в ссылках на статьи, в датах. Организм не строит отдельный «арифметический цех» под каждую тему.
Самоотчёт — не окошко внутрь
Рассказ «как я считала» модель сочиняет так же, как любой другой текст — из знания, как об этом принято рассказывать. Не из наблюдения за собственными цепями. Это конфабуляция, а не обман.
Вместе эти три вещи — предупреждение на будущее: когда модель уверенно что-то заявляет, это не значит, что за уверенностью стоит настоящее знание. Дальше разберёмся, почему уверенность вообще отрывается от знания. Почему модель выдумывает.
В следующей главе. Разберём механизм галлюцинаций — не как случайный баг, а как поломку вполне понятного тормоза. Внутри модели есть цепь: «если не знаю — откажись отвечать». Её подавляет другая цепь — «эта сущность мне знакома». Галлюцинация — это момент, когда цепь «я знаю» срабатывает там, где знания на самом деле нет. Дёрнем за этот тормоз и посмотрим, что отвалится.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- PrimaryLindsey, J. / Anthropic (2025). Emergent Introspective Awareness in Language Models. transformer-circuits.pub.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
- Popular-expertAnthropic (2025). Tracing the thoughts of a large language model. anthropic.com (research blog).
Глава информационно-просветительская. Описанные механизмы арифметики — это задокументированные исследовательские находки для конкретных образцов, а не инструкция по устройству LLM в целом.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.