Один разум на все языки
Глава 5. У модели есть клетки под каждый язык — и есть общее ядро, где смысл живёт отдельно от слов. Чем больше модель, тем это ядро крупнее
Цели урока
К концу этого урока вы:
- Как модель справляется с разными языками: есть клетки под конкретный язык и есть общее ядро смысла
- Что на самом деле значит «смысл живёт отдельно от языка» — на живом примере
- Почему ядро растёт вместе с моделью — и что это говорит про то, как она учится
- Где эта картинка с «одним ядром» верна, а где преувеличена: языки всё равно немного «просачиваются»

О, ты здесь! Отлично — у меня для тебя кое-что есть.
Один разум на все языки
Скажи слово «собака» по-русски. Потом «dog» по-английски. «Hund» по-немецки. «كلب» по-арабски. Звуки разные. Буквы разные. А за ними — одно и то же: четыре лапы, лает, виляет хвостом. Смысл один. Языков много.
Теперь вопрос про наш «организм» — модель, которую мы разглядываем весь курс. Её учили сразу на десятках языков. Значит ли это, что внутри — десять разных умов, у каждого своя анатомия? Или там один разум с общим ядром смысла, а языки — просто обёртка снаружи?
Ответ исследователей неожиданный: верно и то, и другое сразу. Внутри есть клетки под конкретный язык. И есть абстрактное ядро, где смысл живёт отдельно от языка. А сюрприз в другом — чем больше модель, тем больше в ней этого общего ядра [1].
Что ты поймёшь после этой главы
- Как модель справляется с разными языками: есть клетки под конкретный язык и есть общее ядро смысла
- Что на самом деле значит «смысл живёт отдельно от языка» — на живом примере
- Почему ядро растёт вместе с моделью — и что это говорит про то, как она учится
- Где эта картинка с «одним ядром» верна, а где преувеличена: языки всё равно немного «просачиваются»
Часть 1. Два этажа одного организма
В Главе 2 мы уже разглядывали клетки-фичи — крошечные детекторы, каждый загорается на своё понятие. Тогда мы брали примеры из одного языка. Сейчас посмотрим шире.
Исследователи взяли понятие — например, «яблоко» — и проверили, какие клетки на него реагируют в трёх языках: русском, французском, японском. Вот что нашли [1].
Первый этаж: у каждого языка — свои клетки. Одна клетка реагирует на кириллицу. Другая понимает, что перед ней японский текст. Это логично: у грамматики, порядка слов, алфавита — своя «одежда» в каждом языке.
Второй этаж — сверху. Это абстрактные клетки-понятия, они загораются вообще не глядя на язык. «Яблоко» по-русски, pomme по-французски, りんご по-японски — и все три раза зажигается одна и та же клетка-смысл. Вот оно, общее ядро.
Часть 2. Что значит «понятие живёт отдельно от языка»
Остановимся на этой фразе — звучит она красиво, но что за ней на самом деле стоит?
Вспомни Главу 4: модель держит «намеченную рифму» внутри себя ещё до того, как напишет слово. Это внутреннее представление — не слово. Скорее «сгусток смысла», который потом разворачивается в конкретный токен нужного языка.
То же самое с многоязычием. Когда модель читает слово «собака» по-русски, внутри загорается абстрактная клетка — условно «четвероногое домашнее животное». Когда читает dog по-английски — загорается та же самая клетка. Русское и английское слово — это просто два разных входа к одному внутреннему смыслу.
Именно так и происходит. Хорошая модель не переводит слово в слово, впритык подгоняя русское под китайское. Она идёт через общий слой смысла: русское слово → абстрактное понятие → китайский токен. Это устройство переводчика, который сперва понимает, а потом уже говорит. Поэтому у больших моделей перевод получается лучше — у них просто больше этого общего абстрактного слоя [1].
Часть 3. Почему ядро растёт с размером модели
Один из самых неожиданных результатов исследования: доля понятий, которые живут в языко-независимом ядре — учёные называют это universality, — растёт вместе с размером модели [1]. Маленькая модель больше «думает» на конкретном языке. Большая — больше на абстрактных понятиях, которые уже потом одеваются в нужный язык.
Почему так получается? Никто не закладывал в код правило «думай абстрактно, если ты большая модель». Это возникает само, просто из обучения. Вот как это работает на пальцах.
Представь, что тебе нужно научиться переводить между десятью языками. Самый неудобный способ — вызубрить все 90 пар «язык А → язык Б» по отдельности. Самый удобный — вынести смысл в одно общее место и научиться переводить «любой язык → смысл» и «смысл → любой язык». Чем больше модель и чем больше в неё влито данных, тем выгоднее второй способ — и модель как будто сама его находит.
Языки тут не исключение. Та же логика работает и внутри одного языка. Маленькая модель хранит кучу фактов по отдельности: «Наполеон родился в 1769», «Наполеон был французским полководцем». Большая модель сворачивает всё это в один абстрактный «Наполеон» с набором свойств — и потом достаёт из него любой нужный факт. В Главе 4 мы уже видели: это не справочник с карточками, это геометрия — внутренняя карта мира.
Часть 4. Честная калибровка: ядро не идеально
Красивая картинка «много ручьёв стекаются в одно ядро» нуждается в оговорке. Ядро действительно есть, но оно не идеально чистое [1].
что подтверждено
Общие абстрактные клетки-понятия правда существуют и правда загораются вне зависимости от языка. Это не метафора — это измеримые сигналы в модели.
что подтверждено
Чем крупнее модель, тем больше в ней доля языко-независимых представлений — и это подтверждается на разных архитектурах, не на одной случайной.
честная оговорка
Языки всё равно немного «просачиваются»: для редких языков, где мало обучающего текста, абстрактное ядро слабее — и на этих языках модель чаще опирается на языко-специфичные подпорки.
честная оговорка
Некоторые понятия вообще завязаны на культуру: русская «тоска» не переводится точно ни на один другой язык. Здесь абстрактное ядро тоньше и расплывчатее.
Часть 5. Мост: смысл как геометрия
Если ты проходил курс «Язык и смыслы» из серии «нейро-сознание» — ты уже встречал эту идею: смысл можно представить как точку в многомерном пространстве. Языки — просто разные дороги к одной и той же точке.
В Главе 4 мы видели: пространство и время внутри модели тоже устроены геометрически. Следующий шаг простой: языки — тоже геометрия. Абстрактное ядро — это не список и не таблица. Это область в пространстве активаций, куда стягиваются все языки, когда говорят об одном и том же. Русское «яблоко», французское pomme, японское りんご — три разных вектора, и все три сходятся в одну точку.
Вот почему хороший перевод — это не замена слов одного языка словами другого, а движение по общему пространству смысла. Модель не хранит таблицу «русское слово → китайское слово». Она знает, где в этом пространстве стоит нужное понятие, и умеет назвать его на любом языке.
Правда, некоторые понятия она всё ещё немного путает. Но по крайней мере «тоску» она в переводе уже не называет «грустью».
Итоги главы
Два этажа: специфика + ядро
Внутри есть клетки под конкретный язык — грамматика, алфавит — и абстрактные клетки-понятия, которые загораются вне зависимости от языка.
Понятие живёт отдельно от языка
«Собака» по-русски и dog по-английски зажигают одну и ту же абстрактную клетку-смысл. Перевод идёт в два шага: сначала смысл, потом язык.
Ядро растёт с размером
Большие модели больше «думают» абстрактными понятиями, а не конкретными языками. Никто это не закладывал специально — так модели выгоднее сжимать данные при обучении.
Ядро не идеально
На редких языках и культурно-специфичных понятиях ядро даёт слабину. Это честный предел метода, а не скромная оговорка для красоты.
В следующей главе. Мы много смотрели, как модель «понимает». Но есть задача, с которой она справляется не блестяще: арифметика. Иногда она считает неправильно — и при этом абсолютно уверена в ответе. Глава 6 заглянет внутрь арифметических вычислений: как организм считает, что там ломается — и почему потом он врёт про то, как именно считал.
Источники этой главы
- PrimaryLindsey, J., Gould, E., Lindsay, J., et al. / Anthropic (2025). On the Biology of a Large Language Model. transformer-circuits.pub.
- FoundationalBricken, T., Templeton, A., Batson, J., et al. / Anthropic (2023). Towards Monosemanticity: Decomposing Language Models With Dictionary Learning. transformer-circuits.pub.
- Peer-reviewedTempleton, A., Conerly, T., Marcus, J., et al. / Anthropic (2024). Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet. transformer-circuits.pub.
Глава информационно-просветительская. Это рассказ об исследовании ИИ, а не техническая инструкция.
Как вам этот урок?
Один короткий сигнал поможет улучшить следующую версию.