Перейти к содержимому
лоооочВойти
Урок 5

Ловушка переобучения

Глава 5. 2001 год. Приходят люди с калькуляторами — и точность 90% превращается в 21%.

Цели урока

К концу этого урока вы:

  • Что такое переобучение — без всякого жаргона, на простом примере
  • Чем «выборка для обучения» отличается от «выборки для проверки» — и почему в 1998–1999 годах их вообще не различали
  • Что именно нашёл Хейман в 2001-м: цифры, как он их получил, и что из этого следует
  • Почему высокая «общая точность» может прятать за собой бесполезную модель
  • Как переобучение связано с главной темой курса: описание держится, а предсказание — рушится
Гравитация

О, ты здесь! Отлично — у меня для тебя кое-что есть.

0:00 / 0:00
Урок 5 из 10

Ловушка переобучения

Глава 5. 2001 год. Приходят люди с калькуляторами — и точность 90% превращается в 21%.
Методичный статистик начала 2000-х за столом с калькулятором и распечатками чисел, скептический взгляд

Осень 2001 года. На столе — уравнение Готтмана. Три года назад оно предсказывало развод с точностью 90%. Красивое число.

Психолог Ричард Хейман из Университета Стони-Брук с этим числом не спорит. Он делает то, что все почему-то пропустили: берёт других пар — не тех, на ком строилось уравнение, — и смотрит, сколько прогнозов сбудется теперь.

Общая точность и правда держится высокой. Но Хейман считает по-другому: из всех пар, которых уравнение назвало «обречёнными», сколько развелись на самом деле? Не 90%. Не 83%. Даже не 50%. Число — 21% [1].

Смотри, что это значит. Из каждых пяти пар, которых модель назвала обречёнными, четыре живут дальше как ни в чём не бывало. Уравнение, которое хвасталось точностью 90%, в этом смысле оказывается почти в четыре раза хуже, чем если бы просто гадать наугад — по одной лишь частоте разводов вообще.

Как такое возможно? Сейчас разберёмся. Потому что переобучение — не болезнь одной только психологии. Эту ошибку совершают везде, где строят прогнозы по данным. И заметить её изнутри почти невозможно — только со стороны.

Проверь память, прежде чем читать дальше

Три вопроса из прошлых глав — без подглядывания
Из главы 4: Готтман объявил точность 83% в 1998-м и «первые три минуты» в 1999-м. Что в этих числах было слабым местом — ещё до того, как их вообще стали проверять на новых парах?
Из главы 2: четыре всадника. Одного Готтман назвал «серной кислотой любви». Вспомни, кто это — и объясни, почему критика и защита тоже опасны, но менее разрушительны.
Из главы 1: физиологическое сцепление, 1983 год — это было описание или прогноз? Что случилось в 1985-м, когда сцепление попробовали использовать для предсказаний?
Сначала ответь по памяти. Потом сверься с текстом прошлых глав.
Глава 1 Тела двух супругов синхронно реагируют на ссору — и первый звоночек: в 1985-м оказалось, что это сцепление не предсказывает, изменится ли удовлетворённость браком.
Глава 2 Четыре всадника: критика, презрение, защита, стоунволлинг (уход в глухую защиту). Презрение — самый точный предсказатель распада пары: единственное из них несёт чувство собственного превосходства.
Глава 3 Соотношение 5:1 — не правило, а просто наблюдение о балансе хорошего и плохого в паре. В 1998-м эта модель предсказывала исход лучше, чем шесть других проверенных вместе с ней.
Глава 4 Точность 83–94% на своих же данных, «первые три минуты» Каррер и Готтман, 1999. Один вопрос тогда никто не задал: а что будет на новых парах?
Глава 5 — сейчас Хейман и Смит Слеп, 2001: проверка на новых парах. Общая точность держится. А доля верных прогнозов рушится до 21%. Что такое переобучение — и почему его так трудно заметить изнутри.

Что ты поймёшь после этой главы

  • Что такое переобучение — без всякого жаргона, на простом примере
  • Чем «выборка для обучения» отличается от «выборки для проверки» — и почему в 1998–1999 годах их вообще не различали
  • Что именно нашёл Хейман в 2001-м: цифры, как он их получил, и что из этого следует
  • Почему высокая «общая точность» может прятать за собой бесполезную модель
  • Как переобучение связано с главной темой курса: описание держится, а предсказание — рушится

Часть 1. Портной, который шьёт по одному телу

Представь портного. Настоящего профессионала — дотошного, аккуратного. К нему приходит клиент. Портной снимает мерки: плечи, грудь, талия, длина рукава, наклон лопаток. Несколько недель кроит и шьёт. Костюм садится идеально — каждый шов на своём месте. Если бы существовал рейтинг точности пошива, этот портной получил бы 90 баллов из 100.

А теперь тот же костюм надевает другой человек. Случайный прохожий, примерно такого же роста и веса. И костюм не сидит: плечи перекошены, рукава длинные, спина топорщится. Откуда провал? Портной же был невероятно точен.

Вот это и называется переобучением. Модель — костюм, уравнение, прогноз, неважно — подогнана слишком плотно под те данные, которые уже видела. И теряет способность работать с новыми. Она запомнила конкретное тело вместо того, чтобы понять форму тела вообще.

Мастерская портного: один костюм идеально сидит на манекене, тот же костюм мешком висит на другом манекене
Идеально по мерке одного — мешком на другом. Это и есть переобучение.

У Готтмана было так же. Уравнение 1998 года сшито точно по 130 парам, которые прошли через его лабораторию. Этих людей оно описывало идеально. Но когда Ричард Хейман и Эми Смит Слеп надели его на других людей — костюм повис мешком [1].

Часть 2. Что сделал Хейман — и почему это важно

В 2001 году вышла статья с сухим названием: «Опасности прогнозирования развода без кросс-валидации» [1]. Это тот самый разбор методики, которого не было ни в 1998-м, ни в 1999-м.

Хейман и Смит Слеп сделали несколько вещей. Во-первых, они разобрали, как было построено исследование Готтмана, — и нашли проблему в самой основе: выборки были маленькими и подобранными не случайно. Ключевые расчёты 1998 года строились всего на 60 парах — специально отобранных из крайних групп: либо явно счастливые, либо явно на грани развода. Это совсем не то же самое, что случайная выборка молодожёнов [1].

Во-вторых — и это главное — они сделали кросс-валидацию: взяли уравнение и проверили его на других парах, которые не участвовали в его создании. Общая точность (доля верно угаданных пар) осталась высокой. Но Хейман смотрел на другую цифру — положительную предсказательную ценность, сокращённо PPV: из всех пар, которых модель назвала «разводящимися», сколько развелись на самом деле?

Ответ: ~21% [1].

Что это значит на практике. Представь: психолог берёт уравнение Готтмана и проверяет 100 пар. Модель говорит: «Вот эти 20 разведутся». Если PPV — 21%, права она будет примерно в 4 случаях из 20. Остальные 16 пар назвали разводящимися зря. Это не прогноз. Это шум, только красиво упакованный в уравнение.

Часть 3. Почему «общая точность» обманывает

Но как так получается? Общая точность высокая, а предсказательная ценность всего 21%? На первый взгляд — парадокс. Разгадка — в том, как редко на самом деле случаются разводы.

Разводы — событие не такое частое, даже в американской статистике. Допустим, в реальности разводится 20% пар. Тогда модель, которая на все 100 пар просто говорит «никто не разведётся», уже права в 80 случаях из 100. Её общая точность — 80%. При этом она абсолютно бесполезна для предсказания разводов. Просто выглядит точной.

Готтман строил уравнение на своих 130 парах, а в его лабораторной выборке доля разводов была искусственно завышена — за счёт того самого перекоса в сторону крайних случаев. Уравнение научилось находить развод там, где видело его часто. А в обычной популяции, где разводов меньше, та же чуткость модели даёт кучу ложных тревог [1].

Угадай разницу
Хейман обнаружил, что и чувствительность модели тоже упала: с 92% на тренировочной выборке до 46% на новых парах. Что это значит? (а) модель стала находить меньше реальных разводов, чем есть на самом деле; (б) модель стала находить больше разводов, чем есть на самом деле; (в) модель вообще перестала работать. Какой вариант верный — и чем чувствительность отличается от PPV?
Подсказка: чувствительность — это из всех настоящих разводов, сколько модель нашла. PPV — из всех, кого модель назвала разводящимися, сколько развелись по-настоящему. Это два разных вопроса.
Одна и та же модель — два совсем разных результата СВОИ ДАННЫЕ (та же выборка) 130 пар Готтмана, 1998 год 90% общая точность Чувствительность: 92% (нашли 92% реальных разводов) PPV: высокий (свои же данные, не новые) Костюм идеально сидит на манекене кросс- валидация НОВЫЕ ДАННЫЕ (независимые пары) Хейман и Смит Слеп, 2001 21% положительная предсказательная ценность Чувствительность: 46% (нашли только 46% реальных разводов) PPV: ~21% (79% «разводов» — ложная тревога) Тот же костюм мешком висит на прохожем
Переобучение: было 90%, стало 21%. Это не ошибка в расчётах — это ошибка в самом дизайне исследования. Модель выучила конкретные пары, а не общий закон.

Часть 4. Три причины, по которым это произошло

Хейман и Смит Слеп нашли в работах 1998–1999 годов несколько проблем с методом. Стоит разобрать каждую — не для того, чтобы добить Готтмана, а чтобы понять, как вообще устроена наука и где в ней нужна осторожность.

Проблема 1. Маленькие и нерепрезентативные выборки

Ключевые расчёты 1998 года строились всего на 60 парах — специально отобранных из крайних групп: либо очень счастливые, либо очень несчастные. А пары со средним уровнем проблем, которых в жизни большинство, в эту выборку почти не попали. Уравнение научилось различать крайности, а не типичный случай [1].

Проблема 2. Отсутствие проверки на новых данных

По словам Хеймана, к 2001 году ни одно исследование ещё не проверяло предсказание развода на обычной, представительной выборке пар [1]. Точность мерили на тех же данных, на которых строили модель. Это как если бы портной проверял костюм, снова надевая его на того же клиента, с которого снимал мерки.

Проблема 3. Слишком много факторов, слишком мало данных

Уравнение Готтмана учитывало много факторов сразу. А когда модель сложная, а данных мало, она легко «запоминает» случайные мелочи вместо настоящей закономерности — шум вместо сигнала. На новых парах этого шума уже нет, и точность падает. Это классическое переобучение.

Показательно, что статья Хеймана вышла в том же году, что и другая критическая работа — Стэнли, Брэдбери и Маркман [2] написали, что советы из работы Готтмана 1998 года («откажитесь от активного слушания», «принятие влияния партнёра важнее компромисса») «как минимум преждевременны» и держатся на тех же слабых местах в методе. Особый вес этой критике придавало вот что: Говард Маркман, один из авторов статьи, сам был сооснователем программы PREP — программы профилактики семейных конфликтов. То есть критиковали не скептики со стороны, а свои же, изнутри профессии.

Контекст: Готтман и его соавторы опубликовали ответ на критику в том же номере журнала. Это не конец программы Готтмана — это момент, когда она честно встретилась со строгим научным стандартом.

Часть 5. Верхняя дорога держится — нижняя рушится

Тут важно быть честным — за цифрами легко потерять главное. Хейман в 2001-м не говорит, что всё, что делал Готтман, — неправда. Он говорит точнее: часть программы, которая обещала предсказания, не прошла проверку на новых данных.

Верхняя дорога из карты главы 1 — описательные находки — при этом держится. Физиологическое сцепление как признак ссоры, которая идёт плохо (глава 1) [3]. Четыре всадника как поведение, которое отличает пары в кризисе (глава 2). Соотношение хорошего и плохого, связанное с удовлетворённостью браком (глава 3). Эти результаты получали разные учёные, разными методами, в разное время — и в целом они повторяются.

Нижняя дорога — «мы можем предсказать, кто разведётся, по первым трём минутам ссоры» — теста на новых данных не выдержала. Не потому что Готтман плохой учёный. А потому что переобучение — это обычная ошибка, которую делают даже умные люди. И потому что давление публичности, журналов, книг и ожиданий аудитории подталкивало к громким заявлениям быстрее, чем методика успевала их проверить.

Описание держится. Предсказание рушится. Это не катастрофа — это то, как работает настоящая наука.
🧮
Ричард Хейман, глядя на уравнение с 90% точностью: «Красиво. А можно я проверю на другой выборке?»
Уравнение: «Зачем? Я уже проверилось. На этой».
Это и есть переобучение — самоуверенная модель, которая ни разу не выходила из родного города.

Часть 6. Что это значит для живых пар

Ты мог подумать: ладно, это всё какие-то академические споры. Какая разница, 83% там или 21%?

А дело вот в чём. Когда число «83% точности» попадает в популярные книги, тренинги и интернет-тесты — оно начинает жить своей жизнью. Пары читают статьи: «Если в первые три минуты разговора у вас жёсткий старт — вы в группе риска». Консультанты строят на этом целые программы. Выходят книги. Люди покупают онлайн-тесты, которые обещают «предсказать ваши шансы на развод».

Если реальная точность прогноза на новых парах — 21%, все эти программы, какими бы привлекательными они ни выглядели, стоят на шатком основании. Это не значит, что работать над отношениями бесполезно — к этому мы ещё вернёмся в финальных главах. Это значит только одно: конкретным цифрам-прогнозам доверять не стоит так сильно, как им доверяли.

Перенеси на другую область
Придумай свой пример переобучения — не из психологии брака. Это может быть прогноз погоды, выбор ресторана, оценка кандидата на собеседовании, предсказание исхода матча. Опиши: (1) на каких данных «обучалась» твоя модель или человек; (2) что случилось, когда её применили к новым случаям; (3) почему высокая точность на знакомых данных не спасла на незнакомых.
Подсказка: ищи ситуации, где кто-то — человек или система — научился чему-то очень хорошо на ограниченном опыте, а потом растерялся в новой ситуации, непохожей на привычную.

Итоги главы 5

1

Переобучение: красивое число, ненадёжный прогноз

Точность 90% на своих данных превратилась в 21% верных прогнозов на новых. Это не ошибка вычислений — это ошибка дизайна: модель обучалась и проверялась на одних и тех же данных.

2

Три причины, которые привели к этому

Маленькие, специально отобранные выборки (всего 60 пар из крайних групп); отсутствие проверки на новых данных (к 2001 году — ни одной на обычной популяции); слишком сложная модель при слишком малых данных.

3

Критика изнутри профессии

Стэнли, Брэдбери и Маркман, 2000 год: рекомендации Готтмана «как минимум преждевременны». Маркман, соавтор программы PREP, критикует не потому что конкурент — а потому что стандарты важны для всех.

4

Верхняя дорога остаётся

Описательные находки — сцепление из главы 1, всадники из главы 2, соотношение 5:1 из главы 3 — держатся. А вот предсказательная часть — нет. Это и есть главная тема всего курса.

В следующей главе. 2007 год. Ким, Капальди и Кросби берут 85 независимых пар — не новобрачных из Сиэтла, а пары из группы риска, из совсем другого города и другой лаборатории. Они проверяют не одно уравнение, а сразу 22 эмоциональных процесса из программы Готтмана. Подтверждаются только два из двадцати двух. Что это значит для всей программы — и почему провал повторной проверки это не приговор, а начало разговора — в главе 6.

Источники этой главы

  1. Peer-reviewedHeyman, R. E., & Smith Slep, A. M. (2001). The hazards of predicting divorce without crossvalidation. Journal of Marriage and Family, 63(2), 473–479. Кросс-валидация уравнения Готтмана: 90% общая точность → ~21% PPV; sensitivity 92%→46% на независимой выборке. Малые oversampled extreme-groups (n=60 для анализов 1998). На 2001 г. ни одна работа не кросс-валидировала предсказание развода на общей популяции. Канонический методологический разбор. DOI: 10.1111/j.1741-3737.2001.00473.x · PMC: 1622921 · PMID: 17066126
  2. Peer-reviewedStanley, S. M., Bradbury, T. N., & Markman, H. J. (2000). Structural flaws in the bridge from basic research on marriage to interventions for couples. Journal of Marriage and Family, 62(1), 256–264. Критика рекомендаций Gottman 1998 «как минимум преждевременны»: нерандомный отбор, проблемы процедуры, каузальные выводы из корреляций. Маркман — со-основатель PREP — критика изнутри истеблишмента. DOI: 10.1111/j.1741-3737.2000.00256.x
  3. Peer-reviewedGottman, J. M., & Levenson, R. W. (1983). Marital interaction: Physiological linkage and affective exchange. Journal of Personality and Social Psychology, 45(3), 587–597. Основополагающая работа Love Lab: описательные находки о физиологическом сцеплении, которые держатся и после критики предсказательной части программы. Callback к главе 1. DOI: 10.1037/0022-3514.45.3.587 · PMID: 6620126
  4. Peer-reviewedGottman, J. M., Coan, J., Carrère, S., & Swanson, C. (1998). Predicting marital happiness and stability from newlywed interactions. Journal of Marriage and the Family, 60(1), 5–22. Исходная статья, которую кросс-валидирует Хейман: 130 пар, 83% точность, семь конкурирующих моделей. Необходима для понимания того, что именно было проверено в 2001 году. DOI: 10.2307/353438

Глава информационно-просветительская. Методологические ограничения исследований приводятся по рецензируемым источникам, а не по авторской оценке. Это не индивидуальная психологическая консультация и не замена семейной терапии.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.