Перейти к содержимому
лоооочВойти
Урок 6

Репликация, которая не вышла

Глава 6. Орегон, 2007. Независимая команда берёт формулы Готтмана и проверяет их на своих парах. Совпадают 2 признака из 22.

Цели урока

К концу этого урока вы:

  • Чем разбор задним числом (пост-хок анализ) отличается от честной проверки на новых людях (проспективная репликация) — и почему это важнее, чем кажется
  • Что именно нашла Ким с коллегами в 2007-м: какие из 22 сигналов Готтмана подтвердились, а какие нет
  • Как правильно понимать неудачную проверку — это не «учёные наврали», а нормальная работа науки
  • Почему важно, что выборка Ким — молодые пары из группы риска, а не любые пары подряд
Гравитация

Так. Вот этот момент не проскакивай, он ключевой.

0:00 / 0:00
Урок 6 из 10

Репликация, которая не вышла

Глава 6. Орегон, 2007. Независимая команда берёт формулы Готтмана и проверяет их на своих парах. Совпадают 2 признака из 22.
независимая исследовательская команда середины 2000-х в скромном офисе community-исследования встречает обычных молодых пар

Юджин, штат Орегон. Середина 2000-х. Хюн Ким стоит у доски. Перед ней список из двадцати двух пунктов. Каждый пункт — это сигнал, который Готтман и его коллеги считали верным признаком того, что пара развалится: муж не слушает жену, жена начинает разговор слишком резко, пара не умеет остывать после ссоры. Двадцать два сигнала. Ким выписала их из статей Готтмана. И теперь хочет проверить каждый — но не на тех парах, которых изучал сам Готтман, а на своих. На восьмидесяти пяти парах из Орегона. Молодых, из семей с непростой историей. Команда Ким наблюдает за ними уже несколько лет.

План простой: взять утверждения Готтмана, проверить их на других людях и посмотреть, что уцелеет. В науке это называется репликацией. Обычно это рутинная работа — скучная и обязательная, как контрольный замер на рыночных весах.

Результат, который Ким опубликует в 2007 году, рутинным не будет.

Что ты уже знаешь — проверь себя

🔁 Вспомни без подглядывания — 3 вопроса
Из главы 5: что случилось с формулой Готтмана, когда её проверили на других людях? Назови примерные цифры точности до и после этой проверки.
Из главы 3: что такое соотношение 5:1 и у каких пар его увидели в лаборатории?
Из главы 1: чем описание (что отличает несчастливые пары от счастливых) отличается от предсказания (точного прогноза на будущее)?
Не подглядывай. Ответь вслух или письменно — хотя бы одним предложением на каждый вопрос.
Глава 1 Левенсон и Готтман, 1983: ссора связывает нервные системы пары. Но описать — не значит предсказать: первая трещина видна уже в 1985-м.
Глава 3 Пять хороших моментов на один плохой — так было у стабильных пар в лаборатории. Не рецепт на каждый день.
Глава 4 «Первые три минуты» Каррер и Готтмана, 1999: исход ссоры будто виден с первых секунд. Но это разбор задним числом на своих же данных.
Глава 5 Хейман и Смит-Слеп, 2001: формула с точностью 90% на своих данных даёт всего ~21% на обычных людях. Она просто заучила свою выборку.
Глава 6 — сейчас Ким, Капальди и Кросби, 2007: новая выборка, 22 сигнала Готтмана. Что из них подтвердится?

Что ты поймёшь после этой главы

  • Чем разбор задним числом (пост-хок анализ) отличается от честной проверки на новых людях (проспективная репликация) — и почему это важнее, чем кажется
  • Что именно нашла Ким с коллегами в 2007-м: какие из 22 сигналов Готтмана подтвердились, а какие нет
  • Как правильно понимать неудачную проверку — это не «учёные наврали», а нормальная работа науки
  • Почему важно, что выборка Ким — молодые пары из группы риска, а не любые пары подряд

Часть 1. Два разных экзамена

Представь ситуацию. Ты готовишься к экзамену по математике. Задачи придумал сам преподаватель. Он же их объяснял на лекциях. Он же составил контрольную. И теперь смотрит, как его студенты решают его же задачи. Студенты знают его стиль, привыкли к его подходу, натренировались на похожих примерах. Результат будет хорошим. Но это ничего не говорит о том, поймут ли студенты математику вообще — за пределами этого одного преподавателя.

А теперь другой вариант. Те же задачи, тот же учебник. Но экзамен принимает другой преподаватель, в другом городе, у студентов, которые этот учебник вообще не открывали. Они решают задачи с нуля, без привычных подсказок в формулировках.

Вот в этой разнице — суть сегодняшней главы. Первый вариант называется пост-хок анализом: формулу строят и проверяют на одних и тех же данных. Второй — проспективной репликацией: формулу проверяют на новых людях, которых она никогда не видела.

📝

Пост-хок

Строишь формулу и проверяешь её на тех же парах. Получить высокую «точность» легко — формула просто заучила именно эти данные наизусть. Так было в главах 4 и 5 с формулами Готтмана [1, 2].

🔬

Независимая репликация

Другая команда, другие люди, та же идея. Если она подтвердилась — значит, за ней стоит что-то реальное. Если нет — нужно понять почему. Именно это и делает Ким в 2007-м [3].

Разница здесь как у портного. Один снял мерки с конкретного человека и сшил ему идеальный костюм. Другой утверждает, что этот же костюм подойдёт любому. Пока не примерил на чужого — не узнаешь. Про этот же разрыв — между описанием и предсказанием — мы говорили ещё в главе 1. Сегодня увидим его в конкретных цифрах.

Часть 2. Орегонская проверка

Хюн Ким и её коллеги из Орегонского исследовательского института работали с совсем другими людьми, чем Готтман. Готтман изучал в основном добровольцев, которые сами откликнулись на объявление в Сиэтле. У Ким выборка другая — пары из группы риска: молодые люди из семей с непростой историей, участники давнего многолетнего исследования. Восемьдесят пять пар. Наблюдение вели заранее — а исход смотрели через несколько лет.

«Группа риска» здесь не ярлык, а научный термин. Так называют выборку, у которой статистически выше шанс неблагополучного исхода. Такие выборки часто берут для многолетних исследований — так проще увидеть перемены, ведь часть плохих событий действительно случается.

Важный нюанс Раз выборка Ким — молодые пары из группы риска, вопрос «а подойдёт ли это всем остальным парам» встаёт так же остро, как он вставал и для выборки самого Готтмана. Сами авторы это признают открыто. Неудачная проверка ставит вопрос о границах применимости идеи — а не выносит приговор всей теории.

Ким взяла двадцать два сигнала, которые Готтман и коллеги считали признаками будущего распада пары: муж отказывается слушать жену, пара не умеет остывать после ссоры, жена начинает конфликт слишком резко, партнёры взаимно раскручивают негатив по кругу — и ещё много других. И проверила каждый из этих двадцати двух сигналов заранее, до того как узнала исход [3].

Потом она посмотрела на результаты. И увидела то, что увидела.

22 сигнала Готтмана: проверка в Орегоне подтвердился (2) не подтвердился (20) 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 Каждый кружок — один сигнал. Зелёных — два. Именно столько подтвердилось в выборке Ким и коллег (2007)
Ким, Капальди и Кросби (2007): из 22 сигналов теории Готтмана лишь 2 значимо предсказали исход в новой выборке пар из группы риска [3].

Часть 3. Что не подтвердилось — и что это значит

Три сигнала, на которые Готтман делал главную ставку в своей модели предсказания, у Ким себя не показали [3]. Отказ мужчины слушать жену — не подтвердился. Неумение остывать после ссоры — не подтвердилось. Резкое начало конфликта со стороны женщины — не подтвердилось. Из двадцати двух пунктов лишь два дотянули до статистической значимости — то есть их связь с исходом вряд ли была случайностью.

Эта цифра просит объяснения. Не паники — именно объяснения.

Что значит эта цифра. То, что проверка не подтвердилась, не доказывает, что Готтман «выдумал» свою теорию. Он работал в настоящей лаборатории с настоящими парами и получал настоящие данные. Вопрос в другом: работают ли его находки для пар с другим уровнем риска, в другом месте, в другое время? Именно это ставит под вопрос Ким — не то, что видел Готтман, а то, насколько это применимо ко всем остальным.

Здесь работает та же логика, что и в главе 5 про заучивание своей выборки. Формула, которая выучила одну группу людей — сиэтлских добровольцев середины 1980-х, — не обязана работать на орегонских молодых парах из группы риска двадцать лет спустя. Это не вина Готтмана лично. Это ограничение любой теории, которая выросла из одной конкретной выборки и ещё не прошла достаточной проверки на стороне.

И ещё момент. Сама Ким формулирует свой результат именно как вопрос о применимости, а не как опровержение Готтмана. Это честная научная позиция. В науке неудачная проверка — не приговор, а сигнал: ищи, где именно проходит граница, за которой идея перестаёт работать.

🤔 Угадай, прежде чем читать ответ
Если бы у Ким подтвердились все 22 сигнала Готтмана — значило бы это, что формула предсказания развода с точностью 83% теперь надёжна? Подумай и сформулируй свой ответ.
Вспомни главу 5: даже 90% точности на своей выборке падали до ~21% при проверке на чужих данных. Подтверждение паттерна и точность предсказания — разные вещи.

Часть 4. Пост-хок против честной проверки — подробнее

Вернёмся к этой разнице подробнее — она важнее, чем кажется, и встречается далеко не только в науке о браке.

Когда Готтман и Каррер в 1999-м заявили, что по первым трём минутам ссоры видно, разведётся пара через шесть лет или нет, — это был пост-хок анализ на своих же данных [1]. Исследователи уже знали, кто из 124 пар развёлся, а кто нет. Они взяли эти сведения задним числом, нашли в первых трёх минутах паттерн, который лучше всего разделяет «развелись» и «не развелись» — и назвали это предсказанием. Но слово «предсказание» здесь не совсем точное. Они описали прошлое, которое уже знали. А не угадали будущее, которого не знали.

Проспективная проверка устроена иначе. Ким с коллегами смотрели на поведение пар до того, как узнали, что с ними станет. Заранее записали гипотезу — «вот двадцать два сигнала, которые должны предсказывать распад» — и просто дождались, пока жизнь покажет исход по каждой паре. Вот это уже настоящее предсказание.

🎯
Пост-хок анализ — это выстрелить в стену, а потом нарисовать мишень вокруг дырки и объявить себя снайпером.
Проспективная репликация — это повесить мишень до выстрела.
Наука любит второй вариант. Пресса — первый.

Важно понимать: сам Готтман прекрасно знал эту разницу. Его работа 1992 года с Левенсоном была проспективной с самого начала — 73 пары, два замера с разницей в несколько лет [4]. Но чем известнее становилась программа и чем сильнее давили сроки публикаций, тем чаще стали появляться пост-хок анализы. Жить под таким давлением непросто. И история науки знает немало случаев, когда строгость метода постепенно уступала соблазну красивой цифры.

Часть 5. Как понимать неудачную проверку

Результат Ким можно понять двумя способами. Один — журналистский: «учёные доказали, что Готтман ошибался». Другой — научный: «проверка показала границы применимости теории, нужны новые исследования на разных выборках».

Второй способ правильный. Вот почему.

1

Выборка имеет значение

Молодые пары из группы риска — это не «все пары на свете». То, что важно для пар с историей стресса и трудностей, может отличаться от того, что важно для пар без такой истории. Неудачная проверка может говорить не о том, что теория неверна, а о том, что её область применения уже, чем думали.

2

Две из двадцати двух — это не ноль

Два подтвердившихся сигнала из двадцати двух — это немного, но не ноль. Значит, что-то в теории Готтмана реально работает и на других людях. Задача теперь — понять, что именно.

3

Репликация — двигатель, а не тормоз

Без таких проверок, как у Ким в 2007-м, теория Готтмана могла бы ещё двадцать лет жить, а никто бы толком не знал, насколько ей можно доверять. Проверка на новых людях — инструмент, который уточняет теорию, а не ломает её.

✋ Объясни своими словами
Почему неудачная проверка на других людях — это нормальная работа науки, а не скандал и не доказательство обмана? Объясни это человеку, который только что прочитал заголовок «Учёные опровергли Готтмана».
Подсказка: ключевые слова — «границы применимости», «выборка», «пост-хок или заранее», «уточнение, а не опровержение».

Часть 6. Итоги: что держится, что под вопросом

После Хеймана и Смит-Слеп 2001 (глава 5) и Ким с коллегами 2007 (сегодня) картина становится довольно ясной.

Что подтверждается. Базовые находки Готтмана о том, чем несчастливые пары отличаются от счастливых — сильная физиологическая реакция во время ссоры, взаимная раскрутка негатива, паттерны, которые позже назвали «Четырьмя всадниками», — в разной степени подтверждаются и в других исследованиях. Это описательная часть теории, и она довольно прочная. Мы говорили об этом в главах 2 и 3.

Что не подтверждается. Конкретные формулы предсказания — точные цифры вроде 83% или 94%, конкретные сигналы как универсальные признаки для всех пар — не прошли независимую проверку. Это предсказательная часть теории: она эффектно звучит, отлично продаётся — и ненадёжна за пределами тех выборок, на которых родилась.

Граница между описанием и предсказанием — это граница между тем, что наука может сказать надёжно, и тем, что она пока только обещает.

В следующей главе случится кое-что необычное. Готтмана раскритикует не сторонний человек, а коллега из его же научного лагеря. Тот, кто сам всю жизнь изучает пары, и чья программа конкурирует с программой Готтмана. Это будет спор двух взрослых людей, которые не соглашаются друг с другом. И он многое покажет о том, как устроена настоящая наука изнутри.

В следующей главе. 2000 год. Журнал публикует статью и сразу же ответ на неё. Один из авторов ответа — Говард Маркман, один из создателей программы PREP для пар. Он пишет, что советы Готтмана «в лучшем случае преждевременны» — и объясняет, почему мост от данных в лаборатории до советов реальным парам ещё не построен. Это критика изнутри. И она меняет всё.

Источники этой главы

  1. Peer-reviewedCarrère, S., & Gottman, J. M. (1999). Predicting divorce among newlyweds from the first three minutes of a marital conflict discussion. Family Process, 38(3), 293–301. 124 новобрачных, SPAFF-кодирование, пять 3-минутных интервалов; «предсказание» исхода за 6 лет по первым трём минутам — пост-хок анализ на своей выборке. DOI: 10.1111/j.1545-5300.1999.00293.x
  2. Peer-reviewedHeyman, R. E., & Smith Slep, A. M. (2001). The hazards of predicting divorce without crossvalidation. Journal of Marriage and Family, 63(2), 473–479. Уравнение с 90% общей точностью падает до ~21% positive predictive value при кросс-валидации; ни одно исследование на 2001 г. не проверяло предсказание развода на общей популяции. DOI: 10.1111/j.1741-3737.2001.00473.x · PMID: 17066126 · PMC1622921
  3. Peer-reviewedKim, H. K., Capaldi, D. M., & Crosby, L. (2007). Generalizability of Gottman and colleagues' affective process models of couples' relationship outcomes. Journal of Marriage and Family, 69(1), 55–72. Независимая at-risk выборка (85 пар), проспективный дизайн. 22 аффективных процесса Готтмана протестированы: ключевые предикторы не реплицировались; лишь 2 из 22 значимо связаны с исходом. Авторы формулируют как вопрос обобщаемости, а не опровержения теории. DOI: 10.1111/j.1741-3737.2006.00343.x · PMID: 17372624 · PMC1828692
  4. Peer-reviewedGottman, J. M., & Levenson, R. W. (1992). Marital processes predictive of later dissolution: Behavior, physiology, and health. Journal of Personality and Social Psychology, 63(2), 221–233. 73 пары, два замера (1983 и 1987), проспективный дизайн. Каскадная модель распада названа самими авторами «предварительно поддержанной»; закладывает поведенческие паттерны, ставшие прото-Четырьмя всадниками. DOI: 10.1037/0022-3514.63.2.221 · PMID: 1403613

Глава информационно-просветительская. Источники — peer-reviewed статьи. Это не индивидуальная психологическая консультация и не замена семейной терапии.

Как вам этот урок?

Один короткий сигнал поможет улучшить следующую версию.

Репликация, которая не вышла — Коммуникация в паре: что наука знает о ссорах · лооооч