RTP DesportoI Liga. Santa Clara - Sporting BragaESPN DeportesManchester United luce poco peligroso durante el primer lapsoESPNLights, camera, Brunson: Knicks star to appear on 'Law & Order: SVU' episodeThe Jerusalem PostIsraeli public broadcasting icon, journalist Prof. Gideon Kutz dies at age 78וואלהגבר כבן 50 נהרג לאחר שנפל מגובה של שלוש קומות בטמרהInquirer EntertainmentSarah Labahti, McCoy de Leon lead cast of Darryl Yap’s first horror film ‘VHS’MyJoyOnlineFour pupils to one desk: The painful plight of schools in New Juaben NorthVanguardRights lawyer tackles FG over alleged clampdown on dissentn-tvCitys 8-Tore-Spektakel: Wie einst Kane: Haaland holt sich kuriose BestmarkeRMF24Unia Centrum przedstawiła propozycje programowe. Oto plan Pauliny Hennig-KloskiIl Fatto Quotidiano“Questa sarà l’ultima Pontida per Salvini”. Il video racconto del raduno leghista tra deputati lancia coro e contestazioni (organizzate) contro i ribelliPremium TimesCPPE raises concern over foreign traders’ growing presence in Nigeria’s retail sector
The Daily Newsstand · Free, Always
Sunday, September 20, 2026

Одинаковые данные, разные p-value: почему важно правило остановки

Translate

Одно из первых правил, которое обычно усваивают аналитики в A/B-тестировании: не подглядывать в эксперимент до набора рассчитанной выборки. Само правило запоминается хорошо. Некоторые аналитики со временем начинают бояться даже заглядывать в панель эксперимента — будто это квантовая физика и одним взглядом можно спугнуть фотон.

Но проблема не в самом факте наблюдения. Важно, влияет ли увиденное на решение об остановке и учитывает ли это используемый тест. Чтобы понять, почему правило окончания эксперимента вообще имеет значение, начнём с задачи.

Одинаковые данные — разная значимость

Два аналитика решили проверить честность монетки. Оба считают броски независимыми, а вероятность орла p — постоянной. Проверяют одну и ту же нулевую гипотезу против одной и той же односторонней альтернативы:

H_0=0.5, \qquad H_1>0.5.

Оба наблюдают одинаковую последовательность из 12 бросков: 9 орлов и 3 решки. Совпадают не только количества, но и порядок выпадений. Однако у одного результат статистически значим на уровне 5%, а у другого — нет.

Откуда взялась разная значимость, если гипотезы и данные совпадают?

Два правила остановки

Первый аналитик заранее решил сделать ровно 12 бросков. При нулевой гипотезе число орлов X имеет биномиальное распределение:

X\sim\operatorname{Bin}(12,0.5).

Для выбранной альтернативы более экстремальными будут результаты с ещё большим числом орлов. Поэтому p-value — вероятность получить не меньше девяти:

\begin{aligned} p_{\mathrm{fixed}} &=P(X\ge 9\mid H_0)\\[6pt] &=\frac{ \binom{12}{9}+\binom{12}{10}+ \binom{12}{11}+\binom{12}{12} }{2^{12}}\\[6pt] &=\frac{299}{4096} \approx 0.0730. \end{aligned}

На уровне 5% нулевая гипотеза не отвергается.

Второй аналитик заранее выбрал другое правило: бросать монету до третьей решки. В наблюдаемой последовательности третья решка оказалась двенадцатым броском, поэтому итог совпал с результатом первого аналитика.

Теперь случайной величиной является число орлов Y, полученных до третьей решки. Для вычисления p-value нужно найти вероятность того, что при честной монете их окажется не меньше девяти.

Это произойдёт тогда и только тогда, когда среди первых 11 бросков будет не больше двух решек:

\begin{aligned} p_{\mathrm{stop}} &=P(Y\ge 9\mid H_0)\\[6pt] &=P\bigl(\operatorname{Bin}(11,0.5)\le 2\bigr)\\[6pt] &=\frac{ \binom{11}{0}+\binom{11}{1}+\binom{11}{2} }{2^{11}}\\[6pt] &=\frac{67}{2048} \approx 0.0327. \end{aligned}

Теперь результат значим на уровне 5%. Оба расчёта корректны: различается процедура, относительно которой вычислены вероятности.

Этот пример разбирают Джеймс Бергер и Роберт Вольперт в книге The Likelihood Principle, пример 9, с. 19–20.

Почему p-value зависит от процедуры

Мы часто обращаемся с p-value как со свойством готовой таблицы данных. Есть 9 орлов из 12 — значит, из этих чисел должен получаться один определённый ответ.

Но для вычисления p-value нужно знать не только наблюдаемый результат. Нужно определить, какие результаты считать не менее экстремальными и с какой вероятностью они возникают при верной H0 в рамках выбранного эксперимента. Именно такие хвостовые вероятности мы посчитали выше.

У первого аналитика каждое повторение эксперимента состоит ровно из 12 бросков. У второго длина эксперимента случайна: он может закончиться после третьего, двенадцатого или двадцатого броска. Поэтому вопрос «что могло произойти при повторении?» имеет два разных ответа.

Что это объясняет про подглядывание

Задача показывает, почему правило остановки является частью дизайна эксперимента. Самого подглядывания в ней нет: оба аналитика заранее выбрали свои планы и корректно посчитали соответствующие p-value. Но она помогает понять, почему нарушение решения по промежуточным результатам требуют отдельного внимания.

Сравним две процедуры. В первой мы набираем заранее рассчитанные N наблюдений и один раз проверяем гипотезу. Во второй регулярно пересчитываем обычный p-value и заканчиваем эксперимент, как только он становится меньше 0.05.

Формула тестовой статистики может остаться прежней. Однако во второй процедуре нас интересует уже не результат в заранее выбранной точке, а возможность хотя бы раз пересечь границу за время наблюдения. Это другое событие с другой вероятностью. Именно такую ситуацию исследовали Армитидж, Макферсон и Роу в статье Repeated Significance Tests on Accumulating Data.

Во что превращаются 5%

В статье 1969 года Армитидж с соавторами рассчитали вероятность хотя бы одного ложного срабатывания при повторном тестировании накопленных данных.

Для независимых нормальных наблюдений с известной дисперсией, двустороннего теста на уровне 5% и проверки после каждого нового наблюдения они получили следующие значения.

Число проверок

Вероятность хотя бы одного ложного срабатывания

1

5,0%

5

14,2%

10

19,3%

20

24,8%

50

32,0%

100

37,4%

Нулевая гипотеза всё это время верна. Тем не менее уже после пяти проверок вероятность объявить значимый результат составляет около 14%, а не 5%. Это не универсальные числа, они относятся к рассмотренному авторами эксперименту. В другом эксперименте значения могут отличаться: они зависят от распределения данных, используемого теста и того, на каких этапах накопления данных проводятся проверки.

Медианное число проверок до первого ложного значимого результата в этой модели составило 613. При неограниченном продолжении вероятность когда-нибудь пересечь фиксированную границу стремится к единице, хотя приближение к ней может быть медленным.

Смотреть можно. Важно, что мы делаем после этого

Открытие дашборда само по себе не меняет процедуру. Если увиденное не влияет на заранее выбранное правило принятия решения, один лишь просмотр не создаёт описанного эффекта.

Другая ситуация — когда промежуточный результат становится основанием закончить эксперимент раньше или продлить его, чтобы «дожать значимость». Тогда анализ должен учитывать, как именно принимается это решение.

Это не означает и то, что размер выборки обязательно фиксировать заранее. Ещё в Sequential Analysis 1947 года Абрахам Вальд рассматривал тесты, в которых после очередного наблюдения можно принять решение или продолжить эксперимент. Зависимость момента остановки от данных в них предусмотрена с самого начала, а вероятности ошибок оцениваются для всей последовательной процедуры.

На практике важно, чтобы правило остановки соответствовало используемому методу анализа. Если промежуточные результаты влияют на решение продолжить или завершить эксперимент, вероятности ошибок нужно оценивать с учётом этой зависимости.

В задаче с монеткой оба аналитика провели корректные расчёты, но для разных планов эксперимента, поэтому и получили разные p-value. Повторные проверки в A/B-тесте — другая ситуация, однако в обоих случаях правило остановки является частью статистической процедуры. Его нужно учитывать вместе с гипотезами, моделью данных и выбранным критерием.

Литература

Основной пример с 12 бросками и двумя правилами остановки разбирается у James O. Berger и Robert L. Wolpert в The Likelihood Principle, Example 9; отдельный раздел книги посвящён правилам остановки и их связи с принципом правдоподобия.

Численные результаты по повторному тестированию — P. Armitage, C. K. McPherson, B. C. Rowe, Repeated Significance Tests on Accumulating Data, 1969.

Последовательный анализ и классический SPRT — Abraham Wald, Sequential Analysis, 1947.

В Telegram-канале «Пикейный аналитик» пишу о статистике, анализе данных и машинном обучении. Разбираю исследования, делюсь заметками из практики и обсуждаю с читателями задачи вроде этой.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.