A/B тесты и анализ данных на PythonОткрытые материалыСтатистическая значимость и p-value в A/B-тесте

Статистическая значимость и p-value в A/B-тесте

Уроки курсаСтатистическая значимость и p-value в A/B-тесте

Типичные ошибки интерпретации

Нельзя сначала много раз смотреть на результат, а остановить тест при первом p-value ниже 0,05: обычный порог не учитывает последовательный просмотр. Нельзя выбирать метрику после того, как увидели красивый эффект. При проверке десятков метрик растёт вероятность хотя бы одного случайного «успеха».

Практический отчёт содержит дизайн эксперимента, размер групп, длительность, исходную и новую метрику, абсолютный и относительный uplift, доверительный интервал и p-value. Затем бизнес сравнивает диапазон эффекта с минимально полезным изменением и возможными рисками.

Статистическая значимость — фильтр против части случайных находок, а не сертификат полезности и не замена корректному дизайну.