Таблица A/B теста
Основная таблица результатов анализа двух вариантов (контроль vs. тест).
Структура таблицы
Таблица содержит одну строку для каждой метрики из загруженного файла. Колонки показывают ключевые статистики сравнения двух групп.
Метрика
Название метрики из загруженного CSV файла. Метрики с маркером P — это primary метрики, которые образуют семейство для FDR-коррекции (если коррекция включена в настройках анализа).
Зеленый цвет строки означает статистически значимый результат — p-value меньше заданного уровня значимости (альфа), который настраивается в параметрах анализа.
Обработка
Тип предобработки, применённый к метрике:
- — (пусто) — для conversion метрик (бинарных), предобработка не применяется
- log — логарифмическое преобразование
- IQR3 — очистка выбросов методом 3×IQR
- winsor5% — винзоризация на уровне 5%
- winsor1% — винзоризация на уровне 1%
Предобработка автоматически выбирается системой для numeric метрик, чтобы минимизировать влияние выбросов.
Эффект (Δ)
Разница между тестовой и контрольной группами. Формат: абсолютное изменение (относительное изменение в %).
Для conversion метрик:
- Абсолютное изменение в процентных пунктах (pp)
- Пример:
1.50 ( +15.00% )→ конверсия выросла на 1.5 pp, что составляет +15% относительно контроля
Для numeric метрик:
- Абсолютное изменение показывается в расчете на пользователя (per user)
- Пример:
-12.70 ( -1.25% )→ GMV на пользователя снизился на 12.70 единиц, что составляет -1.25% относительно контроля
CI Low / CI Up
Доверительный интервал эффекта (95% confidence interval). Показывает диапазон, в который с вероятностью 95% попадает истинное значение эффекта.
Интерпретация:
- Если интервал не включает 0 → эффект статистически значим
- Если интервал включает 0 → нет уверенности в наличии эффекта
- Узкий интервал → высокая точность оценки
- Широкий интервал → низкая точность, нужна большая выборка
Пример:
- CI Low:
0.80, CI Up:2.20→ эффект находится в диапазоне от +0.80 до +2.20 (значим) - CI Low:
-0.50, CI Up:1.50→ эффект может быть от -0.50 до +1.50 (не значим)
P-value
Вероятность получить наблюдаемую или более экстремальную разницу, если на самом деле изменение не имеет эффекта.
Результат статистически значим, если p-value меньше заданного уровня значимости (альфа). По умолчанию используется α = 0.05, но это значение можно настроить в параметрах анализа.
Для primary метрик (с маркером P): если включена FDR-коррекция, здесь отображается скорректированное значение (q-value), которое учитывает множественное тестирование по семейству метрик.
Важно: P-value показывает, есть ли эффект, но не показывает его размер. Всегда смотрите на величину эффекта и доверительный интервал.
ProbW
Доступно только при выборе метода "Малые выборки".
Вероятность того, что тестовый вариант лучше контрольного (Probability of Winning).
Интерпретация:
- > 95% — очень высокая уверенность в улучшении
- 90-95% — высокая уверенность
- 75-90% — умеренная уверенность
- 50-75% — низкая уверенность
- < 50% — вероятнее всего изменение ухудшает метрику
Пример:
- ProbW = 89.17% → в 89% симуляций тестовый вариант показывает лучший результат
- ProbW = 9.23% → в 91% симуляций контроль лучше теста (изменение скорее всего ухудшает метрику)
Принятие решений
Не полагайтесь только на p-value. Учитывайте:
- Размер эффекта: Достаточно ли он велик для бизнеса?
- Доверительный интервал: Насколько точна оценка?
- Практическая значимость: Стоит ли внедрять изменение с учетом затрат?
- Побочные эффекты: Как изменились другие метрики?
Пример правильного решения:
- Метрика
purchase_conversion: эффект+2.30 ( +23.00% ), CI[+1.50, +3.10], p-value0.0012 - Вывод: Статистически значимый рост конверсии на 23%, доверительный интервал узкий и не включает 0. Изменение явно положительное, стоит внедрять.
Пример осторожного решения:
- Метрика
revenue_per_user: эффект+0.05 ( +0.50% ), CI[+0.01, +0.09], p-value0.0180 - Вывод: Статистически значим, но эффект микроскопический (+0.5%). Нужно оценить, оправдывают ли затраты на внедрение такой малый прирост.
