Таблица A/B/C+ теста
Результаты анализа множественных вариантов (3 и более групп). Состоит из двух таблиц: глобальной проверки и попарных сравнений.
Таблица 1: Global P-value
Первая таблица показывает глобальную проверку: есть ли хотя бы одно различие между всеми группами.
Структура
| Метрика | Global p-value |
|---|---|
| purchase_conversion | 0.0023 |
| revenue_per_user | 0.1450 |
Что показывает Global P-value
Это результат общего статистического теста, который проверяет нулевую гипотезу: все группы одинаковы.
Если Global p-value < α (уровня значимости):
- Есть статистически значимые различия между группами
- Переходите к попарным сравнениям, чтобы найти, какие именно варианты отличаются
Если Global p-value ≥ α:
- Нет уверенности, что группы различаются
- Попарные сравнения не имеют смысла
Важно: Global p-value не говорит, какой вариант лучше. Для этого используйте попарные сравнения.
Таблица 2: Pairwise Comparisons (попарные сравнения)
Вторая таблица показывает все возможные пары вариантов и их различия для каждой метрики.
Структура таблицы
Таблица организована следующим образом:
- Строки — пары сравниваемых групп (например, 0-1, 0-2, 1-2)
- Столбцы — сгруппированы по метрикам, для каждой метрики показаны несколько характеристик
Для стандартного анализа:
- p — p-value сравнения (с поправкой на множественные сравнения)
- CI — доверительный интервал в формате [CI Low, CI Up]
Для анализа с малыми выборками:
- p — p-value сравнения
- CI — доверительный интервал
- ProbW — вероятность того, что вторая группа лучше первой (P(win))
Пример таблицы:
| Группа | cr_item | cr_cart | ||||
|---|---|---|---|---|---|---|
| p | CI | ProbW | p | CI | ProbW | |
| 0-1 | 0.7360 | [-0.02, 0.01] | 36.80% | 0.5373 | [-0.02, 0.01] | 26.87% |
| 0-2 | 0.7360 | [-0.02, 0.01] | 20.70% | 0.3940 | [-0.03, 0.00] | 6.57% |
| 1-2 | 0.7360 | [-0.02, 0.01] | 28.53% | 0.5373 | [-0.02, 0.01] | 18.10% |
Пары групп
Обозначения:
- 0-1 — сравнение группы 0 (контроль) с группой 1
- 0-2 — сравнение группы 0 с группой 2
- 1-2 — сравнение группы 1 с группой 2
Эффект рассчитывается как: вторая группа минус первая. Например, для пары 0-1 положительный эффект означает, что группа 1 лучше группы 0.
P-value (с поправкой на множественные сравнения)
Критично: При множественных сравнениях система автоматически применяет поправку на множественное тестирование, чтобы снизить вероятность ложных срабатываний.
Без коррекции: если делать 10 сравнений при α=0.05, вероятность хотя бы одного ложного срабатывания ~40%.
С коррекцией: вероятность ложного срабатывания контролируется на заданном уровне.
Порог: p < α (уже с учетом коррекции), где α — уровень значимости, заданный в настройках анализа.
Доверительный интервал (CI)
Показывает диапазон, в который с вероятностью 95% попадает истинная разница между группами.
Интерпретация:
- Не включает 0 → различие статистически значимо
- Включает 0 → нет уверенности в наличии различия
ProbW (вероятность "победы")
Доступно только для анализа с малыми выборками.
Показывает вероятность того, что вторая группа в паре лучше первой. Например:
- 0-1, ProbW = 36.80% → вероятность что группа 1 лучше группы 0 составляет 36.80%
- 1-2, ProbW = 28.53% → вероятность что группа 2 лучше группы 1 составляет 28.53%
Интерпретация:
- > 95% — очень высокая уверенность, что вторая группа лучше
- 90-95% — высокая уверенность
- 75-90% — умеренная уверенность
- 50-75% — низкая уверенность
- < 50% — вероятнее всего первая группа лучше второй
Принятие решений при множественных вариантах
Шаг 1: Проверьте Global P-value
Если он не значим — нет смысла копаться в попарных сравнениях. Результат: все варианты примерно одинаковы.
Шаг 2: Найдите лучший вариант
Посмотрите на попарные сравнения. Вариант, который статистически значимо лучше всех остальных, — кандидат на внедрение.
Пример:
- Variant 1 vs Variant 0: p = 0.002 (значим, +20%)
- Variant 2 vs Variant 0: p = 0.150 (не значим)
- Variant 2 vs Variant 1: p = 0.080 (не значим)
Вывод: Variant 1 явно лучше контроля, а Variant 2 не показал преимущества. Внедряем Variant 1.
Шаг 3: Учитывайте практическую значимость
Даже если все варианты статистически лучше контроля, выбирайте тот, у которого наибольший эффект при сопоставимых затратах на внедрение.
Частые ошибки
Ошибка 1: Игнорирование Global P-value Не начинайте анализ с попарных сравнений. Если Global p-value не значим, попарные различия могут быть случайными.
Ошибка 2: Множественное сравнение "вручную" Не делайте много A/B тестов вместо одного A/B/C теста. Это увеличивает вероятность ложных срабатываний.
Ошибка 3: Выбор "лучшего" без учета CI Вариант с наибольшим эффектом может иметь широкий CI, что означает низкую надежность оценки. Смотрите на CI, а не только на точечную оценку.
