Skip to content

Таблица A/B/C+ теста

Результаты анализа множественных вариантов (3 и более групп). Состоит из двух таблиц: глобальной проверки и попарных сравнений.

Таблица 1: Global P-value

Первая таблица показывает глобальную проверку: есть ли хотя бы одно различие между всеми группами.

Структура

МетрикаGlobal p-value
purchase_conversion0.0023
revenue_per_user0.1450

Что показывает Global P-value

Это результат общего статистического теста, который проверяет нулевую гипотезу: все группы одинаковы.

Если Global p-value < α (уровня значимости):

  • Есть статистически значимые различия между группами
  • Переходите к попарным сравнениям, чтобы найти, какие именно варианты отличаются

Если Global p-value ≥ α:

  • Нет уверенности, что группы различаются
  • Попарные сравнения не имеют смысла

Важно: Global p-value не говорит, какой вариант лучше. Для этого используйте попарные сравнения.

Таблица 2: Pairwise Comparisons (попарные сравнения)

Вторая таблица показывает все возможные пары вариантов и их различия для каждой метрики.

Структура таблицы

Таблица организована следующим образом:

  • Строки — пары сравниваемых групп (например, 0-1, 0-2, 1-2)
  • Столбцы — сгруппированы по метрикам, для каждой метрики показаны несколько характеристик

Для стандартного анализа:

  • p — p-value сравнения (с поправкой на множественные сравнения)
  • CI — доверительный интервал в формате [CI Low, CI Up]

Для анализа с малыми выборками:

  • p — p-value сравнения
  • CI — доверительный интервал
  • ProbW — вероятность того, что вторая группа лучше первой (P(win))

Пример таблицы:

Группаcr_itemcr_cart
pCIProbWpCIProbW
0-10.7360[-0.02, 0.01]36.80%0.5373[-0.02, 0.01]26.87%
0-20.7360[-0.02, 0.01]20.70%0.3940[-0.03, 0.00]6.57%
1-20.7360[-0.02, 0.01]28.53%0.5373[-0.02, 0.01]18.10%

Пары групп

Обозначения:

  • 0-1 — сравнение группы 0 (контроль) с группой 1
  • 0-2 — сравнение группы 0 с группой 2
  • 1-2 — сравнение группы 1 с группой 2

Эффект рассчитывается как: вторая группа минус первая. Например, для пары 0-1 положительный эффект означает, что группа 1 лучше группы 0.

P-value (с поправкой на множественные сравнения)

Критично: При множественных сравнениях система автоматически применяет поправку на множественное тестирование, чтобы снизить вероятность ложных срабатываний.

Без коррекции: если делать 10 сравнений при α=0.05, вероятность хотя бы одного ложного срабатывания ~40%.

С коррекцией: вероятность ложного срабатывания контролируется на заданном уровне.

Порог: p < α (уже с учетом коррекции), где α — уровень значимости, заданный в настройках анализа.

Доверительный интервал (CI)

Показывает диапазон, в который с вероятностью 95% попадает истинная разница между группами.

Интерпретация:

  • Не включает 0 → различие статистически значимо
  • Включает 0 → нет уверенности в наличии различия

ProbW (вероятность "победы")

Доступно только для анализа с малыми выборками.

Показывает вероятность того, что вторая группа в паре лучше первой. Например:

  • 0-1, ProbW = 36.80% → вероятность что группа 1 лучше группы 0 составляет 36.80%
  • 1-2, ProbW = 28.53% → вероятность что группа 2 лучше группы 1 составляет 28.53%

Интерпретация:

  • > 95% — очень высокая уверенность, что вторая группа лучше
  • 90-95% — высокая уверенность
  • 75-90% — умеренная уверенность
  • 50-75% — низкая уверенность
  • < 50% — вероятнее всего первая группа лучше второй

Принятие решений при множественных вариантах

Шаг 1: Проверьте Global P-value

Если он не значим — нет смысла копаться в попарных сравнениях. Результат: все варианты примерно одинаковы.

Шаг 2: Найдите лучший вариант

Посмотрите на попарные сравнения. Вариант, который статистически значимо лучше всех остальных, — кандидат на внедрение.

Пример:

  • Variant 1 vs Variant 0: p = 0.002 (значим, +20%)
  • Variant 2 vs Variant 0: p = 0.150 (не значим)
  • Variant 2 vs Variant 1: p = 0.080 (не значим)

Вывод: Variant 1 явно лучше контроля, а Variant 2 не показал преимущества. Внедряем Variant 1.

Шаг 3: Учитывайте практическую значимость

Даже если все варианты статистически лучше контроля, выбирайте тот, у которого наибольший эффект при сопоставимых затратах на внедрение.

Частые ошибки

Ошибка 1: Игнорирование Global P-value Не начинайте анализ с попарных сравнений. Если Global p-value не значим, попарные различия могут быть случайными.

Ошибка 2: Множественное сравнение "вручную" Не делайте много A/B тестов вместо одного A/B/C теста. Это увеличивает вероятность ложных срабатываний.

Ошибка 3: Выбор "лучшего" без учета CI Вариант с наибольшим эффектом может иметь широкий CI, что означает низкую надежность оценки. Смотрите на CI, а не только на точечную оценку.

AB-Labz - Лаборатория продуктовых экспериментов