Skip to content

Расчёт размера выборки

Инструмент для определения необходимого количества пользователей в эксперименте.

Зачем рассчитывать выборку

Размер выборки определяет, сколько пользователей нужно включить в эксперимент, чтобы обнаружить ожидаемое изменение метрики с заданной статистической надежностью.

Слишком маленькая выборка: тест не обнаружит реальный эффект (ложноотрицательный результат), даже если изменение работает.

Слишком большая выборка: эксперимент затянется, потратятся лишние ресурсы на сбор данных.

Инструмент помогает найти минимальный размер выборки для надежного результата.

Как открыть инструмент

Перейдите в ИнструментыРасчёт выборки через боковое меню. Вы увидите форму с двумя вкладками: Conversion и Numeric.

Выберите вкладку в зависимости от типа вашей ключевой метрики.

Расчёт для conversion-метрик

Используется для бинарных событий (регистрация, покупка, клик) — когда метрика принимает значения 0 или 1.

Заполните поля:

Baseline: Текущий уровень метрики до изменений. Например, если сейчас 5% пользователей регистрируются, введите 5.

Uplift (%): Минимальный эффект, который хотите обнаружить, в процентах относительно базового значения.

Например: +10 означает рост с 5% до 5.5% (5% × 1.1 = 5.5%). Можно указывать отрицательные значения для проверки снижения метрики.

Уровень значимости (Alpha): Допустимая вероятность ложноположительного результата. По умолчанию 0.05 (5%) — стандартное значение в индустрии. Означает 95% уверенность в результате.

Мощность теста (Power): Вероятность обнаружить эффект, если он есть. По умолчанию 0.8 (80%) — рекомендуемое значение. Означает, что в 80% случаев тест обнаружит реальное изменение.

Распределение трафика (Traffic allocation): Как делить пользователей между контролем (A) и тестом (B). По умолчанию 50/50. Можно изменить слайдером, если нужен несбалансированный дизайн (например, 70/30).

Нажмите "Рассчитать". Инструмент покажет необходимый размер выборки для каждой группы.

Расчёт для numeric-метрик

Используется для непрерывных показателей (доход на пользователя, время сессии, количество действий).

Заполните поля:

Базовое значение (Baseline mean): Текущее среднее значение метрики. Например, если средний доход на пользователя 50 рублей, введите 50.

Стандартное отклонение (Standard deviation): Мера вариативности данных. Рассчитывается как sqrt(variance) из исторических данных. Чем выше вариативность, тем больше нужна выборка.

Если не знаете SD, используйте примерную оценку: SD ≈ Mean / 2 для умеренной вариативности.

Uplift (%): Минимальный эффект в процентах относительно базового значения. Например: +15 означает рост с 50 до 57.5 рублей.

Alpha и Power: Те же параметры, что для conversion-метрик (по умолчанию 0.05 и 0.8).

Распределение трафика: Аналогично conversion-метрикам, по умолчанию 50/50.

Нажмите "Рассчитать". Результат покажет размер выборки с учётом вариативности данных.

Интерпретация результата

Инструмент показывает три карточки:

1. Параметры теста: Подтверждение введённых значений alpha (уровень значимости) и power (мощность теста).

2. Параметры метрики:

  • Baseline
  • Uplift
  • Целевое значение (baseline + uplift)

3. Необходимый размер выборки: Главный результат — минимальное количество пользователей для каждой группы.

Для сбалансированного дизайна (50/50): Отображается одно число — размер каждой группы. Общий размер эксперимента зависит от количества групп (для A/B теста = размер × 2, для A/B/C = размер × 3 и т.д.).

Для несбалансированного дизайна: Отображаются отдельные числа для каждой группы (контроль и тестовые варианты).

Планирование длительности

Зная размер выборки и средний трафик, можно оценить длительность эксперимента.

Пример расчёта:

  • Необходимый размер: 10,000 пользователей на группу (20,000 всего)
  • Ежедневный трафик: 2,000 пользователей
  • Длительность: 20,000 / 2,000 = 10 дней

Добавьте запас 10-15% на:

  • Неравномерный трафик (выходные/будни)
  • Технические сбои
  • Исключение аномальных данных

Несбалансированный дизайн

Используйте неравное распределение трафика (например, 80/20 или 90/10), если:

  • Тестируете потенциально опасное изменение — ограничьте тестовую группу до 10-20%
  • Хотите минимизировать риски при эксперименте с новым функционалом
  • Есть технические ограничения на размер тестовой группы

Важно: несбалансированный дизайн требует бóльшую общую выборку, чем 50/50, для той же статистической мощности.

Типичные ошибки

Занижение uplift: Если указать слишком маленький ожидаемый uplift (+1%), потребуется огромная выборка. Будьте реалистичны — какой минимальный эффект стоит обнаруживать?

Завышение baseline для conversion: Baseline 50% требует меньшую выборку, чем 5%. Не завышайте baseline искусственно — это приведёт к недостаточному размеру выборки.

Игнорирование вариативности для numeric: Чем выше стандартное отклонение, тем больше нужна выборка. Если SD неизвестно, лучше переоценить, чем недооценить.

Остановка раньше расчётного размера: Если эксперимент показал p < 0.05 на половине запланированной выборки, не останавливайте его — это нарушает статистическую корректность.

AB-Labz - Лаборатория продуктовых экспериментов