Расчёт размера выборки
Инструмент для определения необходимого количества пользователей в эксперименте.
Зачем рассчитывать выборку
Размер выборки определяет, сколько пользователей нужно включить в эксперимент, чтобы обнаружить ожидаемое изменение метрики с заданной статистической надежностью.
Слишком маленькая выборка: тест не обнаружит реальный эффект (ложноотрицательный результат), даже если изменение работает.
Слишком большая выборка: эксперимент затянется, потратятся лишние ресурсы на сбор данных.
Инструмент помогает найти минимальный размер выборки для надежного результата.
Как открыть инструмент
Перейдите в Инструменты → Расчёт выборки через боковое меню. Вы увидите форму с двумя вкладками: Conversion и Numeric.
Выберите вкладку в зависимости от типа вашей ключевой метрики.
Расчёт для conversion-метрик
Используется для бинарных событий (регистрация, покупка, клик) — когда метрика принимает значения 0 или 1.
Заполните поля:
Baseline: Текущий уровень метрики до изменений. Например, если сейчас 5% пользователей регистрируются, введите 5.
Uplift (%): Минимальный эффект, который хотите обнаружить, в процентах относительно базового значения.
Например: +10 означает рост с 5% до 5.5% (5% × 1.1 = 5.5%). Можно указывать отрицательные значения для проверки снижения метрики.
Уровень значимости (Alpha): Допустимая вероятность ложноположительного результата. По умолчанию 0.05 (5%) — стандартное значение в индустрии. Означает 95% уверенность в результате.
Мощность теста (Power): Вероятность обнаружить эффект, если он есть. По умолчанию 0.8 (80%) — рекомендуемое значение. Означает, что в 80% случаев тест обнаружит реальное изменение.
Распределение трафика (Traffic allocation): Как делить пользователей между контролем (A) и тестом (B). По умолчанию 50/50. Можно изменить слайдером, если нужен несбалансированный дизайн (например, 70/30).
Нажмите "Рассчитать". Инструмент покажет необходимый размер выборки для каждой группы.
Расчёт для numeric-метрик
Используется для непрерывных показателей (доход на пользователя, время сессии, количество действий).
Заполните поля:
Базовое значение (Baseline mean): Текущее среднее значение метрики. Например, если средний доход на пользователя 50 рублей, введите 50.
Стандартное отклонение (Standard deviation): Мера вариативности данных. Рассчитывается как sqrt(variance) из исторических данных. Чем выше вариативность, тем больше нужна выборка.
Если не знаете SD, используйте примерную оценку: SD ≈ Mean / 2 для умеренной вариативности.
Uplift (%): Минимальный эффект в процентах относительно базового значения. Например: +15 означает рост с 50 до 57.5 рублей.
Alpha и Power: Те же параметры, что для conversion-метрик (по умолчанию 0.05 и 0.8).
Распределение трафика: Аналогично conversion-метрикам, по умолчанию 50/50.
Нажмите "Рассчитать". Результат покажет размер выборки с учётом вариативности данных.
Интерпретация результата
Инструмент показывает три карточки:
1. Параметры теста: Подтверждение введённых значений alpha (уровень значимости) и power (мощность теста).
2. Параметры метрики:
- Baseline
- Uplift
- Целевое значение (baseline + uplift)
3. Необходимый размер выборки: Главный результат — минимальное количество пользователей для каждой группы.
Для сбалансированного дизайна (50/50): Отображается одно число — размер каждой группы. Общий размер эксперимента зависит от количества групп (для A/B теста = размер × 2, для A/B/C = размер × 3 и т.д.).
Для несбалансированного дизайна: Отображаются отдельные числа для каждой группы (контроль и тестовые варианты).
Планирование длительности
Зная размер выборки и средний трафик, можно оценить длительность эксперимента.
Пример расчёта:
- Необходимый размер: 10,000 пользователей на группу (20,000 всего)
- Ежедневный трафик: 2,000 пользователей
- Длительность: 20,000 / 2,000 = 10 дней
Добавьте запас 10-15% на:
- Неравномерный трафик (выходные/будни)
- Технические сбои
- Исключение аномальных данных
Несбалансированный дизайн
Используйте неравное распределение трафика (например, 80/20 или 90/10), если:
- Тестируете потенциально опасное изменение — ограничьте тестовую группу до 10-20%
- Хотите минимизировать риски при эксперименте с новым функционалом
- Есть технические ограничения на размер тестовой группы
Важно: несбалансированный дизайн требует бóльшую общую выборку, чем 50/50, для той же статистической мощности.
Типичные ошибки
Занижение uplift: Если указать слишком маленький ожидаемый uplift (+1%), потребуется огромная выборка. Будьте реалистичны — какой минимальный эффект стоит обнаруживать?
Завышение baseline для conversion: Baseline 50% требует меньшую выборку, чем 5%. Не завышайте baseline искусственно — это приведёт к недостаточному размеру выборки.
Игнорирование вариативности для numeric: Чем выше стандартное отклонение, тем больше нужна выборка. Если SD неизвестно, лучше переоценить, чем недооценить.
Остановка раньше расчётного размера: Если эксперимент показал p < 0.05 на половине запланированной выборки, не останавливайте его — это нарушает статистическую корректность.
