Правильный A/B-тест начинается до первого показа. Команда заранее пишет, какое единственное изменение получит тестовая группа, кого и по какому устойчивому идентификатору распределяют, какая метрика определяет успех, какой эффект достаточно важен, сколько наблюдений нужно и по какому правилу тест закончится. Во время эксперимента проверяют распределение и телеметрию, но не назначают победителя при каждом обновлении. В финале сообщают величину эффекта с интервалом и влияние на защитные метрики, а не только p-value.

Начните с решения

Фраза «проверим новый баннер» не является гипотезой. Запишите решение после теста: внедрить вариант, оставить контроль, продолжить сбор при заранее оговорённом условии или отказаться из-за защитной метрики. Затем сформулируйте причинное предположение: «если упростить первый экран для новых мобильных посетителей, доля завершивших заявку за семь дней вырастет минимум на выбранную величину, при этом отмены и обращения в поддержку не ухудшатся сверх порога». Здесь названы популяция, изменение, исход, горизонт и ограничение.

Меняйте один интерпретируемый пакет. Если одновременно заменить цену, текст, форму и канал, результат относится ко всему пакету и не объясняет вклад частей. Это может быть приемлемо для решения «выпустить пакет или нет», но неприемлемо для вывода «новый заголовок увеличил продажи». Зафиксируйте, какой вывод допустим, ещё до запуска.

Единица рандомизации и экспозиция

Рандомизировать можно пользователя, аккаунт, организацию, устройство, сессию или географию. Выбор зависит от того, где возникает вмешательство и могут ли варианты влиять друг на друга. Если коллеги одного корпоративного аккаунта должны видеть одинаковую цену, распределение отдельных пользователей нарушит опыт и независимость. Если один человек попадает в оба варианта с разных устройств, сессионная рандомизация размоет эффект. Укажите идентификатор, момент назначения и срок закрепления варианта.

Назначение не равно экспозиции. Человек может попасть в тест, но не увидеть изменённый элемент. Храните отдельно assignment и exposure, причём условие экспозиции должно быть симметричным и определено до анализа. Фильтрация «только тех, кто кликнул» после воздействия способна создать смещение: сам клик уже может зависеть от варианта. Microsoft рекомендует проектировать counterfactual logging для узко срабатывающих изменений, но конкретный метод требует аналитической проверки.

Одна главная метрика и несколько ролей

Роль

Вопрос

Пример

Как влияет на решение

Primary

Достигнута ли цель гипотезы?

Доля новых пользователей с оплаченной заявкой за 7 дней.

Одна заранее выбранная основа вывода.

Guardrail

Не нанесён ли неприемлемый вред?

Возвраты, ошибки, отмены, обращения.

Может заблокировать внедрение даже при росте primary.

Diagnostic

Через какой шаг мог измениться результат?

Открытие формы, валидационная ошибка.

Объясняет механизм, но не заменяет primary.

Data quality

Можно ли доверять измерению?

SRM, потеря событий, доля неизвестной экспозиции.

При серьёзном нарушении результат не интерпретируют.

Большой набор равноправных метрик создаёт возможность выбрать удачное случайное движение после просмотра данных. Если метрик или вариантов много, заранее определите семейство проверок и способ контролировать множественные сравнения вместе со статистиком или библиотекой экспериментов. Не переносите порог 0,05 на десятки независимых решений без коррекции и не скрывайте метрики, которые ухудшились.

MDE, ошибки и мощность

Минимально обнаружимый эффект, или MDE, — наименьшее изменение, ради которого бизнес готов принять решение и которое тест спроектирован различить с выбранной вероятностью. Он не выбирается после результата. Слишком маленький MDE требует большой выборки; слишком крупный позволяет пропустить полезный эффект. Переведите MDE в абсолютные единицы: не «рост 10%», а «с 4,0% до 4,4%», если имеется в виду относительный рост десять процентов.

Alpha ограничивает риск ложного положительного решения при выполнении допущений анализа. Мощность, равная единице минус beta, характеризует способность обнаружить заранее заданный эффект. Требуемая выборка зависит также от базовой доли или разброса метрики, распределения трафика и дизайна. NIST публикует разные формулы для средних и долей; универсального числа наблюдений нет. Используйте проверенную статистическую библиотеку или платформу и сохраняйте все входы расчёта.

Чек-лист гипотезы, метрики и длительности

Поле до запуска

Что записать

Hard fail

Решение

Варианты действий и ответственный.

Команда не знает, что сделает при каждом исходе.

Гипотеза

Популяция, изменение, механизм, метрика, направление.

Нельзя опровергнуть выбранными данными.

Рандомизация

Единица, идентификатор, доли, закрепление.

Один объект может одновременно видеть оба варианта.

Экспозиция

Событие фактического показа и правила анализа.

Логирование различается между вариантами.

Primary

Формула, окно созревания и агрегация.

Выбирается после просмотра результата.

Guardrails

Порог вреда и правило блокировки.

Рискованный эффект остаётся без наблюдения.

MDE и ошибки

Абсолютный эффект, alpha, power и sidedness.

Выборка рассчитана без этих входов.

Выборка

Метод, baseline, variance, N на вариант.

Платформа не объясняет расчёт или допущения.

Длительность

Расчётное N, полный цикл поведения, окно исхода.

Назначена только по привычке или ближайшей дате.

Остановка

Фиксированный горизонт либо валидный sequential design.

План — остановить при первом приятном p-value.

Длительность — это два ограничения

Срок должен одновременно обеспечить расчётное количество единиц и охватить релевантный календарный цикл. Если в будни и выходные аудитория различается, два дня с большим трафиком не заменят полный цикл. Если основная метрика созревает семь дней после первого показа, последний набранный пользователь должен получить это окно до финального анализа. Акции, праздники, сбои и параллельные изменения фиксируются как события контекста.

Некоторые платформы дают типовую рекомендацию по минимальному сроку. Например, Firebase называет две недели для типичного Remote Config эксперимента, одновременно требуя достаточных данных и репрезентативности. Это не закон для любого A/B-теста. Низкочастотный B2B-исход может требовать месяцы, а высокочастотная техническая метрика — меньше календарного времени при другом дизайне. Обоснование хранится рядом с расчётом.

Контроль запуска и SRM

Начните с проверки назначения, конфигурации и событий на небольшом безопасном трафике. Сравните ожидаемую и фактическую долю объектов по вариантам. Значимое несоответствие, Sample Ratio Mismatch, — не неудобная формальность, а симптом: отваливается телеметрия, фильтр применён после рандомизации, один вариант загружается медленнее, распределение использует нестабильный ключ или аудитории пересекаются. До нахождения причины результат нельзя объявлять достоверным.

  • Проверить количество назначенных и экспонированных объектов по каждому варианту.

  • Сверить версии конфигурации, временные зоны, начало и остановку набора.

  • Убедиться, что события имеют одинаковую схему и вероятность доставки.

  • Проверить резкие изменения primary, guardrail и data-quality метрик, не выбирая победителя.

  • Записать внешние кампании, релизы, сбои и изменения продукта, пересекающие эксперимент.

Почему ежедневное подглядывание опасно

Если каждый день применять обычный фиксированный тест и остановиться при первом пересечении порога, фактический риск ложного решения уже не соответствует заявленному. Допустим sequential design с заранее заданными границами и методом, который учитывает повторные просмотры. Недопустимо называть последовательным анализом обычное наблюдение панели. До завершения можно остановить эксперимент ради безопасности или критической поломки, но такой исход документируют и не превращают в доказательство победы.

Интерпретация после завершения

Отчёт начинается с качества данных: SRM, потеря событий, соблюдение плана, фактическая выборка и окно исхода. Затем показываются baseline, значение варианта, абсолютная и относительная разница, доверительный интервал и выбранный статистический метод. P-value не сообщает вероятность истинности гипотезы и не измеряет важность результата. Узкий интервал вокруг слишком маленького эффекта может быть статистически убедительным, но экономически бесполезным.

Исходов больше двух. «Внедрить» уместно, когда эффект практически значим, интервал совместим с решением, guardrails приемлемы и данные качественны. «Оставить контроль» — когда полезный эффект исключён с нужной точностью или риск перевешивает. «Неопределённо» — когда интервал включает и полезный рост, и неприемлемое падение. В последнем случае команда решает, стоит ли дополнительная информация продолжения; нельзя просто написать «теста не было».

Синтетический пример вывода

Предположим, primary выросла с 4,0% до 4,2%, оценка абсолютного эффекта — плюс 0,2 процентного пункта, а интервал совместим со значениями от минус 0,1 до плюс 0,5. MDE был задан как плюс 0,4 пункта. Такой результат не доказывает отсутствие эффекта и не подтверждает целевой рост: данные допускают как небольшое ухудшение, так и полезный эффект. Если стоимость дополнительной выборки высока, можно оставить контроль; если решение критично, продолжение требует нового обоснованного плана, а не стирания первой попытки.

Практический следующий шаг

Возьмите ближайший задуманный тест и заполните чек-лист до поля остановки. Если неизвестны baseline и разброс, сначала соберите исторический срез без вмешательства и проверьте качество события. Рассчитайте выборку проверенным инструментом, сохраните входы и попросите коллегу воспроизвести расчёт. Не запускайте тест, пока разметка экспозиции, primary и guardrails не проходят на контрольном трафике. Самая дешёвая ошибка — та, которую нашли до рандомизации.

Что читать дальше