Коротко: три месяца уходят не на тест, а на ожидание, пока случайные колебания станут похожи на результат. Считайте выборку до запуска — и вы сразу увидите, какие гипотезы вообще стоит проверять.
Три месяца на «шум»: как это происходит
Сценарий всегда один. Запустили вариант B, через три дня конверсия выше на 0,4 процентных пункта, команда радуется и раскатывает изменение. Через две недели выясняется, что разницы нет, а иногда — что вариант B хуже.
Причина не в невезении. Ежедневная конверсия колеблется сама по себе: состав трафика, день недели, погода, остатки на складе. Пока наблюдаемая разница меньше этого естественного разброса, никакого эффекта не обнаружено — независимо от того, насколько убедительно выглядит график.
Сколько данных нужно
Размер выборки считается до запуска, а не после. Формула для равных групп: n ≈ 16 · p(1−p) / Δ² на группу, где p — базовая конверсия, Δ — абсолютный минимальный эффект, который вы хотите заметить. Коэффициент 16 соответствует уровню значимости 0,05 и мощности 80%.
Отсюда следует неприятная, но полезная вещь: при конверсии 1% и желании заметить рост на 5% понадобятся сотни тысяч сессий. Тестировать цвет кнопки в таких условиях бессмысленно — нужно тестировать только крупные изменения.
Ошибки, которые стоят месяцев
| Ошибка | Что происходит | Чем грозит | Как делать |
|---|---|---|---|
| Останавливать тест при первой значимости | Проверяют каждый день и радуются первому p < 0,05 | Ложноположительный результат, откат через месяц | Фиксировать срок и размер выборки заранее |
| Менять несколько блоков сразу | Новая шапка и новый чекаут в одном варианте | Неизвестно, что сработало | Одна гипотеза — одно изменение |
| Тестировать без гипотезы | «Давайте попробуем другой цвет» | Трафик потрачен, выводов нет | Формулировать: что меняем, почему, какой ждём эффект |
| Смешивать трафик из разных каналов | Органика и платный трафик в одной выборке | Разное поведение аудиторий размывает результат | Сегментировать минимум по каналу и устройству |
| Заканчивать тест ровно в середине недели | Недельный цикл не закрыт | Искажение до 15% по выходным | Считать целыми неделями |
| Игнорировать сезонность | Тест в период распродаж | Результат не переносится на обычный период | Либо не тестировать в пик, либо фиксировать условие |
| Считать много метрик без поправки | Проверили 20 показателей — один «значим» | Случайная значимость | Одна главная метрика, остальные — наблюдательные |
Главная ошибка — останавливать тест «когда стало понятно». Понятно становится случайно, а не потому, что данных достаточно.
Тест, у которого нет заранее зафиксированного срока и размера выборки, — это не эксперимент. Это опрос общественного мнения с участием вашего трафика.
Порядок, который экономит месяцы
Рабочий процесс короткий, и его целиком можно уместить в один документ на страницу:
- Гипотеза. Что меняем, на какой ступени воронки, почему это должно сработать.
- Расчёт. Сколько сессий нужно и сколько это займёт недель при текущем трафике.
- Фиксация. Дата окончания и главная метрика записываются до запуска и не пересматриваются.
- Запуск. Одно изменение, целые недели, сегменты не трогаем.
- Разбор. По окончании срока — решение: раскатываем, откатываем или тестируем иначе.
Если расчёт показывает, что тест займёт больше шести недель, правку, скорее всего, не стоит тестировать: эффект должен быть крупным, иначе вы не отличите его от шума за разумное время.
Когда A/B-тест не нужен
| Ситуация | Тест | Что делать вместо |
|---|---|---|
| Ошибка в форме, заявки не доходят | Не нужен | Чинить немедленно: это баг, а не гипотеза |
| Страница грузится 6 секунд | Не нужен | Ускорять: технический стандарт не тестируют |
| Цена выше рынка на 20% | Не нужен | Считать экономику: тест не спасёт нерентабельное предложение |
| Заголовок и оффер на первом экране | Нужен | Тест с заранее посчитанным сроком |
| Порядок блоков в карточке товара | Нужен | Тест на мобильном трафике отдельно |
| Спор команды о варианте | Нужен | Тест как способ закончить спор цифрами |
Правило простое: баги и технические стандарты чинят без теста, гипотезы и споры — проверяют.
FAQ: A/B-тесты
Можно ли остановить тест раньше срока, если разница огромная?
Только если эффект кратно превышает ожидаемый и устойчив несколько дней. Но правило надёжнее: срок фиксируется заранее. Исключения открывают дорогу самообману.
Что делать, если трафика не хватает для теста?
Тестировать только крупные изменения с ожидаемым эффектом от 15–20%. Мелкие правки при низком трафике проверять невозможно — внедряйте их по экспертизе и не называйте это тестом.
Какой уровень значимости брать?
0,05 — рабочий стандарт. Для решений, которые дорого откатывать, берите 0,01 и считайте больший размер выборки. Менять порог по ходу теста нельзя.
Почему результат теста не повторился после раскатки?
Три причины: изменился состав трафика, эффект был сезонным или тест остановили раньше срока. Проверяйте совпадение условий, прежде чем делать вывод.
Сколько тестов можно вести параллельно?
Столько, сколько независимых страниц: на одной странице — один тест. Параллельные тесты на разных страницах допустимы, если они не влияют на одну и ту же ступень воронки.
Нужно ли тестировать на мобильном трафике отдельно?
Да. Поведение на телефоне и на компьютере различается настолько, что общий результат часто скрывает противоположные эффекты. Разбивка по устройствам обязательна.