Что такое A/B-тест
В A/B-тесте часть трафика случайным образом видит вариант А (контрольный, «как сейчас»), а другая часть — вариант Б (с изменением). После набора достаточного количества пользователей сравнивают ключевую метрику — конверсию, клики, время на странице — и делают вывод, какой вариант работает лучше и с какой уверенностью.
Ключевое слово — «случайным образом»: если вариант Б показывать только новым посетителям, а вариант А — постоянным, разница в результатах может объясняться не самим изменением, а разницей в аудитории. Корректное разделение трафика — основа всего теста.
Название метода отсылает к простому сравнению двух вариантов, но на практике встречаются и более сложные форматы: A/B/n-тест сравнивает сразу несколько вариантов одновременно, а мультивариантное тестирование (MVT) проверяет комбинации из нескольких элементов сразу — например, заголовка и картинки в разных сочетаниях. Для большинства задач маркетолога простого A/B-теста достаточно, а более сложные форматы требуют заметно больше трафика.
Когда A/B-тест нужен, а когда — нет
A/B-тестирование требует достаточного трафика и достаточного числа конверсий, чтобы результат был статистически надёжным, а не случайным. На сайте с 200 посетителями в месяц тест изменения кнопки может идти полгода и не набрать значимости — в такой ситуации лучше полагаться на качественные методы: CustDev-интервью, юзабилити-тестирование с 5-8 людьми, экспертную оценку.
Тестировать стоит изменения, которые реально могут повлиять на метрику — заголовок, оффер, структуру формы, цену. Тестировать оттенок серого цвета текста — почти всегда трата ресурсов, если только речь не идёт о крупном e-commerce с миллионами посетителей, где даже минимальный эффект окупается объёмом.
Хороший ориентир перед запуском — прикинуть, сколько конверсий у вас случается в неделю сейчас. Если их меньше 50-100 в неделю, тест любого некрупного изменения будет идти неоправданно долго — в такой ситуации разумнее сосредоточиться на более крупных гипотезах, где ожидаемый эффект измеряется не единицами процентов, а десятками.
Как сформулировать гипотезу
Гипотеза для A/B-теста должна быть конкретной и проверяемой, а не «попробуем и посмотрим». Рабочий шаблон:
Если [изменение], то [ожидаемый эффект], потому что [объяснение механизма, почему это должно сработать]. Пример: Если добавить на лендинг блок с отзывами прямо под оффером, то конверсия в заявку вырастет на 10-15%, потому что пользователи на этапе решения испытывают недоверие к новому бренду, а социальное доказательство снижает этот барьер.
Формулировка «потому что» — не формальность: она заставляет опираться на реальную боль или барьер аудитории, а не тестировать изменения наугад. Барьеры для гипотез часто находят в карте пути клиента — там же, где искали эмоции и препятствия на разных этапах воронки.
Хорошая практика — вести общий список гипотез в таблице с оценкой ожидаемого эффекта и трудозатрат на реализацию, и тестировать в первую очередь то, что даёт наибольший потенциальный эффект при наименьших усилиях. Так тестирование превращается в приоритизированную очередь, а не в хаотичный набор случайных идей от разных членов команды.
Как рассчитать размер выборки и длительность теста
Размер выборки зависит от текущей конверсии, ожидаемого эффекта и желаемой уверенности в результате (обычно 95%). Упрощённый пример расчёта:
| Текущая конверсия | Ожидаемый прирост | Примерный размер выборки на вариант |
|---|---|---|
| 2% | +20% (до 2.4%) | ~40 000 посетителей |
| 5% | +20% (до 6%) | ~15 000 посетителей |
| 10% | +15% (до 11.5%) | ~8 000 посетителей |
Чем ниже исходная конверсия и чем меньше ожидаемый эффект, тем больше нужно трафика — это одна из причин, почему A/B-тесты небольших изменений на низкоконверсионных страницах требуют огромных объёмов посетителей. Точный расчёт удобно делать через готовые калькуляторы размера выборки — вручную это скорее оценка порядка величины, чем точная цифра.
Длительность теста должна охватывать минимум один полный бизнес-цикл — обычно 1-2 недели, чтобы захватить и будни, и выходные, и разные дни зарплаты, если это влияет на покупки.
Статистическая значимость простыми словами
Статистическая значимость показывает, насколько вероятно, что разница между вариантами А и Б — не случайность, а реальный эффект изменения. Порог 95% значимости означает: если повторить тест 100 раз, в 95 случаях вы увидели бы такую же разницу, и только в 5 — она оказалась бы случайной. Большинство инструментов A/B-тестирования считают этот показатель автоматически и показывают его прямо в интерфейсе, поэтому вручную считать формулы обычно не приходится — важно лишь правильно интерпретировать готовую цифру.
Помимо значимости, стоит смотреть и на доверительный интервал — диапазон, в котором с заданной вероятностью находится реальный эффект. Формулировка «конверсия выросла на 12%» звучит убедительно, но если доверительный интервал широкий (например, от 2% до 22%), уверенности в точной цифре гораздо меньше, чем кажется на первый взгляд — это стоит учитывать при планировании следующих шагов на основе результата теста.
Частые ошибки A/B-тестирования
Самая частая ошибка — «подглядывание»: смотреть промежуточные результаты каждый день и останавливать тест, как только видна разница в нужную сторону. Это резко повышает риск ложноположительного вывода — ранние колебания часто выравниваются к концу расчётного периода.
Вторая ошибка — тестировать сразу несколько изменений в одном варианте (новый заголовок + новая кнопка + новая картинка), а потом не понимать, что именно сработало. Третья — запускать тест на слишком короткий срок, не дожидаясь полного цикла и статистической значимости, и делать вывод по первым 200 посетителям.
Четвёртая ошибка — тестировать слишком много гипотез одновременно на разных страницах без общего приоритета, из-за чего команда распыляет трафик на десяток мелких тестов вместо 2-3 значимых. Пятая, менее очевидная — игнорировать сегменты: общий результат теста может скрывать то, что вариант Б выигрывает у новых посетителей, но проигрывает у постоянных клиентов — усреднённый вывод в этом случае вводит в заблуждение.
Как нейросети помогают в A/B-тестировании
Нейросети полезны на двух этапах теста: генерации гипотез и генерации вариантов текста для теста. Вместо того чтобы придумывать гипотезы вручную, можно скормить ИИ данные о продукте, портрете клиента и текущей конверсии и попросить предложить 5-10 гипотез с обоснованием и ожидаемым приоритетом — подробный разбор такого подхода есть в статье генерация гипотез для CRO с помощью нейросетей.
Для самого процесса тестирования — от выбора инструмента до интерпретации результатов — полезен разбор в статье как нейросети помогают в A/B-тестировании.
Чек-лист запуска теста
Перед запуском любого A/B-теста стоит пройти короткий чек-лист: гипотеза сформулирована по шаблону «если-то-потому что»; трафика достаточно для расчётного размера выборки; тест меняет только одну переменную; заранее определён срок остановки и метрика успеха; результаты не будут анализироваться раньше запланированного срока, независимо от того, насколько «очевидна» разница на третий день.
После завершения теста полезно зафиксировать результат не только числом («вариант Б дал +18% к конверсии»), но и выводом о клиенте («аудитория реагирует на социальное доказательство сильнее, чем на скидку») — именно такие выводы накапливаются в базу знаний команды и делают каждый следующий тест точнее предыдущего, а не превращают тестирование в бесконечный перебор случайных идей.
Хороший A/B-тест отвечает не только «какой вариант лучше», но и «почему» — если гипотеза была верной, вы получаете не просто выигравший вариант, а подтверждённое понимание аудитории, которое пригодится в следующих тестах.
Частые вопросы
Зависит от текущей конверсии и ожидаемого эффекта — чем они ниже, тем больше нужно посетителей. Для точного числа лучше использовать калькулятор размера выборки, а не ориентироваться на «пару недель теста».
Можно, но тогда это уже многовариантный тест (A/B/n или мультивариантное тестирование), и для него нужно ещё больше трафика, а интерпретация результата сложнее — сложно понять, какое именно изменение дало эффект.
Считать, что значимого различия между вариантами нет, и не делать вывод в пользу одного из них. Можно либо продлить тест при наличии трафика, либо признать эффект изменения незначительным и переключиться на другую гипотезу.
Ранние результаты часто нестабильны и могут выровняться или даже поменяться местами к концу теста — остановка «по ощущению» резко повышает риск ложного вывода, который потом закладывают в постоянные изменения сайта.
Плохо подходит — набор статистически значимой выборки займёт слишком много времени. В таких случаях эффективнее качественные методы: интервью с клиентами, юзабилити-тесты с небольшой группой, экспертный аудит.
Внедряйте нейросети в маркетинг вместе с нами
В комьюнити 400+ маркетологов делятся кейсами и туториалами по Claude Code, Яндекс.Директ, автоматизации и другим инструментам.
Вступить бесплатно