A/B-тестирование: как проводить правильно | AI-Mrkt
AI
AI Marketing Community
Вступить бесплатно
Главная/Блог/Аналитика
Аналитика · 10 мин чтения

A/B-тестирование: как проверять гипотезы, а не гадать

A/B-тестирование — способ сравнить два варианта страницы, текста или рассылки на реальных пользователях и выбрать тот, что работает лучше, вместо того чтобы полагаться на вкус команды. Разбираем, как ставить гипотезы, считать выборку и не попасть в статистическую ловушку.

Что такое A/B-тест

В A/B-тесте часть трафика случайным образом видит вариант А (контрольный, «как сейчас»), а другая часть — вариант Б (с изменением). После набора достаточного количества пользователей сравнивают ключевую метрику — конверсию, клики, время на странице — и делают вывод, какой вариант работает лучше и с какой уверенностью.

Ключевое слово — «случайным образом»: если вариант Б показывать только новым посетителям, а вариант А — постоянным, разница в результатах может объясняться не самим изменением, а разницей в аудитории. Корректное разделение трафика — основа всего теста.

Название метода отсылает к простому сравнению двух вариантов, но на практике встречаются и более сложные форматы: A/B/n-тест сравнивает сразу несколько вариантов одновременно, а мультивариантное тестирование (MVT) проверяет комбинации из нескольких элементов сразу — например, заголовка и картинки в разных сочетаниях. Для большинства задач маркетолога простого A/B-теста достаточно, а более сложные форматы требуют заметно больше трафика.

Когда A/B-тест нужен, а когда — нет

A/B-тестирование требует достаточного трафика и достаточного числа конверсий, чтобы результат был статистически надёжным, а не случайным. На сайте с 200 посетителями в месяц тест изменения кнопки может идти полгода и не набрать значимости — в такой ситуации лучше полагаться на качественные методы: CustDev-интервью, юзабилити-тестирование с 5-8 людьми, экспертную оценку.

Тестировать стоит изменения, которые реально могут повлиять на метрику — заголовок, оффер, структуру формы, цену. Тестировать оттенок серого цвета текста — почти всегда трата ресурсов, если только речь не идёт о крупном e-commerce с миллионами посетителей, где даже минимальный эффект окупается объёмом.

Хороший ориентир перед запуском — прикинуть, сколько конверсий у вас случается в неделю сейчас. Если их меньше 50-100 в неделю, тест любого некрупного изменения будет идти неоправданно долго — в такой ситуации разумнее сосредоточиться на более крупных гипотезах, где ожидаемый эффект измеряется не единицами процентов, а десятками.

Как сформулировать гипотезу

Гипотеза для A/B-теста должна быть конкретной и проверяемой, а не «попробуем и посмотрим». Рабочий шаблон:

Если [изменение], то [ожидаемый эффект],
потому что [объяснение механизма, почему это должно сработать].

Пример: Если добавить на лендинг блок с отзывами прямо под оффером,
то конверсия в заявку вырастет на 10-15%,
потому что пользователи на этапе решения испытывают недоверие к новому бренду,
а социальное доказательство снижает этот барьер.

Формулировка «потому что» — не формальность: она заставляет опираться на реальную боль или барьер аудитории, а не тестировать изменения наугад. Барьеры для гипотез часто находят в карте пути клиента — там же, где искали эмоции и препятствия на разных этапах воронки.

Хорошая практика — вести общий список гипотез в таблице с оценкой ожидаемого эффекта и трудозатрат на реализацию, и тестировать в первую очередь то, что даёт наибольший потенциальный эффект при наименьших усилиях. Так тестирование превращается в приоритизированную очередь, а не в хаотичный набор случайных идей от разных членов команды.

Как рассчитать размер выборки и длительность теста

Размер выборки зависит от текущей конверсии, ожидаемого эффекта и желаемой уверенности в результате (обычно 95%). Упрощённый пример расчёта:

Текущая конверсияОжидаемый приростПримерный размер выборки на вариант
2%+20% (до 2.4%)~40 000 посетителей
5%+20% (до 6%)~15 000 посетителей
10%+15% (до 11.5%)~8 000 посетителей

Чем ниже исходная конверсия и чем меньше ожидаемый эффект, тем больше нужно трафика — это одна из причин, почему A/B-тесты небольших изменений на низкоконверсионных страницах требуют огромных объёмов посетителей. Точный расчёт удобно делать через готовые калькуляторы размера выборки — вручную это скорее оценка порядка величины, чем точная цифра.

Длительность теста должна охватывать минимум один полный бизнес-цикл — обычно 1-2 недели, чтобы захватить и будни, и выходные, и разные дни зарплаты, если это влияет на покупки.

Статистическая значимость простыми словами

Статистическая значимость показывает, насколько вероятно, что разница между вариантами А и Б — не случайность, а реальный эффект изменения. Порог 95% значимости означает: если повторить тест 100 раз, в 95 случаях вы увидели бы такую же разницу, и только в 5 — она оказалась бы случайной. Большинство инструментов A/B-тестирования считают этот показатель автоматически и показывают его прямо в интерфейсе, поэтому вручную считать формулы обычно не приходится — важно лишь правильно интерпретировать готовую цифру.

ВажноЗначимость 95% — не гарантия, а вероятность. Даже при таком пороге в 1 случае из 20 вывод теста может быть ошибочным — поэтому важные решения проверяют повторным тестом, а не одним запуском.

Помимо значимости, стоит смотреть и на доверительный интервал — диапазон, в котором с заданной вероятностью находится реальный эффект. Формулировка «конверсия выросла на 12%» звучит убедительно, но если доверительный интервал широкий (например, от 2% до 22%), уверенности в точной цифре гораздо меньше, чем кажется на первый взгляд — это стоит учитывать при планировании следующих шагов на основе результата теста.

Частые ошибки A/B-тестирования

Самая частая ошибка — «подглядывание»: смотреть промежуточные результаты каждый день и останавливать тест, как только видна разница в нужную сторону. Это резко повышает риск ложноположительного вывода — ранние колебания часто выравниваются к концу расчётного периода.

Вторая ошибка — тестировать сразу несколько изменений в одном варианте (новый заголовок + новая кнопка + новая картинка), а потом не понимать, что именно сработало. Третья — запускать тест на слишком короткий срок, не дожидаясь полного цикла и статистической значимости, и делать вывод по первым 200 посетителям.

Четвёртая ошибка — тестировать слишком много гипотез одновременно на разных страницах без общего приоритета, из-за чего команда распыляет трафик на десяток мелких тестов вместо 2-3 значимых. Пятая, менее очевидная — игнорировать сегменты: общий результат теста может скрывать то, что вариант Б выигрывает у новых посетителей, но проигрывает у постоянных клиентов — усреднённый вывод в этом случае вводит в заблуждение.

Как нейросети помогают в A/B-тестировании

Нейросети полезны на двух этапах теста: генерации гипотез и генерации вариантов текста для теста. Вместо того чтобы придумывать гипотезы вручную, можно скормить ИИ данные о продукте, портрете клиента и текущей конверсии и попросить предложить 5-10 гипотез с обоснованием и ожидаемым приоритетом — подробный разбор такого подхода есть в статье генерация гипотез для CRO с помощью нейросетей.

Для самого процесса тестирования — от выбора инструмента до интерпретации результатов — полезен разбор в статье как нейросети помогают в A/B-тестировании.

Чек-лист запуска теста

Перед запуском любого A/B-теста стоит пройти короткий чек-лист: гипотеза сформулирована по шаблону «если-то-потому что»; трафика достаточно для расчётного размера выборки; тест меняет только одну переменную; заранее определён срок остановки и метрика успеха; результаты не будут анализироваться раньше запланированного срока, независимо от того, насколько «очевидна» разница на третий день.

После завершения теста полезно зафиксировать результат не только числом («вариант Б дал +18% к конверсии»), но и выводом о клиенте («аудитория реагирует на социальное доказательство сильнее, чем на скидку») — именно такие выводы накапливаются в базу знаний команды и делают каждый следующий тест точнее предыдущего, а не превращают тестирование в бесконечный перебор случайных идей.

Хороший A/B-тест отвечает не только «какой вариант лучше», но и «почему» — если гипотеза была верной, вы получаете не просто выигравший вариант, а подтверждённое понимание аудитории, которое пригодится в следующих тестах.

Частые вопросы

Сколько нужно трафика для A/B-теста?

Зависит от текущей конверсии и ожидаемого эффекта — чем они ниже, тем больше нужно посетителей. Для точного числа лучше использовать калькулятор размера выборки, а не ориентироваться на «пару недель теста».

Можно ли тестировать несколько изменений одновременно?

Можно, но тогда это уже многовариантный тест (A/B/n или мультивариантное тестирование), и для него нужно ещё больше трафика, а интерпретация результата сложнее — сложно понять, какое именно изменение дало эффект.

Что делать, если результаты теста статистически не значимы?

Считать, что значимого различия между вариантами нет, и не делать вывод в пользу одного из них. Можно либо продлить тест при наличии трафика, либо признать эффект изменения незначительным и переключиться на другую гипотезу.

Почему нельзя останавливать тест раньше срока, если разница уже видна?

Ранние результаты часто нестабильны и могут выровняться или даже поменяться местами к концу теста — остановка «по ощущению» резко повышает риск ложного вывода, который потом закладывают в постоянные изменения сайта.

Подходит ли A/B-тест для сайта с низким трафиком?

Плохо подходит — набор статистически значимой выборки займёт слишком много времени. В таких случаях эффективнее качественные методы: интервью с клиентами, юзабилити-тесты с небольшой группой, экспертный аудит.

Внедряйте нейросети в маркетинг вместе с нами

В комьюнити 400+ маркетологов делятся кейсами и туториалами по Claude Code, Яндекс.Директ, автоматизации и другим инструментам.

Вступить бесплатно

Читайте дальше