В логистике мобильное приложение стало частью самого сервиса. Кроме скорости и стоимости доставки пользователь оценивает и то, насколько быстро удается оформить отправление, найти пункт выдачи или оплатить заказ. Чтобы понимать, какие изменения в цифровом опыте клиента действительно работают, продуктовые команды используют A/B-тестирование. О том, как этот инструмент устроен внутри «СДЭК» и какой экономический эффект он приносит, я, руководитель продукта CDEK Super App Максим Кайнер, расскажу в статье.

Как устроено A/B-тестирование
Двум группам пользователей одновременно показывают разные варианты одного экрана и измеряют, какой даёт лучший результат. Инструмент не привязан к конкретной отрасли — аналогичные эксперименты проводят и в электронной коммерции, финансовых сервисах и медиа.
На практике каждому участнику эксперимента присваивается идентификатор, определяющий, в какую группу он попал:
- Группа «А» видит текущую версию интерфейса без каких-либо изменений.
- Группа «Б» получает обновленный вариант, который команда хочет протестировать.
Распределение случайное — именно это и гарантирует однородность выборок по полу, возрасту, частоте заказов и другим параметрам. Благодаря этому разница в метриках объясняется новым дизайном, а не составом групп. В СДЭК такие тесты запускают и на сайтах, и в мобильном приложении.
В группах обычно участвуют сотни тысяч пользователей, а сам тест длится около двух недель, в редких случаях — месяц. Статистическую достоверность результата определяют с помощью стандартных калькуляторов на основе критериев Пирсона или Стьюдента в зависимости от типа проверяемой метрики.
При этом каждый эксперимент уникален. Команда не повторяет тесты одного и того же экрана, а проверяет разные элементы: способы отображения тарифов в форме заказа, контент в неавторизованной зоне сайта, карту пунктов выдачи.
Откуда берутся гипотезы и что именно тестируют
Перед началом эксперимента важно сформулировать гипотезу — какую конкретную метрику улучшит изменение и почему. Идеи рождаются из двух типов исследований:
- Проактивные — когда команда сама ищет респондентов и общается с ними.
- Реактивные — когда пожелания к продукту приходят из обратной связи.
Дополнительный источник — анализ поведенческих метрик. Например, времени, которое пользователь проводит на каждом этапе воронки. Именно глубокое изучение собственного сервиса, аудитории и рынка помогает находить гипотезы для тестирования.
Важнейший источник информации — обращения клиентов и отзывы. Данные от службы поддержки и поведенческая аналитика тоже ценны, однако здесь есть нюанс: команда неизбежно считывает их сквозь призму собственной экспертизы, а это может искажать картину.
Также важно разграничивать продуктовые и рыночные барьеры, чтобы не вкладывать ресурсы в тесты, где интерфейс ни на что не влияет. Рынок логистики далек от монополии, и клиенты сравнивают тарифы у нескольких перевозчиков. Выбирают того, кто в конкретной ситуации выигрывает по сочетанию цены, географии, сроков и параметров груза. А это значит, что изменение интерфейса в данной ситуации не повлияет на решение клиента.
Как оценить результаты и перевести их в экономический эффект
Набор ключевых показателей (KPI) всегда определяется проверяемой гипотезой. В продукте SuperApp в СДЭК основной фокус приходится на коэффициент конверсии из трафика приложения в онлайн-заказ. Дополнительно отслеживается выручка от проданных услуг. Параллельно команда проводит эксперименты, нацеленные на продуктовые метрики — например, на скорость заполнения формы отправления.
Допустим, по каждому десятому заказу поступают обращения в поддержку. Если сократить их объем на 10%, средние затраты на сопровождение одного отправления снизятся на 1%. В масштабах компании с миллионами доставок даже такая доля превращается в ощутимую экономию. Тот же принцип работает и в обратную сторону: рост конверсии хотя бы на десятые доли процента при большом трафике транслируется в дополнительные продажи, которые легко пересчитать в рублях.
Косвенно команда видит подтверждение эффекта в динамике средних оценок качества сервиса. Хоть этот показатель и складывается из множества факторов и не может служить прямым доказательством, его устойчивый рост совпадает с периодами активного тестирования. В рамках каждого отдельного эксперимента прирост целевых метрик становится индикатором того, что опыт пользователя улучшается.
Один из недавних примеров: на главном экране клиентского приложения СДЭК подсветили выгодность аренды самокатов через партнера, предложившего уникальную скидку. Специалисты рассчитывали на прирост конверсии в переход к воронке аренды не менее чем на 10%, а по итогам A/B-теста получили рост более 53%. Часть эффекта сохранилась и в сквозном коэффициенте конверсии — выросло само число продаж.
Другой кейс связан не с выручкой, а с издержками. Команда улучшила процесс согласования времени приезда курьера. Пользователи получили интерфейс для самостоятельного переноса времени на определенном этапе, что снизило нагрузку на линию поддержки, которая раньше принимала такие заявки вручную. Для подобных гипотез в СДЭК используют не A/B-тесты, а анализ когорт — он лучше подходит для оценки эффекта на операционные затраты. В совокупности такие изменения дают мультимиллионный финансовый эффект в пересчете на год.
Когда тест не подтверждает гипотезу, и где проходят границы экспериментов
Неподтвержденная гипотеза — нормальный и даже более вероятный итог эксперимента, чем удачный. Так, при тестировании вариантов отображения тарифов в форме заказа команда ожидала повлиять на долю отправлений с более срочным тарифом и, как следствие, на средний чек. Однако после нескольких недель эксперимента стало ясно, что способ подачи тарифов на эти метрики не влияет. Бывает и обратная ситуация: продуктовая метрика улучшается, но при пересчете выясняется, что финансового эффекта нет. Такие метрики команда старается исключать из будущих гипотез.
Кроме того, во многих случаях сильно улучшить ключевые метрики лишь за счет изменения интерфейса практически невозможно. Например, если целевое действие команды — оплата заказа, то повлиять на конверсию исключительно дизайном сегодня сложно: большинство крупных интернет-сервисов уже обеспечивают высокий уровень клиентского опыта.
При проектировании экспериментов СДЭК исходит из простого правила: тест не должен навредить пользователю. Если новый вариант несет риск критически ухудшить опыт для группы «Б», команда выбирает альтернативный формат. Это может быть фокус-группа или экспресс-тест на небольшой выборке добровольцев, когда прототип показывают случайным сотрудникам или знакомым и собирают обратную связь до выхода на реальную аудиторию.
Еще одно практическое ограничение связано со сроками. Перед запуском необходимо рассчитать требуемый объем выборки, и если для статистически достоверного результата понадобится больше месяца, специалисты ищут другой способ подтвердить или опровергнуть гипотезу.
Так, A/B-тестирование превращает развитие цифрового сервиса из интуитивного процесса в управляемый. Каждое подтвержденное улучшение интерфейса может снизить операционные затраты компании и сделать путь клиента проще.
Читайте также: Сервисы аналитики для маркетплейсов: 5 инструментов, которые поднимают продажи