Оплатить курс
ИИretentionаналитикаCMO

Прогноз оттока: как ML-модель предсказывает, кто уйдёт, за 30 дней до этого

Александр Петров
11 мин чтения

Модель прогноза оттока (churn prediction model) — это алгоритм машинного обучения, который на основе поведения клиента (частота покупок, активность, обращения в поддержку, изменение чека) присваивает каждому клиенту вероятность ухода в ближайший период, обычно 30–90 дней. В отличие от churn rate, который считает отток постфактум, модель churn prediction работает на опережение: она указывает конкретных клиентов из вашей базы, которые с высокой вероятностью уйдут, до того как они перестанут платить. Это превращает удержание из реактивной функции поддержки в управляемый процесс с бюджетом и P&L.

Разница на цифрах: если вы посчитали churn rate 5,4% за месяц (о том, как это сделать корректно, — в статье про расчёт churn rate), вы знаете, что потеряли клиентов постфактум. Модель прогноза оттока даёт список из 200–400 клиентов сегодня, с вероятностью ухода 70%+ в следующие 30 дней — и время среагировать до того, как они перестанут платить.

Чем прогноз оттока отличается от расчёта churn rate

Churn rate — это диагностика: агрегированный процент ушедших клиентов за период. Модель прогноза оттока — это прогноз на уровне конкретного клиента, до факта ухода. Первое отвечает на вопрос «сколько мы теряем», второе — «кого именно мы потеряем через месяц и почему».

Churn rate вы считаете постфактум, обычно раз в месяц, по формуле: число ушедших клиентов за период, разделённое на число клиентов на начало периода. Это полезная метрика для отчёта совету директоров, но она не даёт инструмента действия — цифра 5% ничего не говорит про то, кого конкретно спасать. Модель прогноза оттока строится на исторических данных о том, как вели себя клиенты перед уходом в прошлом, и применяет эту закономерность к текущей базе в режиме реального времени или еженедельного пересчёта.

На практике эти два инструмента работают в связке: churn rate — метрика для контроля тренда и отчётности, модель прогноза оттока — операционный инструмент для retention-команды. Без базового понимания churn rate модель прогноза оттока не с чем сверять: она должна снижать именно ту метрику, которую вы уже умеете считать.

Как работает ML-модель прогноза оттока

Модель прогноза оттока — это классификатор, который на входе получает набор признаков поведения клиента, а на выходе выдаёт число от 0 до 1 — вероятность оттока в заданный горизонт. Она обучается на исторических данных: берётся выборка клиентов, которые ушли, и клиентов, которые остались, и алгоритм ищет закономерности, отличающие первых от вторых.

Процесс укрупнённо состоит из четырёх этапов:

  • Сбор и разметка данных. Из CRM, биллинга и продуктовой аналитики выгружается история поведения клиентов за 6–18 месяцев с меткой «ушёл / остался» на конкретную дату отсечки.
  • Построение признаков (feature engineering). Сырые события (визиты, покупки, обращения) превращаются в измеримые переменные: частота покупок за 30/60/90 дней, тренд среднего чека, дни с последней активности, число обращений в поддержку.
  • Обучение и валидация. Модель обучается на одной части выборки и проверяется на другой, которую она не видела, чтобы избежать переобучения — ситуации, когда модель запоминает частности обучающих данных вместо реальной закономерности.
  • Скоринг и обновление. Обученная модель применяется к текущей базе клиентов на регулярной основе — раз в сутки или раз в неделю, — и каждому клиенту присваивается актуальный churn score.

Логика похожа на скоринг лидов в продажах, только вектор развёрнут в обратную сторону: там модель ищет, кто с высокой вероятностью купит, здесь — кто с высокой вероятностью уйдёт. Принципы работы с вероятностными скорами в целом пересекаются с подходами, описанными в статье про ИИ-скоринг лидов.

Какие данные нужны для модели прогноза оттока

Модели прогноза оттока нужны минимум три типа данных: транзакционные (что и когда покупал клиент), поведенческие (как клиент взаимодействует с продуктом или сайтом) и сервисные (обращения в поддержку, жалобы, возвраты). Без истории минимум за 6–12 месяцев по репрезентативной выборке ушедших клиентов модель не сможет найти устойчивую закономерность.

Типичный набор признаков, которые входят в модель:

КатегорияПримеры признаковИсточник данных
ТранзакционныеДни с последней покупки, частота заказов, динамика среднего чекаCRM, биллинг, 1С
ПоведенческиеЧастота визитов, глубина просмотра, использование ключевых функций продуктаGA4, продуктовая аналитика
СервисныеЧисло обращений в поддержку, тональность обращений, возвратыHelpdesk, CRM
Демографические и контрактныеТип тарифа, срок жизни клиента, канал привлеченияCRM
RFM-показателиRecency, Frequency, MonetaryCRM, биллинг

RFM-анализ (recency, frequency, monetary — давность, частота, сумма покупок) часто становится базовым слоем признаков для модели прогноза оттока, потому что эти три переменные уже сами по себе сильно коррелируют с вероятностью ухода. Если вы ещё не сегментировали базу по RFM, это разумная точка входа перед построением полноценной ML-модели — подробнее в статье про RFM-анализ.

Отдельно стоит вопрос обработки персональных данных: транзакционная и поведенческая история клиентов подпадает под требования 152-ФЗ «О персональных данных», и при построении модели нужно соблюдать основания обработки и хранения, а не просто выгружать всё, что есть в CRM.

Какие алгоритмы применяют для прогноза оттока

Для прогноза оттока чаще всего применяют градиентный бустинг (XGBoost, LightGBM, CatBoost), логистическую регрессию и случайный лес — эти алгоритмы дают контролируемую точность на табличных данных без избыточной сложности. Выбор конкретного алгоритма определяется объёмом данных, требованием к интерпретируемости и наличием команды, способной поддерживать модель.

АлгоритмКогда уместенПлюсМинус
Логистическая регрессияМалая база, нужна прозрачность для бизнесаЛегко объяснить, кто и почему в рискеХуже ловит нелинейные закономерности
Случайный лесСредняя база, разнородные признакиУстойчив к шуму в данныхМенее интерпретируем без доп. инструментов
Градиентный бустинг (XGBoost, LightGBM, CatBoost)Крупная база, важна точностьОбычно даёт лучшую точность на табличных данныхТребует больше вычислительных ресурсов и тюнинга
НейросетиОчень большая база, сложные последовательности событийХорошо работает с временными рядами поведенияИзбыточен для большинства среднего бизнеса

Для большинства компаний среднего размера — с базой в десятки тысяч клиентов и историей 1–2 года — градиентный бустинг остаётся оптимальным выбором по соотношению точности и трудозатрат на поддержку. Нейросетевые архитектуры оправданы там, где база исчисляется миллионами клиентов и есть плотная последовательность событий (маркетплейсы, стриминговые сервисы, банки).

Как оценить точность модели прогноза оттока

Точность модели прогноза оттока оценивают не по проценту правильных ответов, а по метрикам precision (доля реально ушедших среди тех, кого модель назвала «в риске») и recall (доля реально ушедших, которых модель поймала). Для бизнеса это переводится в конкретный вопрос: сколько ресурсов retention-команды уходит впустую (низкий precision) и сколько реальных уходов модель пропускает (низкий recall).

Ключевые метрики, которые стоит смотреть при приёмке модели:

  • Precision (точность). Из всех клиентов, помеченных моделью как «уйдут», какая доля действительно ушла. Низкий precision означает, что вы тратите бюджет удержания на клиентов, которые и так остались бы.
  • Recall (полнота). Из всех реально ушедших клиентов, какую долю модель заранее пометила как риск. Низкий recall означает, что модель пропускает реальные уходы.
  • AUC-ROC. Обобщённая метрика способности модели ранжировать клиентов по риску от менее вероятного к более вероятному уходу. Значение выше 0,75 обычно считается рабочим порогом для прикладной модели прогноза оттока.
  • Lift в топ-децили. Во сколько раз концентрация реальных уходов в топ-10% скоринга выше, чем в среднем по базе. Эта метрика ближе всего к бизнес-смыслу: именно с топ-децилью работает retention-команда физически.

Практический ориентир: модель, у которой в топ-10% по churn score сконцентрировано 40–50% всех реальных уходов следующего периода, уже пригодна для операционной работы retention-команды — дальнейшее повышение точности даёт убывающую отдачу относительно затрат на доработку.

Что делать с прогнозом: как встроить его в retention-маркетинг

Прогноз оттока сам по себе не удерживает клиентов — он лишь указывает, на кого направить ограниченный ресурс retention-команды. Ценность модели реализуется только через процесс: сегментацию клиентов по churn score, назначение конкретного действия на каждый сегмент и измерение эффекта этого действия против контрольной группы.

Типичная логика встраивания прогноза в операционный процесс:

  1. Сегментация по риску. Клиенты делятся минимум на три группы: высокий риск (churn score выше 70%), средний (40–70%), низкий (ниже 40%).
  2. Назначение действия на сегмент. Высокий риск — персональный контакт менеджера или таргетированное предложение; средний риск — автоматизированная email/push-цепочка; низкий риск — фоновый мониторинг без активных действий.
  3. Контрольная группа. Часть клиентов из группы риска намеренно не получает вмешательства, чтобы можно было измерить реальный эффект удержания, а не приписать модели заслугу естественного оттока, который случился бы и без действий.
  4. Замер результата. Сравнение фактического оттока в тестовой и контрольной группах через 30–60 дней после вмешательства.

Без контрольной группы легко попасть в ловушку иллюзии эффективности: маркетинг отчитывается о «спасённых» клиентах, часть из которых и так осталась бы. Общие принципы построения такой системы удержания — сегментация, персонализация коммуникации, измерение эффекта — подробно разобраны в статье про retention-маркетинг и удержание клиентов.

Сколько стоит и когда окупается модель прогноза оттока

Стоимость внедрения модели прогноза оттока для среднего бизнеса складывается из работы data-специалиста или подрядчика, интеграции данных и поддержки модели — на горизонте первого запуска это обычно эквивалентно 1–3 месяцам работы одного data-специалиста в зависимости от состояния данных в компании. Окупаемость определяется не точностью модели самой по себе, а стоимостью удержания одного клиента относительно стоимости его привлечения.

Модель экономически оправдана, если выполняются два условия одновременно: LTV удерживаемого клиента существенно выше стоимости вмешательства (скидка, звонок менеджера, персональное предложение), и база достаточно велика, чтобы точечная работа с топ-децилью риска давала заметный эффект на общий churn rate компании. Для компаний с базой в несколько сотен активных клиентов ML-модель зачастую избыточна — там персональная работа менеджера с полным списком клиентов даёт сопоставимый эффект без затрат на разработку. Порог, с которого модель начинает окупаться, обычно связан не с оборотом компании, а с числом активных клиентов и частотой их взаимодействия с продуктом.

Частые ошибки

  • Строят модель без базового учёта churn rate. Если компания не умеет стабильно считать отток постфактум, у неё нет метрики, относительно которой можно проверить, работает ли модель прогноза.
  • Не выделяют контрольную группу при внедрении. Без неё невозможно отличить эффект вмешательства от естественного поведения клиентов, и отчёт о «спасённых» клиентах становится недостоверным.
  • Игнорируют объяснимость модели. Чёрный ящик без понятных причин («клиент в риске из-за падения частоты покупок и роста обращений в поддержку») не даёт retention-команде конкретного действия — только цифру.
  • Обучают модель на слишком коротком периоде. История менее 6 месяцев обычно не содержит достаточно случаев ухода, чтобы модель нашла устойчивую закономерность, а не шум.
  • Забывают про переобучение. Модель с идеальными показателями на обучающей выборке и резким падением точности на новых данных бесполезна в проде — это признак того, что она запомнила частности, а не закономерность.
  • Внедряют модель без процесса действия. Список клиентов с высоким churn score без назначенного сценария коммуникации — это просто отчёт, а не инструмент удержания.
  • Не пересматривают модель регулярно. Поведение клиентов меняется вместе с продуктом, ценами и рынком, и модель, обученная год назад, постепенно теряет точность без переобучения на свежих данных.

FAQ

Что такое churn prediction простыми словами?

Churn prediction — это прогноз, кто из текущих клиентов компании с высокой вероятностью перестанет платить или пользоваться продуктом в ближайший период (обычно 30–90 дней). В отличие от отчёта об оттоке за прошлый месяц, это список конкретных клиентов, для которых ещё есть время на удержание.

Чем модель прогноза оттока отличается от простого сегментирования клиентов по активности?

Ручная сегментация по активности («не заходил 30 дней») использует одно правило и один порог. ML-модель одновременно учитывает десятки признаков и их сочетания, которые в истории действительно предшествовали уходу, что даёт более точное ранжирование клиентов по реальному риску.

Нужна ли модель прогноза оттока небольшому бизнесу?

Для базы в несколько сотен активных клиентов ML-модель обычно избыточна: точечная ручная работа с полным списком клиентов через RFM-сегментацию даёт сопоставимый эффект без затрат на разработку и поддержку модели. Модель окупается там, где база достаточно велика, чтобы персональный охват всех клиентов был физически невозможен.

Какая точность считается хорошей для модели прогноза оттока?

Значение AUC-ROC выше 0,75 обычно считается рабочим порогом для прикладной модели. Более практичный ориентир — концентрация 40–50% реальных уходов в топ-10% клиентов по churn score: этого достаточно, чтобы retention-команда работала эффективно с ограниченным ресурсом.

Можно ли использовать Excel вместо ML-модели для прогноза оттока?

Простую сегментацию по RFM-показателям (давность, частота, сумма покупок) действительно можно вести в Excel или Bitrix24 без ML — и это разумная стартовая точка. Полноценная ML-модель нужна тогда, когда закономерности ухода сложнее одного-двух правил и требуют учёта множества признаков одновременно.

Как часто нужно пересчитывать churn score клиентов?

Частота обновления зависит от цикла взаимодействия с продуктом: для e-commerce с частыми покупками — раз в сутки или раз в неделю, для B2B-подписок с длинным циклом — раз в месяц. Модель без регулярного пересчёта быстро теряет актуальность, потому что поведение клиентов меняется.

Какие данные обязательны для запуска модели прогноза оттока?

Минимально необходимы транзакционная история (даты и суммы покупок), поведенческие данные (активность в продукте или на сайте) и история обращений в поддержку за период не менее 6–12 месяцев с явной меткой, кто из клиентов ушёл, а кто остался.


Если хотите разобраться, как выстроить систему принятия решений на основе данных — от прогноза оттока до полноценной аналитики удержания — в своей компании, а не разбирать это по кусочкам из статей, приглашаем на интенсив Marketing OS: без давления, в своём темпе.