Using Probability to Model Customer Churn and Retention Rates
Table of Contents
Qu'est-ce que le client Churn?
La clientèle, également connue sous le nom d'attrition, mesure le taux auquel les clients cessent de faire affaire avec une entreprise sur une période donnée. C'est une mesure critique pour les entreprises basées sur l'abonnement, les fournisseurs SaaS, les opérateurs de télécommunications et toute organisation qui compte sur des revenus récurrents.
Churn est généralement exprimé en pourcentage : le nombre de clients perdus au cours d'une période divisée par le nombre de clients au début de cette période. Par exemple, si une entreprise commence le mois avec 1 000 clients et perd 50, le taux mensuel de curn est de 5%. Cependant, la curn peut être segmentée davantage – par cohorte de clients, canal d'acquisition, niveau de plan, ou comportement – pour révéler des idées granulaires.
Une analyse efficace de la situation exige de dépasser les simples statistiques descriptives. Modèles de probabilité fournir un cadre de principe pour comprendre pourquoi les clients quittent, prédire qui est susceptible de quitter le prochain et simuler l'impact des initiatives de rétention.Ces modèles transforment les données historiques brutes en prévisions réalisables, permettant des stratégies de rétention proactives plutôt que réactives.
Pourquoi la probabilité? Le cas de la modélisation statistique
Les modèles de probabilité embrassent cette incertitude en quantifiant la probabilité de divers résultats.Ils permettent aux entreprises de répondre à des questions telles que : - Quelle est la probabilité qu'un client spécifique soit toujours actif dans six mois ? ou - Combien de clients d'une nouvelle cohorte resteront après un an ?
Le principal avantage des modèles de probabilité par rapport aux moyennes simples est qu'ils captent l'hétérogénéité entre les clients. Un taux moyen de 5 % peut masquer une grande variation : certains segments de clients peuvent avoir 1 % de courbure tandis que d'autres en ont 20 %.
En outre, les modèles de probabilité permettent prise de décisions prospectives. En adaptant les distributions aux données historiques, les entreprises peuvent simuler les courbes de rétention futures, calculer les probabilités de valeur de vie du client (CLV) et optimiser l'allocation des ressources pour les campagnes de rétention.
Bernoulli et les distributions binômes — La Fondation
Bernoulli Distribution
Le modèle de probabilité le plus simple pour le churn est la distribution Bernoulli. Il modélise un seul client sur une période fixe (par exemple, un mois) comme résultat binaire: le client churns (1) ou reste (0). p, la probabilité de churn. Pour un client, la fonction de masse de probabilité de Bernoulli est:
P(X = 1) = p , P(X = 0) = 1 − p
Si nous supposons que tous les clients ont la même probabilité de churn p, nous pouvons estimer p Cette hypothèse est souvent irréaliste, l'hétérogénéité des clients est la norme. Malgré cette limitation, le modèle Bernoulli sert de base à des approches plus complexes.
Distribution binôme
Lors de l'analyse d'un groupe de n clients, chacun avec la même probabilité de churn p, le nombre de clients qui curn suit une distribution binôme: X ~ Binomial(n, p). Le nombre de clients pressés attendu est np, et la variation est np(1 − p Cette distribution est utile pour prédire la croissance globale sur une cohorte.
Par exemple, si vous embarquez à bord 200 nouveaux clients en un mois et que votre probabilité de rétention par mois est de 0,95, vous vous attendez à 10 à battre (200 × 0,05 = 10). La distribution Binomial fournit également un intervalle de confiance : avec une probabilité de 95 %, le nombre de clients pressés va tomber entre 5 et 16 (approximation).
Dans la pratique, l'hypothèse de la p La plupart des clients sont détendus en introduisant des covariables au niveau du client (p. ex. fréquence d'utilisation, tickets de soutien, durée du contrat) par régression logistique. modèle de régression logistique, un type de modèle linéaire généralisé qui cartographie les variables indépendantes à une probabilité de curn via une fonction logistique. La régression logistique est largement utilisée dans la prédiction de curn parce qu'elle est interprétable et échelle efficacement.
Modèles de chaînes Markov — Comptabilisation des dépendances de l'État
Les relations client évoluent souvent à travers plusieurs états (actifs, dormants, houleux, peut-être réactivés).Une chaîne Markov modélise les transitions entre ces états discrets sur des étapes de temps discrètes. La propriété définissante : la probabilité de passer à un état futur dépend uniquement de l'état actuel, et non de l'historique de la façon dont le client est arrivé là (la propriété Markov).
Considérez un modèle simple à trois états :
- En cours — le client utilise le service.
- Risque — le client a réduit son utilisation ou a présenté des signes d'avertissement.
- Crûrés — le client a annulé.
Une matrice de transition spécifie les probabilités de passer d'un état à un autre chaque période. Par exemple :
P(Active → Active) = 0,90, P(Active → À risque) = 0,08, P(Active → Grève) = 0,02
P(At‐risk → Active) = 0,15, P(At‐risk → At‐risk) = 0,70, P(At‐risk → Grève) = 0,15
P(Attrait → Attrait) = 1,00 (état absorbant)
Compte tenu de ces probabilités, une chaîne de Markov peut projeter la fraction d'une cohorte de clients dans chaque état sur de nombreuses périodes.Cela est puissant pour prévoir la courbure future et pour évaluer l'impact des programmes de rétention qui déplacent les probabilités de transition (p. ex., réduire la probabilité à risque → pressée par des offres ciblées).
Les chaînes Markov ont été largement appliquées dans les télécommunications, les finances et les soins de santé pour modéliser la migration des clients. Chaînes Markov par J. R. Norris (lien vers Cambridge University Press). Cependant, pour de nombreuses entreprises, l'hypothèse que l'état suivant dépend uniquement de l'état actuel peut être trop restrictive. Des extensions comme les modèles Markov cachés (HMM) permettent des états non observés qui influencent les décisions de curn.
Analyse de survie — Temps de modélisation jusqu'à Churn
L'analyse de survie, aussi connue sous le nom d'analyse d'événements-temps, modélise le temps jusqu'à ce qu'un événement (churn) se produise. Elle est largement utilisée dans la recherche médicale, la fiabilité de l'ingénierie et de plus en plus dans l'analyse des clients.
Les concepts clés sont les suivants :
- Fonction de survie S(t): la probabilité qu'un client n'ait pas pressé par le temps t- Oui.
- Fonction de danger h(t): la vitesse instantanée de la courbure à la fois t, sous réserve d'avoir survécu jusqu'à ce moment.
- Censurage: les clients qui n'ont pas cogné à la fin de la période d'observation (cension droite) ou qui ont été perdus dans le suivi.
L'estimateur Kaplan‐Meier fournit une estimation non paramétrique de la fonction de survie d'un échantillon. C'est une fonction par étapes qui diminue à chaque heure de courbure observée. Par exemple, une courbe Kaplan‐Meier pour une cohorte pourrait montrer que 80 % des clients survivent jusqu'au mois 6, 60 % au mois 12 et 40 % au mois 18.
Pour intégrer les caractéristiques du client (p. ex. âge, type de plan, utilisation), le modèle de risque proportionnel Cox est le cheval de bataille. Il suppose que le rapport de risque entre deux clients est constant au fil du temps (risques proportionnels). Le modèle produit un rapport de risque pour chaque covariable, indiquant combien il multiplie le risque de base. Par exemple, avoir un compte de ticket de soutien élevé pourrait doubler le risque (rapport de risque = 2,0), ce qui signifie que les clients se battent deux fois plus vite.
Les modèles de survie sont particulièrement utiles pour prédire la probabilité de curn à n'importe quel horizon futur, et pour prioriser les efforts d'intervention. Livre de Springer sur l'analyse de survie par Kleinbaum et Klein.
Modèles avancés: BTYD et Pareto/NBD
Pour les paramètres non contractuels (commerce électronique, vente au détail, médias), les clients peuvent se battre à tout moment et souvent ne pas annuler formellement. Les méthodes de survie standard sont moins appropriées parce que l'événement --churn-- Acheter jusqu'à ce que tu meures (BTYD) famille ont été développés.
Le modèle Pareto/NBD (Schmittlein, Morrison, Colombo, 1987) suppose que chaque client a un -lifetime - et que pendant cette durée, ils font des achats selon un processus Poisson. Le modèle estime la probabilité qu'un client soit encore vivant compte tenu de son historique d'achat. Il produit des mesures comme les achats futurs attendus et la probabilité d'être actif.
Une variante plus efficace en calcul est le modèle Beta‐Géometric/NBD (BG/NBD), qui remplace la distribution exponentielle à vie par une distribution géométrique. Les deux modèles sont disponibles dans les paquets R ( et ) et peuvent être appliqués aux données de transaction individuelle du client.
Ces modèles sont particulièrement utiles pour segmenter les clients sur un continuum de -----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
Un examen complet des modèles de BTYD peut être trouvé dans cet article AMA sur la modélisation de la valeur au cours de la vie du client.
Étapes pratiques de mise en œuvre
Pour appliquer des modèles de probabilité à la fissuration et à la rétention, suivez les étapes suivantes :
- Collecte de données & Nettoyage — Recueillir des données sur les clients historiques: dates d'inscription, registres des transactions, interactions de soutien, changements de plan, et si elles ont éventuellement été écrasées.
- Définir la période de modélisation — Choisir une granularité du temps (mensuelle, hebdomadaire) en fonction de la cadence des affaires.
- Sélectionnez la famille de modèles Pour la dynamique multi-états, utilisez les chaînes Markov. Pour le temps à l'événement avec censure, utilisez l'analyse de survie (Kaplan‐Meier + Cox). Pour les données non contractuelles, utilisez BG/NBD ou Pareto/NBD.
- Ingénierie des fonctions — Créer des caractéristiques qui capturent la réactivité, la fréquence, la valeur monétaire (FMR), ainsi que des signaux comportementaux (fréquence de connexion, tickets de soutien, scores d'enquête).
- Formation du modèle & Validation Pour les modèles de survie, utiliser l'indice de concordance (indice C) pour évaluer la discrimination. Pour les modèles binaires, utiliser l'ASC, la précision ou les courbes de levage. Valider que les prédictions du modèle sont calibrées (probabilités prédictives correspondent aux taux observés).
- Déployer & Loi — Démarrage des clients actuels avec le modèle.
- Surveiller & Iterate — Recycler les modèles périodiquement (trimestrielment) au fur et à mesure que le comportement du client évolue. Suivre la pression réelle par rapport aux prédictions pour détecter la dégradation.
Limites et pièges
Les modèles de probabilité sont puissants, mais ils ne sont pas des boules de cristal. Plusieurs pièges communs peuvent saper leur utilité:
- Ignorer les facteurs externes — Les changements économiques à l'échelle du marché, les actions des concurrents ou les événements saisonniers peuvent modifier de façon spectaculaire les schémas de rotation qu'un modèle formé à partir de données historiques ne peut prévoir.
- Surmonter — L'inclusion de trop de caractéristiques ou de modèles trop complexes (par exemple, l'apprentissage profond avec de petites données) peut capter le bruit plutôt que le signal réel.
- Changements dans les définitions — Si la définition de ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
- Non-stationnement — Le comportement du client peut changer au fil du temps (par exemple, en raison d'une mise à jour de produit).
- Considérations éthiques — L'utilisation de modèles de probabilité pour cibler la rétention avec des réductions ou des offres spéciales doit être faite de manière transparente.
Conclusion
Les modèles de probabilité fournissent une base rigoureuse pour comprendre, prédire et gérer le rythme et la rétention des clients. À partir de modèles simples Bernoulli et Binomial, les entreprises peuvent rapidement estimer le rythme de la cohorte. L'ajout de régression logistique permet de marquer les risques au niveau individuel. Les chaînes Markov capturent les transitions d'état au fil du temps, tandis que l'analyse de survie modélise explicitement le temps d'attente jusqu'à la période de la crise.
En transformant les estimations de probabilité en stratégies de rétention ciblées, les entreprises peuvent réduire la pression, augmenter la valeur de vie des clients et établir des relations plus durables. L'infrastructure de données s'améliore et les coûts de calcul diminuent, ces techniques deviennent accessibles aux organisations de toutes tailles. Investir dans une vision probabiliste du comportement des clients n'est pas seulement un exercice technique.