Research & Evidence

Rechercher une méthode

Recherchez parmi les titres, les questions, les territoires et les identifiants MSC.

41 résultats
  1. MSC-P-001Comment transformer une affirmation marketing en question testable ?Science de la décision↗
  2. MSC-P-002Corrélation ou causalité : que permet réellement d’affirmer une analyse ?Mesure marketing↗
  3. MSC-P-003Comment exprimer l’incertitude d’un résultat marketing ?Science de la décision↗
  4. MSC-P-004Significativité ou taille d’effet : quel résultat faut-il interpréter ?Science de la décision↗
  5. MSC-P-005Comment mesurer un construit marketing qui n’est pas directement observable ?Études de marché↗
  6. MSC-P-006Comment concevoir puis valider une échelle de mesure ?Études de marché↗
  7. MSC-P-007Alpha ou oméga : comment évaluer la fiabilité d’une échelle ?Études de marché↗
  8. MSC-P-009ACP, AFE ou AFC : quelle méthode choisir ?Études de marché↗
  9. MSC-P-010Quand faut-il mener une expérience marketing ?Mesure marketing↗
  10. MSC-P-011Comment concevoir un A/B test qui estime réellement un effet ?Mesure marketing↗
  11. MSC-P-012De combien d’observations une expérience a-t-elle besoin ?Science de la décision↗
  12. MSC-P-013Comment mesurer l’effet incrémental d’une campagne avec un groupe témoin ?Mesure marketing↗
  13. MSC-P-017Comment détecter sélection, contamination et attrition dans une expérience ?Mesure marketing↗
  14. MSC-P-018Régression prédictive ou causale : qu’essaye-t-on d’estimer ?Modèles marketing↗
  15. MSC-P-019Comment diagnostiquer une régression marketing avant de l’interpréter ?Modèles marketing↗
  16. MSC-P-022Comment estimer une élasticité-prix et son incertitude ?Science des prix↗
  17. MSC-P-026Logit vs Probit : comment choisir pour une probabilité d’achat ?Science client↗
  18. MSC-P-029Quels clients présentent la probabilité de churn la plus élevée ?Science client↗
  19. MSC-P-027TAM, UTAUT ou UTAUT2 : quel cadre pour étudier l’acceptation d’une technologie ?Études de marché↗
  20. MSC-H-001Mesure et causalité : comment établir un effet marketing ?Mesure marketing↗
  21. MSC-H-002Modèles de réponse marketing : forme, délai et saturationModèles marketing↗
  22. MSC-H-003Science des prix : relier prix, demande et contributionScience des prix↗
  23. MSC-H-004Science client et choix : comportement, valeur et hétérogénéitéScience client↗
  24. MSC-H-005Science de la mesure : construire des indicateurs validesÉtudes de marché↗
  25. MSC-H-006Méthodes statistiques de décision : choisir, quantifier, validerScience de la décision↗
  26. MSC-P-008Comment valider une échelle de mesure marketing ?Études de marché↗
  27. MSC-P-014Comment concevoir une expérience géographique marketing ?Mesure marketing↗
  28. MSC-P-015Comment estimer un effet avec une différence-de-différences ?Mesure marketing↗
  29. MSC-P-020Comment traiter l’endogénéité du prix ?Science des prix↗
  30. MSC-P-021Effets fixes ou aléatoires : quel modèle de panel choisir ?Modèles marketing↗
  31. MSC-P-023Comment estimer une fonction de demande ?Science des prix↗
  32. MSC-P-024Comment simuler un scénario prix-volume-marge ?Science des prix↗
  33. MSC-P-028Comment estimer la CLV avec BG/NBD et Gamma-Gamma ?Science client↗
  34. MSC-P-030Comment analyser la rétention avec un modèle de survie ?Science client↗
  35. MSC-P-043Combien vaut un abonné quand on n’a observé que six mois de rétention ?Science client↗
  36. MSC-P-031Comment construire une segmentation client utile ?Science client↗
  37. MSC-P-032Comment tester la stabilité d’une segmentation ?Science client↗
  38. MSC-P-033Comment valider une prévision marketing ?Science de la décision↗
  39. MSC-P-034Comment construire une simulation Monte Carlo pour une décision marketing ?Science de la décision↗
  40. MSC-P-035Comment modéliser saturation et adstock ?Modèles marketing↗
  41. MSC-P-039Quel test statistique choisir ?Science de la décision↗
← Toutes les méthodes
FICHE MÉTHODEMSC-P-032Science clientDossier scientifique vérifié

Comment tester la stabilité d’une segmentation ?

La stabilité évalue si une structure proche réapparaît sous rééchantillonnage, variation de période ou perturbation raisonnable des variables. Elle ne garantit pas l’utilité métier.

Rédaction scientifique : Marketing Science Center

Réponse directe

Comparer des solutions et quantifier la robustesse des affectations.

La stabilité évalue si une structure proche réapparaît sous rééchantillonnage, variation de période ou perturbation raisonnable des variables. Elle ne garantit pas l’utilité métier.

Hennig, 2007Rousseeuw, 1987

01 · PROTOCOLE

Résumé opérationnel

Une segmentation en quatre segments est proposée sur 360 clients. Elle est reconstruite sur 40 rééchantillons tirés avec remise, et le recouvrement de chaque segment est mesuré par l’indice de Jaccard. Le segment le plus faible n’est retrouvé qu’à 0,664749, sous le seuil déclaré de 0,75. Pire : une référence sans structure, obtenue en permutant chaque variable, retrouve ses propres segments à 0,829190, donc mieux que le fichier réel. Verdict : PROPOSED_SEGMENTATION_NOT_STABLE. La solution en trois segments, elle, tient à 0,986949.

02 · PROTOCOLE

Situation marketing concrète

Une direction marketing a reçu d’un prestataire une segmentation en quatre groupes, avec des noms, des personas et un plan d’animation par groupe. Avant d’engager quatre budgets distincts, l’équipe pose une question simple : si l’on refaisait le même travail sur un échantillon légèrement différent des mêmes clients, retrouverait-on ces quatre groupes ? Personne ne demande si les groupes sont vrais. On demande s’ils tiennent.

03 · PROTOCOLE

Question scientifique

Pour ces 360 clients, ces trois variables déclarées, cette distance déclarée et cette procédure de rééchantillonnage déclarée, chacun des quatre segments proposés réapparaît-il assez souvent pour qu’on puisse lui consacrer un budget ? Et ce niveau de réapparition dépasse-t-il ce qu’un fichier sans aucune structure produirait déjà par le seul effet du rééchantillonnage ? La question ne porte ni sur l’existence des groupes ni sur leur utilité, mais sur leur reproductibilité sous perturbation.

04 · PROTOCOLE

Pourquoi l’approche simple peut échouer

Regarder la solution une seule fois ne dit rien : un algorithme de partition rend toujours le nombre de groupes demandé, et sur un tirage unique ce nombre paraît toujours net. Rejouer le calcul sans changer les données ne dit rien non plus, puisque le départ est déterministe. Et mesurer un recouvrement élevé sans point de comparaison peut tromper complètement : sur ce fichier, la référence sans structure atteint 0,829190 à quatre segments, un chiffre qu’on lirait volontiers comme une preuve de solidité s’il n’était pas confronté à autre chose.

05 · PROTOCOLE

Intuition de la méthode

L’idée tient en une phrase : on perturbe le fichier, on refait exactement le même travail, et on regarde ce qui revient. Chaque perturbation est un rééchantillon tiré avec remise, de même taille que le fichier. Après chaque reconstruction, tous les clients d’origine sont réaffectés aux nouveaux centres, si bien que les deux découpages portent sur les mêmes personnes et se comparent sans artifice. Un segment d’origine reçoit alors le meilleur recouvrement qu’il obtient face aux segments reconstruits. Le tout est mesuré une seconde fois sur une référence sans structure, pour savoir ce que le bruit seul produit.

06 · PROTOCOLE

Données nécessaires

Sont figés avant toute lecture : l’identifiant client ordonné sans trou, la récence, la fréquence, le panier moyen, les transformations déclarées, la standardisation, la distance, le départ déterministe, les nombres de segments examinés (2, 3 et 4), le nombre proposé (4), les 40 rééchantillons, la récurrence arithmétique qui les produit, la référence sans structure et les deux seuils. Le fichier scellé contient 360 clients. Le cas est synthétique et déclaré comme tel.

07 · PROTOCOLE

Modèle formel et symboles

Chaque client est un vecteur de trois coordonnées standardisées : logarithme de la récence, fréquence, logarithme du panier. La distance est euclidienne au carré et un segment regroupe les clients plus proches de leur centre que de tout autre. Le recouvrement d’un segment S par un segment reconstruit R est l’indice de Jaccard, soit le nombre de clients communs divisé par le nombre de clients appartenant à l’un ou à l’autre. Les rééchantillons proviennent d’une récurrence déclarée : l’état suivant vaut (1103515245 × état + 12345) modulo 2^31, et le client tiré est l’état modulo le nombre de clients.

08 · PROTOCOLE

Calcul déclaré

Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ; transformer et standardiser les trois variables sur l’ensemble du fichier ; construire la référence sans structure en permutant chaque variable indépendamment avec la même récurrence ; pour chaque nombre de segments examiné, construire le découpage sur tout le fichier et enregistrer la composition de chaque segment ; tirer les 40 rééchantillons, reconstruire, réaffecter tous les clients d’origine et attribuer à chaque segment son meilleur Jaccard, en échouant si un rééchantillon ne produit pas le nombre demandé ; moyenner sur les rééchantillons, refaire à l’identique sur la référence sans structure, puis calculer le recouvrement le plus faible, celui de la référence et leur marge ; appliquer les deux seuils, puis la règle de verdict au nombre proposé.

09 · PROTOCOLE

Exemple numérique de bout en bout

Illustration synthétique — valeurs pédagogiques, non observées

Sur le fichier scellé : 360 clients, 40 rééchantillons. À deux segments, recouvrements 0,977481 et 0,976322 ; le plus faible vaut 0,976322, la référence sans structure 0,647971, la marge 0,328351, donc STABLE. À trois segments : 0,990139, 0,986949 et 0,997222 ; plus faible 0,986949, référence 0,606088, marge 0,380860, donc STABLE. À quatre segments, le nombre proposé : 0,848874, 0,664749, 0,827341 et 0,979621 ; plus faible 0,664749, sous le seuil de 0,75, référence 0,829190 et marge −0,164441, donc NOT_STABLE. Verdict : PROPOSED_SEGMENTATION_NOT_STABLE.

10 · PROTOCOLE

Hypothèses de validité

La procédure suppose que les clients du fichier peuvent être traités comme des observations interchangeables d’une même population, ce qui autorise le tirage avec remise ; que les trois variables sont celles qui décrivent ce que l’équipe veut distinguer ; et que la référence obtenue en permutant chaque variable détruit bien la structure conjointe tout en conservant chaque distribution marginale. Elle ne suppose pas que quatre segments existent, ni que trois soient le bon nombre. Trois choses ne sont pas testables ici : la pertinence des variables, la persistance du découpage dans le temps, et la réaction différenciée d’un segment à une action.

11 · PROTOCOLE

Diagnostics et incertitude

Le recouvrement moyen porte sur 40 rééchantillons : il n’est pas accompagné d’un intervalle, parce qu’à ce nombre de tirages l’incertitude sur la moyenne resterait du même ordre que les écarts qu’on cherche à interpréter, et la page le dit plutôt que d’afficher une précision qu’elle n’a pas. Le diagnostic décisif n’est pas le niveau brut mais la marge : à quatre segments elle est négative, −0,164441, ce qui signifie que le fichier réel reproduit ses segments moins bien qu’un fichier sans structure. Aucun de ces chiffres n’est un p, et aucun ne teste une hypothèse.

12 · PROTOCOLE

Robustesse et alternatives

Alternatives déclarées avant résultat : remplacer le tirage avec remise par un sous-échantillonnage sans remise à taille fixée, et vérifier que la conclusion ne dépend pas du schéma ; remplacer l’indice de Jaccard par l’indice de Rand ajusté, qui juge le découpage entier au lieu de chaque segment ; augmenter le nombre de rééchantillons pour resserrer les moyennes ; ou perturber les variables par un bruit déclaré plutôt que par un tirage. Chaque variante doit être annoncée avant lecture et rapportée même si elle renverse le verdict.

13 · PROTOCOLE

Interprétation du résultat

La solution proposée ne tient pas. Un de ses quatre segments se dissout dès qu’on rejoue le calcul sur des clients légèrement différents, et l’ensemble se reproduit moins bien qu’un fichier sans structure. Le découpage en trois segments, lui, revient presque intact. Mais la lecture s’arrête là : le découpage en deux segments est lui aussi stable, ce qui montre qu’un bon recouvrement ne désigne pas le bon nombre de groupes. La stabilité élimine des candidats, elle n’en couronne aucun.

14 · PROTOCOLE

Conclusions autorisées

Autorisé : refuser d’engager quatre budgets sur la solution proposée ; publier le recouvrement de chaque segment, la référence sans structure et la marge ; dire qu’un des quatre segments se dissout sous rééchantillonnage ; retenir trois segments comme candidat sérieux à condition de le justifier par autre chose que la stabilité ; et exiger d’un prestataire qu’il fournisse ces trois chiffres avec toute segmentation livrée. Autorisé aussi : dire que ce résultat vaut pour ces variables et cette période, et refaire l’examen si l’une des deux change.

15 · PROTOCOLE

Conclusions interdites

Interdit : conclure que trois est le vrai nombre de segments, alors que deux passe aussi les seuils ; lire un recouvrement élevé comme une preuve qu’une structure existe, alors que la référence sans structure atteint 0,829190 à quatre segments ; présenter la stabilité comme une mesure d’utilité commerciale ; conclure qu’un segment stable réagira mieux à une offre ; ou refaire le calcul avec plusieurs seuils et ne publier que celui qui arrange. Interdit également : présenter ce cas synthétique comme une mesure observée.

16 · PROTOCOLE

Décision marketing possible

La décision raisonnable est de renvoyer la segmentation à quatre groupes à son auteur avec les trois chiffres qui la mettent en défaut, et de ne financer aucun des quatre programmes en l’état. Si l’équipe veut avancer, elle repart de la solution à trois segments, la justifie par sa capacité d’animation et par l’écart de valeur entre groupes, puis mesure l’effet réel de chaque programme par une expérience avec un groupe témoin dans chaque segment. La stabilité conditionne le droit de continuer ; elle ne remplace pas la mesure.

17 · PROTOCOLE

Quand utiliser ou éviter la méthode

Utiliser cet examen chaque fois qu’une segmentation est livrée pour fonder des budgets, et avant toute mise en production. L’éviter comme critère unique de choix du nombre de segments, puisqu’il n’en désigne aucun. L’éviter aussi quand la base vient d’être renouvelée, quand les variables ne décrivent pas ce qu’on veut distinguer, ou quand la question réelle est l’effet d’une action sur un segment, ce qui demande une expérience et non un rééchantillonnage.

18 · PROTOCOLE

Implémentations et livrable final

Le CSV CC0 contient les 360 clients synthétiques. Python et R sont les implémentations de référence ; SPSS reprend le même calcul dans un bloc Python ; SAS reproduit exactement la récurrence déclarée, donc tire les mêmes rééchantillons, mais confie le regroupement à sa propre procédure et vérifie les drapeaux plutôt que chaque décimale. Le livrable final réunit les données, le dictionnaire des variables, les variables et la distance déclarées, la récurrence de rééchantillonnage, la référence sans structure, les deux seuils, les sept étapes numérotées, le recouvrement de chaque segment pour chaque nombre examiné, les marges, les drapeaux, le verdict et les versions logicielles.

19 · PROTOCOLE

Sources et niveau de preuve

Von Luxburg explique que tester la stabilité suppose de relancer l’algorithme sur des jeux de données légèrement différents, et qu’un résultat stable à un nombre de segments trop petit ne permet aucune conclusion utile ; elle rappelle aussi qu’on compare le score obtenu à celui d’une distribution de référence sans structure, et que le tirage avec remise est le schéma standard de la littérature du bootstrap. Hennig note que la stabilité est plus facile à atteindre avec peu de groupes, et que les variables doivent être choisies pour la question posée. Ullmann, Hennig et Boulesteix situent l’analyse de stabilité dans un cadre de validation et rappellent l’usage courant qui consiste à retenir le nombre de segments le plus stable. Ullmann et ses coauteurs montrent enfin que le nombre de segments est un réglage dont il faut examiner les conséquences, et que se prémunir de l’excès d’optimisme exige des règles fixées d’avance. Références fondatrices : von Luxburg (2010, prépublication arXiv ; publiée dans Foundations and Trends in Machine Learning, relue) et Hennig (2015, prépublication arXiv ; publiée dans Pattern Recognition Letters, relue). Développements récents : Ullmann, Hennig et Boulesteix (2021, prépublication arXiv ; publiée dans WIREs Data Mining and Knowledge Discovery, relue) et Ullmann et al. (2022, Advances in Data Analysis and Classification, accès ouvert CC BY, relue).

  1. von Luxburg (2010) Texte intégral vérifié, avec extrait court localisé dans la source.
  2. Hennig (2015) Texte intégral vérifié, avec extrait court localisé dans la source.
  3. Ullmann, Hennig & Boulesteix (2021) Texte intégral vérifié, avec extrait court localisé dans la source.
  4. Ullmann et al. (2022) Texte intégral vérifié, avec extrait court localisé dans la source.

Connexions méthodologiques

Territoire parentScience client et choix : comportement, valeur et hétérogénéitéValideComment construire une segmentation client utile ?Comparer avecComment valider une prévision marketing ?

À lire ensuite

MSC-H-004Science client et choix : comportement, valeur et hétérogénéité→MSC-P-031Comment construire une segmentation client utile ?→MSC-P-019Comment diagnostiquer une régression marketing avant de l’interpréter ?→MSC-P-033Comment valider une prévision marketing ?→