Comment tester la stabilité d’une segmentation ?
La stabilité évalue si une structure proche réapparaît sous rééchantillonnage, variation de période ou perturbation raisonnable des variables. Elle ne garantit pas l’utilité métier.
Rédaction scientifique : Marketing Science Center
Réponse directe
Comparer des solutions et quantifier la robustesse des affectations.
La stabilité évalue si une structure proche réapparaît sous rééchantillonnage, variation de période ou perturbation raisonnable des variables. Elle ne garantit pas l’utilité métier.
01 · PROTOCOLE
Résumé opérationnel
Une segmentation en quatre segments est proposée sur 360 clients. Elle est reconstruite sur 40 rééchantillons tirés avec remise, et le recouvrement de chaque segment est mesuré par l’indice de Jaccard. Le segment le plus faible n’est retrouvé qu’à 0,664749, sous le seuil déclaré de 0,75. Pire : une référence sans structure, obtenue en permutant chaque variable, retrouve ses propres segments à 0,829190, donc mieux que le fichier réel. Verdict : PROPOSED_SEGMENTATION_NOT_STABLE. La solution en trois segments, elle, tient à 0,986949.
02 · PROTOCOLE
Situation marketing concrète
Une direction marketing a reçu d’un prestataire une segmentation en quatre groupes, avec des noms, des personas et un plan d’animation par groupe. Avant d’engager quatre budgets distincts, l’équipe pose une question simple : si l’on refaisait le même travail sur un échantillon légèrement différent des mêmes clients, retrouverait-on ces quatre groupes ? Personne ne demande si les groupes sont vrais. On demande s’ils tiennent.
03 · PROTOCOLE
Question scientifique
Pour ces 360 clients, ces trois variables déclarées, cette distance déclarée et cette procédure de rééchantillonnage déclarée, chacun des quatre segments proposés réapparaît-il assez souvent pour qu’on puisse lui consacrer un budget ? Et ce niveau de réapparition dépasse-t-il ce qu’un fichier sans aucune structure produirait déjà par le seul effet du rééchantillonnage ? La question ne porte ni sur l’existence des groupes ni sur leur utilité, mais sur leur reproductibilité sous perturbation.
04 · PROTOCOLE
Pourquoi l’approche simple peut échouer
Regarder la solution une seule fois ne dit rien : un algorithme de partition rend toujours le nombre de groupes demandé, et sur un tirage unique ce nombre paraît toujours net. Rejouer le calcul sans changer les données ne dit rien non plus, puisque le départ est déterministe. Et mesurer un recouvrement élevé sans point de comparaison peut tromper complètement : sur ce fichier, la référence sans structure atteint 0,829190 à quatre segments, un chiffre qu’on lirait volontiers comme une preuve de solidité s’il n’était pas confronté à autre chose.
05 · PROTOCOLE
Intuition de la méthode
L’idée tient en une phrase : on perturbe le fichier, on refait exactement le même travail, et on regarde ce qui revient. Chaque perturbation est un rééchantillon tiré avec remise, de même taille que le fichier. Après chaque reconstruction, tous les clients d’origine sont réaffectés aux nouveaux centres, si bien que les deux découpages portent sur les mêmes personnes et se comparent sans artifice. Un segment d’origine reçoit alors le meilleur recouvrement qu’il obtient face aux segments reconstruits. Le tout est mesuré une seconde fois sur une référence sans structure, pour savoir ce que le bruit seul produit.
06 · PROTOCOLE
Données nécessaires
Sont figés avant toute lecture : l’identifiant client ordonné sans trou, la récence, la fréquence, le panier moyen, les transformations déclarées, la standardisation, la distance, le départ déterministe, les nombres de segments examinés (2, 3 et 4), le nombre proposé (4), les 40 rééchantillons, la récurrence arithmétique qui les produit, la référence sans structure et les deux seuils. Le fichier scellé contient 360 clients. Le cas est synthétique et déclaré comme tel.
07 · PROTOCOLE
Modèle formel et symboles
Chaque client est un vecteur de trois coordonnées standardisées : logarithme de la récence, fréquence, logarithme du panier. La distance est euclidienne au carré et un segment regroupe les clients plus proches de leur centre que de tout autre. Le recouvrement d’un segment S par un segment reconstruit R est l’indice de Jaccard, soit le nombre de clients communs divisé par le nombre de clients appartenant à l’un ou à l’autre. Les rééchantillons proviennent d’une récurrence déclarée : l’état suivant vaut (1103515245 × état + 12345) modulo 2^31, et le client tiré est l’état modulo le nombre de clients.
08 · PROTOCOLE
Calcul déclaré
Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ; transformer et standardiser les trois variables sur l’ensemble du fichier ; construire la référence sans structure en permutant chaque variable indépendamment avec la même récurrence ; pour chaque nombre de segments examiné, construire le découpage sur tout le fichier et enregistrer la composition de chaque segment ; tirer les 40 rééchantillons, reconstruire, réaffecter tous les clients d’origine et attribuer à chaque segment son meilleur Jaccard, en échouant si un rééchantillon ne produit pas le nombre demandé ; moyenner sur les rééchantillons, refaire à l’identique sur la référence sans structure, puis calculer le recouvrement le plus faible, celui de la référence et leur marge ; appliquer les deux seuils, puis la règle de verdict au nombre proposé.
09 · PROTOCOLE
Exemple numérique de bout en bout
Illustration synthétique — valeurs pédagogiques, non observées
Sur le fichier scellé : 360 clients, 40 rééchantillons. À deux segments, recouvrements 0,977481 et 0,976322 ; le plus faible vaut 0,976322, la référence sans structure 0,647971, la marge 0,328351, donc STABLE. À trois segments : 0,990139, 0,986949 et 0,997222 ; plus faible 0,986949, référence 0,606088, marge 0,380860, donc STABLE. À quatre segments, le nombre proposé : 0,848874, 0,664749, 0,827341 et 0,979621 ; plus faible 0,664749, sous le seuil de 0,75, référence 0,829190 et marge −0,164441, donc NOT_STABLE. Verdict : PROPOSED_SEGMENTATION_NOT_STABLE.
10 · PROTOCOLE
Hypothèses de validité
La procédure suppose que les clients du fichier peuvent être traités comme des observations interchangeables d’une même population, ce qui autorise le tirage avec remise ; que les trois variables sont celles qui décrivent ce que l’équipe veut distinguer ; et que la référence obtenue en permutant chaque variable détruit bien la structure conjointe tout en conservant chaque distribution marginale. Elle ne suppose pas que quatre segments existent, ni que trois soient le bon nombre. Trois choses ne sont pas testables ici : la pertinence des variables, la persistance du découpage dans le temps, et la réaction différenciée d’un segment à une action.
11 · PROTOCOLE
Diagnostics et incertitude
Le recouvrement moyen porte sur 40 rééchantillons : il n’est pas accompagné d’un intervalle, parce qu’à ce nombre de tirages l’incertitude sur la moyenne resterait du même ordre que les écarts qu’on cherche à interpréter, et la page le dit plutôt que d’afficher une précision qu’elle n’a pas. Le diagnostic décisif n’est pas le niveau brut mais la marge : à quatre segments elle est négative, −0,164441, ce qui signifie que le fichier réel reproduit ses segments moins bien qu’un fichier sans structure. Aucun de ces chiffres n’est un p, et aucun ne teste une hypothèse.
12 · PROTOCOLE
Robustesse et alternatives
Alternatives déclarées avant résultat : remplacer le tirage avec remise par un sous-échantillonnage sans remise à taille fixée, et vérifier que la conclusion ne dépend pas du schéma ; remplacer l’indice de Jaccard par l’indice de Rand ajusté, qui juge le découpage entier au lieu de chaque segment ; augmenter le nombre de rééchantillons pour resserrer les moyennes ; ou perturber les variables par un bruit déclaré plutôt que par un tirage. Chaque variante doit être annoncée avant lecture et rapportée même si elle renverse le verdict.
13 · PROTOCOLE
Interprétation du résultat
La solution proposée ne tient pas. Un de ses quatre segments se dissout dès qu’on rejoue le calcul sur des clients légèrement différents, et l’ensemble se reproduit moins bien qu’un fichier sans structure. Le découpage en trois segments, lui, revient presque intact. Mais la lecture s’arrête là : le découpage en deux segments est lui aussi stable, ce qui montre qu’un bon recouvrement ne désigne pas le bon nombre de groupes. La stabilité élimine des candidats, elle n’en couronne aucun.
14 · PROTOCOLE
Conclusions autorisées
Autorisé : refuser d’engager quatre budgets sur la solution proposée ; publier le recouvrement de chaque segment, la référence sans structure et la marge ; dire qu’un des quatre segments se dissout sous rééchantillonnage ; retenir trois segments comme candidat sérieux à condition de le justifier par autre chose que la stabilité ; et exiger d’un prestataire qu’il fournisse ces trois chiffres avec toute segmentation livrée. Autorisé aussi : dire que ce résultat vaut pour ces variables et cette période, et refaire l’examen si l’une des deux change.
15 · PROTOCOLE
Conclusions interdites
Interdit : conclure que trois est le vrai nombre de segments, alors que deux passe aussi les seuils ; lire un recouvrement élevé comme une preuve qu’une structure existe, alors que la référence sans structure atteint 0,829190 à quatre segments ; présenter la stabilité comme une mesure d’utilité commerciale ; conclure qu’un segment stable réagira mieux à une offre ; ou refaire le calcul avec plusieurs seuils et ne publier que celui qui arrange. Interdit également : présenter ce cas synthétique comme une mesure observée.
16 · PROTOCOLE
Décision marketing possible
La décision raisonnable est de renvoyer la segmentation à quatre groupes à son auteur avec les trois chiffres qui la mettent en défaut, et de ne financer aucun des quatre programmes en l’état. Si l’équipe veut avancer, elle repart de la solution à trois segments, la justifie par sa capacité d’animation et par l’écart de valeur entre groupes, puis mesure l’effet réel de chaque programme par une expérience avec un groupe témoin dans chaque segment. La stabilité conditionne le droit de continuer ; elle ne remplace pas la mesure.
17 · PROTOCOLE
Quand utiliser ou éviter la méthode
Utiliser cet examen chaque fois qu’une segmentation est livrée pour fonder des budgets, et avant toute mise en production. L’éviter comme critère unique de choix du nombre de segments, puisqu’il n’en désigne aucun. L’éviter aussi quand la base vient d’être renouvelée, quand les variables ne décrivent pas ce qu’on veut distinguer, ou quand la question réelle est l’effet d’une action sur un segment, ce qui demande une expérience et non un rééchantillonnage.
18 · PROTOCOLE
Implémentations et livrable final
Le CSV CC0 contient les 360 clients synthétiques. Python et R sont les implémentations de référence ; SPSS reprend le même calcul dans un bloc Python ; SAS reproduit exactement la récurrence déclarée, donc tire les mêmes rééchantillons, mais confie le regroupement à sa propre procédure et vérifie les drapeaux plutôt que chaque décimale. Le livrable final réunit les données, le dictionnaire des variables, les variables et la distance déclarées, la récurrence de rééchantillonnage, la référence sans structure, les deux seuils, les sept étapes numérotées, le recouvrement de chaque segment pour chaque nombre examiné, les marges, les drapeaux, le verdict et les versions logicielles.
Données synthétiques · CC0
msc-p032-stability-panel.csv ↓Protocole reproductible
msc-p032-reproducibility-readme.md ↓Référence Python · MIT
msc-p032-reference.py ↓Référence R · MIT
msc-p032-reference.R ↓Implémentation SPSS · MIT
msc-p032-secondary.sps ↓Implémentation SAS · MIT
msc-p032-secondary.sas ↓19 · PROTOCOLE
Sources et niveau de preuve
Von Luxburg explique que tester la stabilité suppose de relancer l’algorithme sur des jeux de données légèrement différents, et qu’un résultat stable à un nombre de segments trop petit ne permet aucune conclusion utile ; elle rappelle aussi qu’on compare le score obtenu à celui d’une distribution de référence sans structure, et que le tirage avec remise est le schéma standard de la littérature du bootstrap. Hennig note que la stabilité est plus facile à atteindre avec peu de groupes, et que les variables doivent être choisies pour la question posée. Ullmann, Hennig et Boulesteix situent l’analyse de stabilité dans un cadre de validation et rappellent l’usage courant qui consiste à retenir le nombre de segments le plus stable. Ullmann et ses coauteurs montrent enfin que le nombre de segments est un réglage dont il faut examiner les conséquences, et que se prémunir de l’excès d’optimisme exige des règles fixées d’avance. Références fondatrices : von Luxburg (2010, prépublication arXiv ; publiée dans Foundations and Trends in Machine Learning, relue) et Hennig (2015, prépublication arXiv ; publiée dans Pattern Recognition Letters, relue). Développements récents : Ullmann, Hennig et Boulesteix (2021, prépublication arXiv ; publiée dans WIREs Data Mining and Knowledge Discovery, relue) et Ullmann et al. (2022, Advances in Data Analysis and Classification, accès ouvert CC BY, relue).
- von Luxburg (2010) Texte intégral vérifié, avec extrait court localisé dans la source.
- Hennig (2015) Texte intégral vérifié, avec extrait court localisé dans la source.
- Ullmann, Hennig & Boulesteix (2021) Texte intégral vérifié, avec extrait court localisé dans la source.
- Ullmann et al. (2022) Texte intégral vérifié, avec extrait court localisé dans la source.
Connexions méthodologiques

