Comment construire une segmentation client utile ?
Une segmentation utile relie variables admissibles, mesure de distance, algorithme, stabilité et usage décisionnel. Les groupes ne sont pas des essences naturelles mais une représentation conditionnelle.
Rédaction scientifique : Marketing Science Center
Réponse directe
Construire une partition descriptive actionnable et documenter son incertitude.
Une segmentation utile relie variables admissibles, mesure de distance, algorithme, stabilité et usage décisionnel. Les groupes ne sont pas des essences naturelles mais une représentation conditionnelle.
01 · PROTOCOLE
Résumé opérationnel
Neuf cents clients sont répartis en quatre segments par une construction entièrement déclarée, sans tirage aléatoire. Dans le cas synthétique scellé, les tailles valent 283, 246, 184 et 187, la silhouette moyenne 0,407973 et l’indice de Rand ajusté entre deux reconstructions indépendantes 0,984661. Le revenu du trimestre suivant, jamais utilisé pour construire les segments, va de 69,260000 à 644,625668 selon le segment, soit un rapport de 9,307330. Les quatre contrôles passent. Verdict : SEGMENTATION_READABLE_FOR_ACTION.
02 · PROTOCOLE
Situation marketing concrète
Une équipe CRM veut arrêter de traiter sa base comme un bloc unique. Elle dispose, pour chaque client, de la récence, de la fréquence, du panier moyen, du nombre de catégories achetées et de la part de commandes en ligne. Elle veut quatre groupes, parce que quatre est le nombre de programmes relationnels qu’elle peut réellement animer. La question n’est pas de trouver les vrais groupes, qui n’existent pas comme tels, mais d’obtenir un découpage qui tienne et qui serve à décider.
03 · PROTOCOLE
Question scientifique
Pour ces neuf cents clients, ces cinq variables déclarées et cette distance déclarée, le découpage en quatre segments est-il séparé, équilibré, reproductible sur d’autres observations, et distingue-t-il un résultat que la construction n’a jamais vu ? La question ne porte pas sur l’existence de groupes naturels dans la clientèle, mais sur la tenue d’un découpage déclaré et sur son utilité pour une décision.
04 · PROTOCOLE
Pourquoi l’approche simple peut échouer
Lancer un algorithme de partition et commenter les groupes obtenus produit toujours des groupes : la méthode en fabrique autant qu’on lui en demande, même dans un nuage sans structure. Changer les variables, l’échelle ou la distance change le résultat, et un tirage initial différent peut déplacer les frontières. Sans contrôle, on décrit un artefact de l’algorithme et on l’appelle une segmentation client. Le mot « vrai » segment n’a d’ailleurs pas de définition opératoire dans la littérature.
05 · PROTOCOLE
Intuition de la méthode
La méthode consiste à tout déclarer avant de regarder : les cinq variables, leur transformation, leur mise à l’échelle, la distance, le nombre de segments, le point de départ des centres et les quatre seuils. Le départ n’est pas tiré au sort : ce sont les observations situées à quatre rangs fixes d’un score composite déclaré. Le découpage est ensuite soumis à quatre questions : les segments sont-ils séparés, sont-ils tous adressables, réapparaissent-ils si on reconstruit sur d’autres clients, et distinguent-ils un résultat extérieur à la construction ?
06 · PROTOCOLE
Données nécessaires
Sont figés avant toute lecture : l’identifiant client ordonné sans trou, la récence, la fréquence, le panier moyen, le nombre de catégories, la part en ligne, le revenu du trimestre suivant, les transformations déclarées, la standardisation, le nombre de segments fixé à quatre par le contexte de décision, le départ déclaré et les quatre seuils. Le revenu n’entre jamais dans la construction. Le fichier scellé contient neuf cents clients. Le cas est synthétique et déclaré comme tel.
07 · PROTOCOLE
Modèle formel et symboles
Chaque client est un vecteur de cinq coordonnées standardisées : logarithme de la récence, fréquence, logarithme du panier, nombre de catégories, part en ligne. La distance est euclidienne au carré. Un segment est un ensemble de clients plus proches de leur centre que de tout autre ; le centre est la moyenne de ses membres. La silhouette d’un client compare sa distance moyenne aux membres de son segment à sa distance moyenne au segment le plus proche. L’indice de Rand ajusté compare deux découpages en corrigeant l’accord dû au hasard.
08 · PROTOCOLE
Calcul déclaré
Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ; transformer et standardiser les cinq variables sur l’ensemble du fichier ; placer les quatre centres initiaux aux rangs déclarés du score composite et itérer jusqu’à stabilité des affectations ou cent passages, en échouant si un segment se vide ; rapporter tailles et parts et appliquer le seuil d’équilibre ; calculer la silhouette moyenne sur l’échantillon systématique déclaré ; reconstruire séparément sur les clients pairs et impairs, réaffecter tout le fichier sous chaque solution et calculer l’indice de Rand ajusté ; calculer les moyennes de revenu par segment, leur rapport et la variance expliquée, puis appliquer la règle de verdict.
09 · PROTOCOLE
Exemple numérique de bout en bout
Illustration synthétique — valeurs pédagogiques, non observées
Sur le fichier scellé : 900 clients, 4 segments. Tailles 283, 246, 184, 187 ; parts 0,314444, 0,273333, 0,204444 et 0,207778 ; plus petite part 0,204444, contrôle réussi. Silhouette moyenne 0,407973, contrôle réussi. Indice de Rand ajusté entre les deux reconstructions 0,984661, contrôle réussi. Revenu moyen par segment : 192,210318 ; 106,899593 ; 69,260000 ; 644,625668. Rapport du plus élevé au plus faible 9,307330 et variance expliquée 0,692635, contrôle réussi. Verdict : SEGMENTATION_READABLE_FOR_ACTION.
10 · PROTOCOLE
Hypothèses de validité
La construction suppose que les cinq variables décrivent ce que l’équipe veut distinguer, que la standardisation leur donne un poids acceptable, que la distance euclidienne a un sens sur ces coordonnées et que quatre segments correspondent à une capacité d’action réelle. Elle ne suppose pas l’existence de groupes naturels. Trois choses ne sont pas testables ici : la pertinence des variables retenues, la stabilité du découpage dans le temps, et le fait qu’un segment réagisse différemment à une action, ce qui relève d’une expérience.
11 · PROTOCOLE
Diagnostics et incertitude
La silhouette mesure une séparation relative sous la distance déclarée, pas une vérité géométrique : elle serait différente avec d’autres variables. Elle est calculée ici sur un échantillon systématique de clients, mais comparés à tous les clients ; une bibliothèque standard qui restreint les distances aux seuls points échantillonnés renvoie 0,406210 au lieu de 0,407973 sur ce fichier, et la page le signale plutôt que de laisser croire à une définition unique. L’indice de Rand ajusté vaut 0,984661 parce que la structure synthétique est nette ; sur données réelles, une valeur au-dessus de 0,60 est déjà rassurante. Aucun de ces chiffres n’est un p.
12 · PROTOCOLE
Robustesse et alternatives
Alternatives déclarées avant résultat : refaire le découpage avec trois ou cinq segments et comparer les quatre contrôles ; remplacer la standardisation par une pondération explicite des variables et publier les deux profils ; retirer la part en ligne, qui peut refléter un canal d’acquisition plutôt qu’un comportement ; ou remplacer la partition par une méthode qui autorise des appartenances partielles. Chaque variante doit être annoncée avant lecture et rapportée même si elle change les segments.
13 · PROTOCOLE
Interprétation du résultat
Les quatre contrôles passent, donc le découpage peut servir à décider. Le résultat exploitable est le profil des segments et l’écart de valeur entre eux : un segment concentre un revenu moyen de 644,625668 sur le trimestre suivant, un autre de 69,260000, et le découpage explique 69,2635 pour cent de la variance du revenu. Cette structure justifie des programmes différenciés. Elle ne dit pas qu’un programme fera réagir un segment plus qu’un autre : c’est une association, mesurée sur un résultat que la construction n’a pas vu, pas un effet.
14 · PROTOCOLE
Conclusions autorisées
Autorisé : publier les profils de segments, leurs tailles, leur séparation, leur reproductibilité et leur écart de valeur ; construire quatre programmes relationnels distincts ; suivre dans le temps la part de chaque segment ; conclure que la base n’est pas homogène et que quatre groupes tiennent sous les critères déclarés. Autorisé aussi : dire que ces segments dépendent des variables retenues et republier le découpage si ces variables changent.
15 · PROTOCOLE
Conclusions interdites
Interdit : présenter ces quatre segments comme les vrais groupes de la clientèle ; affirmer qu’un client appartient définitivement à son segment, alors qu’il change de position dès que ses achats changent ; attribuer l’écart de revenu à l’appartenance au segment comme s’il s’agissait d’un effet ; choisir le nombre de segments après avoir vu les profils puis publier les contrôles comme s’il avait été fixé d’avance ; ou transposer ces segments à un autre marché. Interdit également : présenter ce cas synthétique comme une mesure observée.
16 · PROTOCOLE
Décision marketing possible
La décision raisonnable consiste à donner à chaque segment un programme relationnel distinct, dimensionné sur sa taille et sur son écart de valeur, puis à mesurer l’effet de ces programmes par une expérience et non par la comparaison des segments entre eux. Le segment le plus dense en valeur justifie l’effort le plus élevé, mais rien n’assure encore qu’il y répondra le mieux : c’est la campagne suivante, avec un groupe témoin par segment, qui le dira.
17 · PROTOCOLE
Quand utiliser ou éviter la méthode
Utiliser cette méthode quand l’équipe sait combien de programmes elle peut animer et quelles variables décrivent ce qu’elle veut distinguer. L’éviter comme outil d’exploration pure : sans purpose déclaré, aucun critère ne permet de dire qu’un découpage est meilleur qu’un autre. L’éviter aussi quand les variables retenues mesurent surtout le canal d’acquisition, quand la base vient d’être renouvelée, ou quand l’objectif réel est de mesurer l’effet d’une action, ce qui demande une expérience.
18 · PROTOCOLE
Implémentations et livrable final
Le CSV CC0 contient les neuf cents clients synthétiques. Python et R sont les implémentations de référence ; SPSS reprend le même calcul dans un bloc Python ; SAS reçoit les mêmes quatre points de départ déclarés mais applique son propre ordre d’affectation et sa propre règle de convergence, et vérifie l’équilibre et l’utilité plutôt que de reproduire chaque décimale. Le livrable final réunit les données, le dictionnaire des variables, les variables et la distance déclarées, le nombre de segments et son motif, le départ déclaré, les quatre seuils, les sept étapes numérotées, les profils, les quatre contrôles, le verdict et les versions logicielles.
Données synthétiques · CC0
msc-p031-segmentation-panel.csv ↓Protocole reproductible
msc-p031-reproducibility-readme.md ↓Référence Python · MIT
msc-p031-reference.py ↓Référence R · MIT
msc-p031-reference.R ↓Implémentation SPSS · MIT
msc-p031-secondary.sps ↓Implémentation SAS · MIT
msc-p031-secondary.sas ↓19 · PROTOCOLE
Sources et niveau de preuve
Hennig rappelle qu’une analyse de partition devient scientifique par la transparence de ses choix, non par l’unicité de son résultat, et que la notion de vrai groupe reste rarement définie. Von Luxburg, Williamson et Guyon montrent qu’aucune procédure générale ne classe les méthodes de partition sans tenir compte du contexte d’usage. Romano et al. situent l’indice de Rand ajusté parmi les mesures corrigées du hasard. Ullmann, Hennig et Boulesteix formalisent la validation d’un découpage sur d’autres observations, par partage du fichier en deux moitiés. Références fondatrices : Hennig (2015, prépublication arXiv ; publiée dans Pattern Recognition Letters, relue) et von Luxburg, Williamson et Guyon (2012, actes relus, sans DOI). Développements récents : Romano et al. (2016, Journal of Machine Learning Research, relu, sans DOI) et Ullmann, Hennig et Boulesteix (2021, prépublication arXiv ; publiée dans WIREs Data Mining and Knowledge Discovery, relue).
- Hennig (2015) Texte intégral vérifié, avec extrait court localisé dans la source.
- von Luxburg, Williamson & Guyon (2012) Texte intégral vérifié, avec extrait court localisé dans la source.
- Romano et al. (2016) Texte intégral vérifié, avec extrait court localisé dans la source.
- Ullmann, Hennig & Boulesteix (2021) Texte intégral vérifié, avec extrait court localisé dans la source.
Connexions méthodologiques

