Come costruire una segmentazione clienti utile?
Una segmentazione utile collega variabili ammissibili, distanza, algoritmo, stabilità e uso decisionale. I gruppi non sono essenze naturali ma una rappresentazione condizionale.
Redazione scientifica: Marketing Science Center
Risposta diretta
Costruire una partizione descrittiva azionabile e documentarne l’incertezza.
Una segmentazione utile collega variabili ammissibili, distanza, algoritmo, stabilità e uso decisionale. I gruppi non sono essenze naturali ma una rappresentazione condizionale.
01 · PROTOCOLLO
Sintesi operativa
Novecento clienti sono ripartiti in quattro segmenti con una costruzione interamente dichiarata, senza estrazioni casuali. Nel caso sintetico sigillato le dimensioni valgono 283, 246, 184 e 187, la silhouette media 0,407973 e l’indice di Rand corretto fra due ricostruzioni indipendenti 0,984661. Il ricavo del trimestre successivo, mai usato per costruire i segmenti, va da 69,260000 a 644,625668 secondo il segmento, con un rapporto di 9,307330. I quattro controlli passano. Verdetto: SEGMENTATION_READABLE_FOR_ACTION.
02 · PROTOCOLLO
Situazione marketing concreta
Un team CRM vuole smettere di trattare la base come un blocco unico. Per ogni cliente dispone di recenza, frequenza, scontrino medio, numero di categorie acquistate e quota di ordini online. Vuole quattro gruppi, perché quattro è il numero di programmi relazionali che può davvero animare. La domanda non è trovare i veri gruppi, che non esistono come tali, ma ottenere una ripartizione che regga e che serva a decidere.
03 · PROTOCOLLO
Domanda scientifica
Per questi novecento clienti, queste cinque variabili dichiarate e questa distanza dichiarata, la ripartizione in quattro segmenti è separata, equilibrata, riproducibile su altre osservazioni e distingue un risultato che la costruzione non ha mai visto? La domanda non riguarda l’esistenza di gruppi naturali nella clientela, ma la tenuta di una ripartizione dichiarata e la sua utilità per una decisione.
04 · PROTOCOLLO
Perché l’approccio semplice può fallire
Lanciare un algoritmo di partizione e commentare i gruppi ottenuti produce sempre gruppi: il metodo ne fabbrica quanti gliene si chiedono, anche in una nuvola senza struttura. Cambiare variabili, scala o distanza cambia il risultato, e un’estrazione iniziale diversa può spostare i confini. Senza controlli si descrive un artefatto dell’algoritmo e lo si chiama segmentazione clienti. L’espressione «vero segmento» non ha del resto definizione operativa in letteratura.
05 · PROTOCOLLO
Intuizione del metodo
Il metodo consiste nel dichiarare tutto prima di guardare: le cinque variabili, la loro trasformazione, la scala, la distanza, il numero di segmenti, il punto di partenza dei centri e le quattro soglie. La partenza non è estratta a sorte: sono le osservazioni collocate a quattro ranghi fissi di un punteggio composito dichiarato. La ripartizione è poi sottoposta a quattro domande: i segmenti sono separati, sono tutti raggiungibili, riappaiono ricostruendo su altri clienti, e distinguono un risultato esterno alla costruzione?
06 · PROTOCOLLO
Dati necessari
Sono fissati prima di ogni lettura: l’identificativo cliente ordinato senza lacune, la recenza, la frequenza, lo scontrino medio, il numero di categorie, la quota online, il ricavo del trimestre successivo, le trasformazioni dichiarate, la standardizzazione, il numero di segmenti fissato a quattro dal contesto decisionale, la partenza dichiarata e le quattro soglie. Il ricavo non entra mai nella costruzione. Il file sigillato contiene novecento clienti. Il caso è sintetico e dichiarato tale.
07 · PROTOCOLLO
Modello formale e simboli
Ogni cliente è un vettore di cinque coordinate standardizzate: logaritmo della recenza, frequenza, logaritmo dello scontrino, numero di categorie, quota online. La distanza è euclidea al quadrato. Un segmento è un insieme di clienti più vicini al proprio centro che a ogni altro; il centro è la media dei suoi membri. La silhouette di un cliente confronta la distanza media dai membri del proprio segmento con quella dal segmento più vicino. L’indice di Rand corretto confronta due ripartizioni correggendo l’accordo dovuto al caso.
08 · PROTOCOLLO
Calcolo dichiarato
Il calcolo dichiarato segue sette tappe: validare lo schema e rifiutare ogni file non conforme; trasformare e standardizzare le cinque variabili sull’intero file; collocare i quattro centri iniziali ai ranghi dichiarati del punteggio composito e iterare fino alla stabilità delle assegnazioni o a cento passaggi, fallendo se un segmento si svuota; riportare dimensioni e quote e applicare la soglia di equilibrio; calcolare la silhouette media sul campione sistematico dichiarato; ricostruire separatamente su clienti pari e dispari, riassegnare l’intero file sotto ciascuna soluzione e calcolare l’indice di Rand corretto; calcolare le medie di ricavo per segmento, il loro rapporto e la varianza spiegata, poi applicare la regola di verdetto.
09 · PROTOCOLLO
Esempio numerico completo
Illustrazione sintetica — valori didattici, non osservati
Sul file sigillato: 900 clienti, 4 segmenti. Dimensioni 283, 246, 184, 187; quote 0,314444, 0,273333, 0,204444 e 0,207778; quota minima 0,204444, controllo superato. Silhouette media 0,407973, controllo superato. Indice di Rand corretto fra le due ricostruzioni 0,984661, controllo superato. Ricavo medio per segmento: 192,210318; 106,899593; 69,260000; 644,625668. Rapporto fra massimo e minimo 9,307330 e varianza spiegata 0,692635, controllo superato. Verdetto: SEGMENTATION_READABLE_FOR_ACTION.
10 · PROTOCOLLO
Ipotesi di validità
La costruzione presuppone che le cinque variabili descrivano ciò che il team vuole distinguere, che la standardizzazione dia loro un peso accettabile, che la distanza euclidea abbia senso su queste coordinate e che quattro segmenti corrispondano a una capacità d’azione reale. Non presuppone l’esistenza di gruppi naturali. Tre cose non sono verificabili qui: la pertinenza delle variabili scelte, la stabilità della ripartizione nel tempo e il fatto che un segmento reagisca diversamente a un’azione, che spetta a un esperimento.
11 · PROTOCOLLO
Diagnostica e incertezza
La silhouette misura una separazione relativa sotto la distanza dichiarata, non una verità geometrica: sarebbe diversa con altre variabili. Qui è calcolata su un campione sistematico di clienti, ma confrontati con tutti i clienti; una libreria standard che restringe le distanze ai soli punti campionati restituisce 0,406210 invece di 0,407973 su questo file, e la pagina lo segnala anziché lasciar credere a una definizione unica. L’indice di Rand corretto vale 0,984661 perché la struttura sintetica è netta; su dati reali un valore sopra 0,60 è già rassicurante. Nessuno di questi numeri è un p.
12 · PROTOCOLLO
Robustezza e alternative
Alternative dichiarate prima del risultato: rifare la ripartizione con tre o cinque segmenti e confrontare i quattro controlli; sostituire la standardizzazione con una ponderazione esplicita delle variabili e pubblicare entrambi i profili; togliere la quota online, che può riflettere un canale di acquisizione più che un comportamento; oppure sostituire la partizione con un metodo che ammette appartenenze parziali. Ogni variante va annunciata prima della lettura e riportata anche se cambia i segmenti.
13 · PROTOCOLLO
Interpretazione del risultato
I quattro controlli passano, quindi la ripartizione può servire a decidere. Il risultato utilizzabile è il profilo dei segmenti e lo scarto di valore fra loro: un segmento concentra un ricavo medio di 644,625668 sul trimestre successivo, un altro di 69,260000, e la ripartizione spiega il 69,2635 per cento della varianza del ricavo. Questa struttura giustifica programmi differenziati. Non dice che un programma farà reagire un segmento più di un altro: è un’associazione, misurata su un risultato che la costruzione non ha visto, non un effetto.
14 · PROTOCOLLO
Conclusioni consentite
Consentito: pubblicare i profili dei segmenti, le loro dimensioni, la separazione, la riproducibilità e lo scarto di valore; costruire quattro programmi relazionali distinti; seguire nel tempo la quota di ciascun segmento; concludere che la base non è omogenea e che quattro gruppi reggono secondo i criteri dichiarati. Consentito anche: dire che questi segmenti dipendono dalle variabili scelte e ripubblicare la ripartizione se tali variabili cambiano.
15 · PROTOCOLLO
Conclusioni vietate
Vietato: presentare questi quattro segmenti come i veri gruppi della clientela; affermare che un cliente appartiene definitivamente al proprio segmento, mentre cambia posizione appena cambiano i suoi acquisti; attribuire lo scarto di ricavo all’appartenenza al segmento come se fosse un effetto; scegliere il numero di segmenti dopo aver visto i profili e poi pubblicare i controlli come se fosse stato fissato in anticipo; o trasporre questi segmenti a un altro mercato. Vietato anche: presentare questo caso sintetico come una misura osservata.
16 · PROTOCOLLO
Possibile decisione marketing
La decisione ragionevole consiste nell’assegnare a ciascun segmento un programma relazionale distinto, dimensionato sulla sua quota e sul suo scarto di valore, e poi nel misurare l’effetto di tali programmi con un esperimento anziché confrontando i segmenti fra loro. Il segmento più denso di valore giustifica lo sforzo maggiore, ma nulla assicura ancora che risponda meglio: lo dirà la campagna successiva, con un gruppo di controllo in ogni segmento.
17 · PROTOCOLLO
Quando usare o evitare il metodo
Usare questo metodo quando il team sa quanti programmi può animare e quali variabili descrivono ciò che vuole distinguere. Evitarlo come strumento di pura esplorazione: senza uno scopo dichiarato nessun criterio dice che una ripartizione è migliore di un’altra. Evitarlo anche quando le variabili scelte misurano soprattutto il canale di acquisizione, quando la base è appena stata rinnovata o quando l’obiettivo reale è misurare l’effetto di un’azione, che richiede un esperimento.
18 · PROTOCOLLO
Implementazioni e risultato finale
Il CSV CC0 contiene i novecento clienti sintetici. Python e R sono le implementazioni di riferimento; SPSS riprende lo stesso calcolo in un blocco Python; SAS riceve gli stessi quattro punti di partenza dichiarati ma applica il proprio ordine di assegnazione e la propria regola di convergenza, e verifica equilibrio e utilità anziché riprodurre ogni decimale. Il risultato finale raccoglie i dati, il dizionario delle variabili, le variabili e la distanza dichiarate, il numero di segmenti e la sua motivazione, la partenza dichiarata, le quattro soglie, le sette tappe numerate, i profili, i quattro controlli, il verdetto e le versioni software.
Dati sintetici · CC0
msc-p031-segmentation-panel.csv ↓Protocollo riproducibile
msc-p031-reproducibility-readme.md ↓Riferimento Python · MIT
msc-p031-reference.py ↓Riferimento R · MIT
msc-p031-reference.R ↓Implementazione SPSS · MIT
msc-p031-secondary.sps ↓Implementazione SAS · MIT
msc-p031-secondary.sas ↓19 · PROTOCOLLO
Fonti e livello di prova
Hennig ricorda che un’analisi di partizione diventa scientifica per la trasparenza delle sue scelte, non per l’unicità del risultato, e che la nozione di vero gruppo resta raramente definita. Von Luxburg, Williamson e Guyon mostrano che nessuna procedura generale ordina i metodi di partizione senza tenere conto del contesto d’uso. Romano et al. collocano l’indice di Rand corretto fra le misure corrette per il caso. Ullmann, Hennig e Boulesteix formalizzano la validazione di una ripartizione su altre osservazioni, dividendo il file in due metà. Riferimenti fondativi: Hennig (2015, preprint arXiv; pubblicato in Pattern Recognition Letters, con revisione paritaria) e von Luxburg, Williamson e Guyon (2012, atti con revisione, senza DOI). Sviluppi recenti: Romano et al. (2016, Journal of Machine Learning Research, con revisione, senza DOI) e Ullmann, Hennig e Boulesteix (2021, preprint arXiv; pubblicato in WIREs Data Mining and Knowledge Discovery, con revisione).
- Hennig (2015) Testo integrale verificato, con estratto breve localizzato nella fonte.
- von Luxburg, Williamson & Guyon (2012) Testo integrale verificato, con estratto breve localizzato nella fonte.
- Romano et al. (2016) Testo integrale verificato, con estratto breve localizzato nella fonte.
- Ullmann, Hennig & Boulesteix (2021) Testo integrale verificato, con estratto breve localizzato nella fonte.
Connessioni metodologiche

