Research & Evidence

Cerca un metodo

Cerca tra titoli, domande, territori e identificativi MSC.

41 risultati
  1. MSC-P-001Come trasformare un’affermazione di marketing in una domanda verificabile?Scienza delle decisioni↗
  2. MSC-P-002Correlazione o causalità: cosa consente davvero di affermare un’analisi?Misurazione del marketing↗
  3. MSC-P-003Come esprimere l’incertezza di un risultato di marketing?Scienza delle decisioni↗
  4. MSC-P-004Significatività o dimensione dell’effetto: quale risultato interpretare?Scienza delle decisioni↗
  5. MSC-P-005Come misurare un costrutto di marketing non direttamente osservabile?Ricerche di mercato↗
  6. MSC-P-006Come progettare e validare una scala di misurazione?Ricerche di mercato↗
  7. MSC-P-007Alfa o omega: come valutare l’affidabilità di una scala?Ricerche di mercato↗
  8. MSC-P-009PCA, EFA o CFA: quale metodo scegliere?Ricerche di mercato↗
  9. MSC-P-010Quando condurre un esperimento di marketing?Misurazione del marketing↗
  10. MSC-P-011Come progettare un A/B test che stimi davvero un effetto?Misurazione del marketing↗
  11. MSC-P-012Di quante osservazioni ha bisogno un esperimento?Scienza delle decisioni↗
  12. MSC-P-013Come misurare l’effetto incrementale di una campagna con un gruppo di controllo?Misurazione del marketing↗
  13. MSC-P-017Come rilevare selezione, contaminazione e perdita di osservazioni in un esperimento?Misurazione del marketing↗
  14. MSC-P-018Regressione predittiva o causale: cosa si vuole stimare?Modelli di marketing↗
  15. MSC-P-019Come diagnosticare una regressione di marketing prima di interpretarla?Modelli di marketing↗
  16. MSC-P-022Come stimare l’elasticità al prezzo e la sua incertezza?Scienza dei prezzi↗
  17. MSC-P-026Logit vs Probit: come scegliere per una probabilità di acquisto?Scienza del cliente↗
  18. MSC-P-029Quali clienti hanno la probabilità di abbandono più elevata?Scienza del cliente↗
  19. MSC-P-027TAM, UTAUT o UTAUT2: quale quadro usare per studiare l’accettazione tecnologica?Ricerche di mercato↗
  20. MSC-H-001Misurazione e causalità: come stabilire un effetto di marketing?Misurazione del marketing↗
  21. MSC-H-002Modelli di risposta marketing: forma, ritardo e saturazioneModelli di marketing↗
  22. MSC-H-003Scienza dei prezzi: collegare prezzo, domanda e contribuzioneScienza dei prezzi↗
  23. MSC-H-004Scienza del cliente e della scelta: comportamento, valore ed eterogeneitàScienza del cliente↗
  24. MSC-H-005Scienza della misurazione: costruire indicatori validiRicerche di mercato↗
  25. MSC-H-006Metodi statistici decisionali: scegliere, quantificare, validareScienza delle decisioni↗
  26. MSC-P-008Come validare una scala di misurazione marketing?Ricerche di mercato↗
  27. MSC-P-014Come progettare un esperimento geografico di marketing?Misurazione del marketing↗
  28. MSC-P-015Come stimare un effetto con la differenza nelle differenze?Misurazione del marketing↗
  29. MSC-P-020Come trattare l’endogeneità del prezzo?Scienza dei prezzi↗
  30. MSC-P-021Effetti fissi o casuali: quale modello panel scegliere?Modelli di marketing↗
  31. MSC-P-023Come stimare una funzione di domanda?Scienza dei prezzi↗
  32. MSC-P-024Come simulare uno scenario prezzo-volume-margine?Scienza dei prezzi↗
  33. MSC-P-028Come stimare la CLV con BG/NBD e Gamma-Gamma?Scienza del cliente↗
  34. MSC-P-030Come analizzare la ritenzione con un modello di sopravvivenza?Scienza del cliente↗
  35. MSC-P-043Quanto vale un abbonato se si hanno solo sei mesi di ritenzione osservata?Scienza del cliente↗
  36. MSC-P-031Come costruire una segmentazione clienti utile?Scienza del cliente↗
  37. MSC-P-032Come testare la stabilità di una segmentazione?Scienza del cliente↗
  38. MSC-P-033Come validare una previsione di marketing?Scienza delle decisioni↗
  39. MSC-P-034Come costruire una simulazione Monte Carlo per una decisione di marketing?Scienza delle decisioni↗
  40. MSC-P-035Come modellare saturazione e adstock?Modelli di marketing↗
  41. MSC-P-039Quale test statistico scegliere?Scienza delle decisioni↗
← Tutti i metodi
SCHEDA METODOMSC-P-031Scienza del clienteDossier scientifico verificato

Come costruire una segmentazione clienti utile?

Una segmentazione utile collega variabili ammissibili, distanza, algoritmo, stabilità e uso decisionale. I gruppi non sono essenze naturali ma una rappresentazione condizionale.

Redazione scientifica: Marketing Science Center

Risposta diretta

Costruire una partizione descrittiva azionabile e documentarne l’incertezza.

Una segmentazione utile collega variabili ammissibili, distanza, algoritmo, stabilità e uso decisionale. I gruppi non sono essenze naturali ma una rappresentazione condizionale.

Rousseeuw, 1987Hennig, 2007

01 · PROTOCOLLO

Sintesi operativa

Novecento clienti sono ripartiti in quattro segmenti con una costruzione interamente dichiarata, senza estrazioni casuali. Nel caso sintetico sigillato le dimensioni valgono 283, 246, 184 e 187, la silhouette media 0,407973 e l’indice di Rand corretto fra due ricostruzioni indipendenti 0,984661. Il ricavo del trimestre successivo, mai usato per costruire i segmenti, va da 69,260000 a 644,625668 secondo il segmento, con un rapporto di 9,307330. I quattro controlli passano. Verdetto: SEGMENTATION_READABLE_FOR_ACTION.

02 · PROTOCOLLO

Situazione marketing concreta

Un team CRM vuole smettere di trattare la base come un blocco unico. Per ogni cliente dispone di recenza, frequenza, scontrino medio, numero di categorie acquistate e quota di ordini online. Vuole quattro gruppi, perché quattro è il numero di programmi relazionali che può davvero animare. La domanda non è trovare i veri gruppi, che non esistono come tali, ma ottenere una ripartizione che regga e che serva a decidere.

03 · PROTOCOLLO

Domanda scientifica

Per questi novecento clienti, queste cinque variabili dichiarate e questa distanza dichiarata, la ripartizione in quattro segmenti è separata, equilibrata, riproducibile su altre osservazioni e distingue un risultato che la costruzione non ha mai visto? La domanda non riguarda l’esistenza di gruppi naturali nella clientela, ma la tenuta di una ripartizione dichiarata e la sua utilità per una decisione.

04 · PROTOCOLLO

Perché l’approccio semplice può fallire

Lanciare un algoritmo di partizione e commentare i gruppi ottenuti produce sempre gruppi: il metodo ne fabbrica quanti gliene si chiedono, anche in una nuvola senza struttura. Cambiare variabili, scala o distanza cambia il risultato, e un’estrazione iniziale diversa può spostare i confini. Senza controlli si descrive un artefatto dell’algoritmo e lo si chiama segmentazione clienti. L’espressione «vero segmento» non ha del resto definizione operativa in letteratura.

05 · PROTOCOLLO

Intuizione del metodo

Il metodo consiste nel dichiarare tutto prima di guardare: le cinque variabili, la loro trasformazione, la scala, la distanza, il numero di segmenti, il punto di partenza dei centri e le quattro soglie. La partenza non è estratta a sorte: sono le osservazioni collocate a quattro ranghi fissi di un punteggio composito dichiarato. La ripartizione è poi sottoposta a quattro domande: i segmenti sono separati, sono tutti raggiungibili, riappaiono ricostruendo su altri clienti, e distinguono un risultato esterno alla costruzione?

06 · PROTOCOLLO

Dati necessari

Sono fissati prima di ogni lettura: l’identificativo cliente ordinato senza lacune, la recenza, la frequenza, lo scontrino medio, il numero di categorie, la quota online, il ricavo del trimestre successivo, le trasformazioni dichiarate, la standardizzazione, il numero di segmenti fissato a quattro dal contesto decisionale, la partenza dichiarata e le quattro soglie. Il ricavo non entra mai nella costruzione. Il file sigillato contiene novecento clienti. Il caso è sintetico e dichiarato tale.

07 · PROTOCOLLO

Modello formale e simboli

Ogni cliente è un vettore di cinque coordinate standardizzate: logaritmo della recenza, frequenza, logaritmo dello scontrino, numero di categorie, quota online. La distanza è euclidea al quadrato. Un segmento è un insieme di clienti più vicini al proprio centro che a ogni altro; il centro è la media dei suoi membri. La silhouette di un cliente confronta la distanza media dai membri del proprio segmento con quella dal segmento più vicino. L’indice di Rand corretto confronta due ripartizioni correggendo l’accordo dovuto al caso.

08 · PROTOCOLLO

Calcolo dichiarato

Il calcolo dichiarato segue sette tappe: validare lo schema e rifiutare ogni file non conforme; trasformare e standardizzare le cinque variabili sull’intero file; collocare i quattro centri iniziali ai ranghi dichiarati del punteggio composito e iterare fino alla stabilità delle assegnazioni o a cento passaggi, fallendo se un segmento si svuota; riportare dimensioni e quote e applicare la soglia di equilibrio; calcolare la silhouette media sul campione sistematico dichiarato; ricostruire separatamente su clienti pari e dispari, riassegnare l’intero file sotto ciascuna soluzione e calcolare l’indice di Rand corretto; calcolare le medie di ricavo per segmento, il loro rapporto e la varianza spiegata, poi applicare la regola di verdetto.

09 · PROTOCOLLO

Esempio numerico completo

Illustrazione sintetica — valori didattici, non osservati

Sul file sigillato: 900 clienti, 4 segmenti. Dimensioni 283, 246, 184, 187; quote 0,314444, 0,273333, 0,204444 e 0,207778; quota minima 0,204444, controllo superato. Silhouette media 0,407973, controllo superato. Indice di Rand corretto fra le due ricostruzioni 0,984661, controllo superato. Ricavo medio per segmento: 192,210318; 106,899593; 69,260000; 644,625668. Rapporto fra massimo e minimo 9,307330 e varianza spiegata 0,692635, controllo superato. Verdetto: SEGMENTATION_READABLE_FOR_ACTION.

10 · PROTOCOLLO

Ipotesi di validità

La costruzione presuppone che le cinque variabili descrivano ciò che il team vuole distinguere, che la standardizzazione dia loro un peso accettabile, che la distanza euclidea abbia senso su queste coordinate e che quattro segmenti corrispondano a una capacità d’azione reale. Non presuppone l’esistenza di gruppi naturali. Tre cose non sono verificabili qui: la pertinenza delle variabili scelte, la stabilità della ripartizione nel tempo e il fatto che un segmento reagisca diversamente a un’azione, che spetta a un esperimento.

11 · PROTOCOLLO

Diagnostica e incertezza

La silhouette misura una separazione relativa sotto la distanza dichiarata, non una verità geometrica: sarebbe diversa con altre variabili. Qui è calcolata su un campione sistematico di clienti, ma confrontati con tutti i clienti; una libreria standard che restringe le distanze ai soli punti campionati restituisce 0,406210 invece di 0,407973 su questo file, e la pagina lo segnala anziché lasciar credere a una definizione unica. L’indice di Rand corretto vale 0,984661 perché la struttura sintetica è netta; su dati reali un valore sopra 0,60 è già rassicurante. Nessuno di questi numeri è un p.

12 · PROTOCOLLO

Robustezza e alternative

Alternative dichiarate prima del risultato: rifare la ripartizione con tre o cinque segmenti e confrontare i quattro controlli; sostituire la standardizzazione con una ponderazione esplicita delle variabili e pubblicare entrambi i profili; togliere la quota online, che può riflettere un canale di acquisizione più che un comportamento; oppure sostituire la partizione con un metodo che ammette appartenenze parziali. Ogni variante va annunciata prima della lettura e riportata anche se cambia i segmenti.

13 · PROTOCOLLO

Interpretazione del risultato

I quattro controlli passano, quindi la ripartizione può servire a decidere. Il risultato utilizzabile è il profilo dei segmenti e lo scarto di valore fra loro: un segmento concentra un ricavo medio di 644,625668 sul trimestre successivo, un altro di 69,260000, e la ripartizione spiega il 69,2635 per cento della varianza del ricavo. Questa struttura giustifica programmi differenziati. Non dice che un programma farà reagire un segmento più di un altro: è un’associazione, misurata su un risultato che la costruzione non ha visto, non un effetto.

14 · PROTOCOLLO

Conclusioni consentite

Consentito: pubblicare i profili dei segmenti, le loro dimensioni, la separazione, la riproducibilità e lo scarto di valore; costruire quattro programmi relazionali distinti; seguire nel tempo la quota di ciascun segmento; concludere che la base non è omogenea e che quattro gruppi reggono secondo i criteri dichiarati. Consentito anche: dire che questi segmenti dipendono dalle variabili scelte e ripubblicare la ripartizione se tali variabili cambiano.

15 · PROTOCOLLO

Conclusioni vietate

Vietato: presentare questi quattro segmenti come i veri gruppi della clientela; affermare che un cliente appartiene definitivamente al proprio segmento, mentre cambia posizione appena cambiano i suoi acquisti; attribuire lo scarto di ricavo all’appartenenza al segmento come se fosse un effetto; scegliere il numero di segmenti dopo aver visto i profili e poi pubblicare i controlli come se fosse stato fissato in anticipo; o trasporre questi segmenti a un altro mercato. Vietato anche: presentare questo caso sintetico come una misura osservata.

16 · PROTOCOLLO

Possibile decisione marketing

La decisione ragionevole consiste nell’assegnare a ciascun segmento un programma relazionale distinto, dimensionato sulla sua quota e sul suo scarto di valore, e poi nel misurare l’effetto di tali programmi con un esperimento anziché confrontando i segmenti fra loro. Il segmento più denso di valore giustifica lo sforzo maggiore, ma nulla assicura ancora che risponda meglio: lo dirà la campagna successiva, con un gruppo di controllo in ogni segmento.

17 · PROTOCOLLO

Quando usare o evitare il metodo

Usare questo metodo quando il team sa quanti programmi può animare e quali variabili descrivono ciò che vuole distinguere. Evitarlo come strumento di pura esplorazione: senza uno scopo dichiarato nessun criterio dice che una ripartizione è migliore di un’altra. Evitarlo anche quando le variabili scelte misurano soprattutto il canale di acquisizione, quando la base è appena stata rinnovata o quando l’obiettivo reale è misurare l’effetto di un’azione, che richiede un esperimento.

18 · PROTOCOLLO

Implementazioni e risultato finale

Il CSV CC0 contiene i novecento clienti sintetici. Python e R sono le implementazioni di riferimento; SPSS riprende lo stesso calcolo in un blocco Python; SAS riceve gli stessi quattro punti di partenza dichiarati ma applica il proprio ordine di assegnazione e la propria regola di convergenza, e verifica equilibrio e utilità anziché riprodurre ogni decimale. Il risultato finale raccoglie i dati, il dizionario delle variabili, le variabili e la distanza dichiarate, il numero di segmenti e la sua motivazione, la partenza dichiarata, le quattro soglie, le sette tappe numerate, i profili, i quattro controlli, il verdetto e le versioni software.

19 · PROTOCOLLO

Fonti e livello di prova

Hennig ricorda che un’analisi di partizione diventa scientifica per la trasparenza delle sue scelte, non per l’unicità del risultato, e che la nozione di vero gruppo resta raramente definita. Von Luxburg, Williamson e Guyon mostrano che nessuna procedura generale ordina i metodi di partizione senza tenere conto del contesto d’uso. Romano et al. collocano l’indice di Rand corretto fra le misure corrette per il caso. Ullmann, Hennig e Boulesteix formalizzano la validazione di una ripartizione su altre osservazioni, dividendo il file in due metà. Riferimenti fondativi: Hennig (2015, preprint arXiv; pubblicato in Pattern Recognition Letters, con revisione paritaria) e von Luxburg, Williamson e Guyon (2012, atti con revisione, senza DOI). Sviluppi recenti: Romano et al. (2016, Journal of Machine Learning Research, con revisione, senza DOI) e Ullmann, Hennig e Boulesteix (2021, preprint arXiv; pubblicato in WIREs Data Mining and Knowledge Discovery, con revisione).

  1. Hennig (2015) Testo integrale verificato, con estratto breve localizzato nella fonte.
  2. von Luxburg, Williamson & Guyon (2012) Testo integrale verificato, con estratto breve localizzato nella fonte.
  3. Romano et al. (2016) Testo integrale verificato, con estratto breve localizzato nella fonte.
  4. Ullmann, Hennig & Boulesteix (2021) Testo integrale verificato, con estratto breve localizzato nella fonte.

Connessioni metodologiche

Territorio principaleScienza del cliente e della scelta: comportamento, valore ed eterogeneitàRichiedeCome diagnosticare una regressione di marketing prima di interpretarla?

Da leggere dopo

MSC-H-004Scienza del cliente e della scelta: comportamento, valore ed eterogeneità→MSC-P-032Come testare la stabilità di una segmentazione?→MSC-P-019Come diagnosticare una regressione di marketing prima di interpretarla?→MSC-P-029Quali clienti hanno la probabilità di abbandono più elevata?→