Quanto spenderà un cliente per acquisto? Il modello Gamma-Gamma
Modello Gamma-Gamma: prevedere la spesa media per acquisto di ogni cliente dagli acquisti passati, verificato su dati reali CDNOW e un periodo tenuto da parte.
Redazione scientifica: Marketing Science Center
Risposta diretta
Prevedere la spesa media per acquisto di ogni cliente dal numero e dall'importo dei suoi acquisti, con un intervallo, e validare la previsione su un periodo tenuto da parte rispetto alle medie semplici.
Modello Gamma-Gamma: prevedere la spesa media per acquisto di ogni cliente dagli acquisti passati, verificato su dati reali CDNOW e un periodo tenuto da parte.
01
In breve
Il valore di un cliente dipende da due cose: quante volte acquisterà e quanto spenderà a ogni acquisto. Il modello Gamma-Gamma di Fader, Hardie e Lee si occupa della seconda [C02]: prevede la spesa media per acquisto di ciascun cliente a partire dai suoi acquisti passati [C01]. La sua regola: la previsione attira la media osservata di un cliente verso quella dell'insieme dei clienti, tanto più quanto meno il cliente ha acquistato [C20, C21].
Il programma della pagina lo applica ai dati reali pubblicati dagli autori: 2.357 clienti del negozio di dischi online CDNOW, acquisiti nel primo trimestre 1997 [C03, C04]. Ritrova i risultati pubblicati dagli autori su questi dati, tranne una statistica descrittiva. Poi giudica le previsioni su trentanove settimane che la stima non ha visto, per i 491 clienti che acquistano di nuovo:
- il modello degli autori, che usa solo gli acquisti ripetuti, sbaglia in media di 16,37 $ per acquisto; fa nettamente meglio della media di questi soli acquisti, 17,35 $, ma non meglio della media di tutti gli acquisti del cliente, primo compreso, 16,09 $;
- lo stesso modello stimato su tutti gli acquisti, una variante aggiunta dalla pagina dopo una prima lettura di queste settimane, sbaglia di 15,78 $: un po' meglio di questa media semplice, ma senza uno scarto netto rispetto al modello degli autori. Resta da confermare su altri dati.
Il modello sottostima anche la dispersione degli acquisti di un cliente attorno alla sua media, e corregge troppo poco gli importi per acquisto piccoli. Serve a correggere le medie basate su pochi acquisti; non prevede meglio il totale della base.
02
La situazione
Un negozio di dischi online ha acquisito i suoi clienti nel primo trimestre 1997. Al 30 settembre 1997, 946 dei 2.357 clienti del campione hanno riacquistato almeno una volta [C07]. Per quantificarne il valore, il team marketing dispone già di un modello che prevede quanti acquisti farà ciascuno, come quello della pagina sulla stima della CLV non contrattuale; gli manca l'importo di questi acquisti.
Due clienti lo mettono in difficoltà. Il primo ha riacquistato una sola volta, per 100 $; il secondo sei volte, per 20 $ in media. Bisogna prevedere 100 $ per il primo, 20 $ per il secondo, o altro?
I dati della pagina sono quelli di CDNOW, così come li pubblica Bruce Hardie: un campione sistematico di un decimo della coorte [C03], cioè 6.919 righe con la data dell'acquisto, il numero di dischi e l'importo in dollari [C05].
03
La domanda scientifica
Quale spesa media per acquisto attendersi da un cliente, noti il numero x dei suoi acquisti ripetuti e il loro importo medio z̄? La media osservata è solo una stima imperfetta della vera media del cliente, che non si vede [C08]; bisogna quindi correggerla, dire di quanto, e verificare che la correzione preveda meglio delle medie semplici.
04
Perché il metodo semplice fallisce
Tre scorciatoie frequenti:
- Prendere la media passata del cliente. Gli autori si chiedono se serva un modello e rispondono che non ci si può necessariamente fidare di questa media [C09]: se la spesa media di tutti i clienti è di 35 $, che cosa prevedere per un cliente il cui unico riacquisto è costato 100 $ [C10]? Sulle settimane tenute da parte, i clienti la cui media dei riacquisti era inferiore a 20 $, 14,84 $ in media, hanno poi speso 26,82 $ per acquisto; quelli la cui media raggiungeva o superava 50 $, 79,07 $ in media, hanno speso 69,20 $. Gli scarti estremi di un piccolo numero di acquisti tendono a non ripetersi. Contare il primo acquisto nella media attenua già questo difetto.
- Prendere la media di tutti i clienti. Cancella le differenze reali tra clienti: sulle settimane tenute da parte, è la peggiore delle previsioni confrontate.
- Supporre una distribuzione normale, come Schmittlein e Peterson: ammette spese negative ed è simmetrica [C11], mentre le spese sono asimmetriche, con una lunga coda verso gli importi elevati [C12]. Qui la media degli importi per acquisto, 35,08 $, supera la mediana, 27,50 $, che supera la moda, 14,96 $.
Moltiplicare il numero di acquisti previsti per la media osservata del cliente è allettante; gli autori scrivono che così si ignora il ritorno verso la media [C46, C47].
05
L'intuizione
Il modello poggia su tre ipotesi di fondo [C14, C15, C16]: l'importo di ogni acquisto di un cliente varia a caso attorno alla sua media; queste medie differiscono da un cliente all'altro ma non cambiano nel tempo; e la loro distribuzione tra i clienti non dipende dalla frequenza d'acquisto. Vi aggiunge due scelte di forma, descritte più avanti.
Il modello impara dall'intera base due cose: quanto gli acquisti di uno stesso cliente variano attorno alla sua media, e quanto le medie variano da un cliente all'altro. Per ogni cliente, la previsione è una media ponderata tra la media della popolazione e la media osservata del cliente [C20]; più il cliente ha acquistato, più pesa la sua media [C21]. Su questi dati, un solo riacquisto dà già un peso di 0,69 alla media del cliente; quattro riacquisti, 0,90.
06
I dati necessari
Per ogni cliente, sul periodo di stima:
- il numero x dei suoi acquisti ripetuti, cioè senza contare il primo;
- l'importo medio z̄ di questi acquisti ripetuti: la tabella descrittiva degli autori riguarda il valore medio degli acquisti ripetuti [C07, C24].
Gli acquisti di uno stesso giorno si sommano e contano come un solo acquisto; questa convenzione ritrova esattamente i 946 clienti e la tabella descrittiva degli autori. I clienti senza acquisti ripetuti non entrano nella stima degli autori; la loro previsione è la media della popolazione [C48]. La variante della pagina conta anche il primo acquisto: vi entrano tutti i clienti, tranne 8 il cui unico acquisto è registrato a 0 $ nel file.
Bisogna poi verificare l'ipotesi di indipendenza: gli autori misurano una correlazione di 0,11 tra spesa media e numero di acquisti [C38], che non giudicano abbastanza forte da mettere in discussione il modello [C41].
07
Il modello formale
Questa sezione si rivolge al professionista. Chi deve decidere può saltarla e riprendere da «Il calcolo dichiarato»: basta la frase «In parole semplici» che la conclude.
- z₁, …, z_x: gli importi degli x acquisti ripetuti di un cliente; z̄ la loro media. Z indica l'importo di un acquisto; un accento circonflesso, come in p̂, indica un valore stimato.
- Ogni importo segue una distribuzione gamma di forma p e tasso ν (gli autori dicono «scala»; la media vale ζ = p/ν, la vera spesa media del cliente) [C17]. Il parametro p è lo stesso per tutti: tutti i clienti hanno lo stesso coefficiente di variazione, la deviazione standard di un acquisto rapportata alla media del cliente, 1/√p [C19].
- ν varia tra i clienti secondo una distribuzione gamma di forma q e tasso γ [C18]; queste due ipotesi di forma costituiscono il modello Gamma-Gamma [C53]. La vera media ζ = p/ν segue allora una distribuzione gamma inversa. La distribuzione gamma ha proprietà vicine a quelle della log-normale, con una coda un po' più sottile; a differenza della log-normale, dà formule chiuse [C13]. Il modello adatta quello di Colombo e Jiang [C54].
- Distribuzione della media osservata: f(z̄ | x) = Γ(px + q) / (Γ(px) Γ(q)) × γ^q z̄^(px−1) x^(px) / (γ + x z̄)^(px+q), dove Γ è la funzione gamma, che estende il fattoriale, da non confondere con il parametro γ. Questa formula dà la densità di probabilità di una media z̄ osservata dopo x acquisti.
- Media della popolazione: E(Z) = pγ / (q − 1).
- Previsione per un cliente: E(Z | z̄, x) = p(γ + x z̄) / (px + q − 1), cioè la media ponderata (1 − w) E(Z) + w z̄, con un peso w = px / (px + q − 1) dato alla media del cliente [C20, C21].
- Stima: si scelgono i valori di p, q e γ che rendono più verosimili le medie osservate dei 946 clienti, cioè il massimo della log-verosimiglianza, somma dei ln f(z̄ | x), trovato con un metodo numerico standard [C22].
In parole semplici: ogni cliente ha la sua vera spesa media, che i primi acquisti rivelano solo in parte; finché ha acquistato poco, si prevede un valore tra la sua media e quella di tutti, e più vicino alla sua a ogni acquisto.
08
Il calcolo dichiarato
- Dati. Il file pubblicato, letto così com'è: 6.919 righe, 2.357 clienti, 244.091,94 $; sommati gli acquisti di uno stesso giorno, restano 6.696 giorni d'acquisto. Stima sulle settimane da 1 a 39, fino al 30 settembre 1997; settimane da 40 a 78, dal 1° ottobre 1997 al 30 giugno 1998, tenute da parte, come per gli autori [C06].
- Controllo sui valori pubblicati. Prima di qualsiasi risultato, i due programmi ritrovano i 946 clienti che hanno riacquistato [C07], le otto righe della tabella descrittiva della nota [C24, C25, C26, C27, C28, C29, C30, C31], i tre parametri [C23], lo scarto di nove centesimi tra media teorica e media osservata [C34], le due mode [C35, C36], le correlazioni [C38, C39, C40], le log-verosimiglianze dell'articolo [C42] e la media su 78 settimane [C44]. Altrimenti si fermano con un errore. I quartili sono calcolati con la regola di Weibull, la posizione (n + 1) × probabilità, l'unica di uso comune che ritrova i due valori pubblicati.
- Stima del massimo di verosimiglianza sui logaritmi di p, q e γ, con il simplesso di Nelder-Mead, un algoritmo che cerca passo dopo passo l'adattamento migliore, riavviato fino a stabilità; i programmi verificano poi che in quel punto la pendenza della verosimiglianza sia nulla. La funzione log-gamma è scritta per esteso nei due linguaggi.
- Variante della pagina: lo stesso modello, stimato su tutti gli acquisti delle settimane da 1 a 39, primo compreso. È stata aggiunta dopo una prima lettura delle settimane tenute da parte, in seguito a una revisione: la sua validazione non è quindi cieca, e i suoi errori standard non tengono conto di questa scelta.
- Validazione sulle settimane tenute da parte: cinque previsioni della spesa media per acquisto sono confrontate con quanto i clienti hanno speso: la media degli acquisti ripetuti, la media di tutti gli acquisti, la media della popolazione, il modello degli autori e la variante. L'errore è la spesa osservata meno la previsione; se positivo, segnala una sottoprevisione. Ogni scarto è dato con il suo errore standard, che misura l'imprecisione dovuta alla sola scelta dei clienti; uno scarto superiore a due errori standard è considerato netto. Gli scarti sono calcolati prima dell'arrotondamento.
- Dispersione di un cliente attorno alla sua media: per i clienti con almeno tre riacquisti, il coefficiente di variazione osservato dei loro acquisti è confrontato con quello dato da 200 simulazioni del modello, con gli stessi numeri di acquisti.
- Incertezza: bootstrap, che estrae di nuovo a caso, con reinserimento, 1.000 volte 946 clienti tra i 946, e ristima ogni volta il modello; intervallo dal 25º al 975º valore ordinato. Questi intervalli sono detti al 95% nominale: è il livello cui mira il metodo, che nulla qui garantisce esattamente. Il generatore di numeri pseudo-casuali è scritto per esteso (seme 20261007; s ← 1103515245 · s + 12345 mod 2³¹), perché Python e R estraggano gli stessi numeri.
- Invarianti: 19 identità, tra cui la distribuzione di z̄ che integra a 1, la sua media uguale a pγ / (q − 1) e la previsione uguale alla media ponderata; i programmi si fermano se una fallisce.
09
L'esempio numerico completo
I risultati pubblicati, ricalcolati. Valore medio degli acquisti ripetuti per cliente, settimane da 1 a 39, in dollari:
| Statistica | Ricalcolata | Pubblicata |
|---|---|---|
| Minimo | 2,99 | 2,99 [C24] |
| Primo quartile | 15,745 | 15,75 [C25] |
| Mediana | 27,4975 | 27,50 [C26] |
| Terzo quartile | 41,7956 | 41,80 [C27] |
| Massimo | 299,6338 | 299,63 [C28] |
| Media | 35,0778 | 35,08 [C29] |
| Deviazione standard | 30,2835 | 30,28 [C30] |
| Moda | 14,96 | 14,96 [C31] |
I parametri sono ritrovati: p̂ = 6,2496, q̂ = 3,7442, γ̂ = 15,4435, contro 6,25, 3,74 e 15,44 pubblicati [C23]. Lo strumento Risolutore di Excel, nella cartella di lavoro degli autori, si ferma in un punto leggermente diverso alla quarta cifra decimale, perché la superficie di verosimiglianza è quasi piatta; il massimo raggiunto qui è appena più alto. La media teorica, 35,1704 $, supera la media osservata di 0,0925 $, i nove centesimi degli autori [C34]. La moda della distribuzione adattata cade a 19 $, quella dei dati a 14,96 $, come pubblicato [C35, C36]. La correlazione tra spesa media e numero di acquisti vale 0,1139, e 0,0570 senza il cliente con 21 acquisti e 299,63 $ di media; il test di nullità di questa correlazione dà allora un valore p di 0,0801. Sono gli 0,11, 0,06 e 0,08 pubblicati [C38, C39, C40].
Restano due scarti.
- La log-verosimiglianza. Al massimo, la formula della nota dà −4.055,92. L'articolo pubblica −4.659 [C42]. Lo scarto è esattamente la somma dei ln x dei 946 clienti, 603,37: −4.055,92 − 603,37 = −4.659,29. L'articolo ha quindi verosimilmente calcolato la verosimiglianza della spesa totale x z̄, benché la formula che riporta sia quella della media z̄; il massimo, e quindi i parametri, sono gli stessi. Con questa convenzione, i parametri stimati sulle 78 settimane danno −4.661,41 sulle settimane da 1 a 39, i −4.661 pubblicati [C42], e una media della popolazione di 35,81 $, i «36 $» degli autori [C44].
- L'asimmetria. L'articolo indica un'asimmetria di 4 e una curtosi di 17 [C32, C33]. La pagina trova 17,15 per la curtosi, in eccesso rispetto alla normale, ma 3,40 per l'asimmetria; nessuna variante di definizione provata dà 4.
Il modello adattato. Le vere medie dei clienti hanno media 35,17 $ e deviazione standard 26,63 $. Il modello stima a 0,40 il coefficiente di variazione degli acquisti di un cliente attorno alla sua media; il seguito mostra che i dati lo smentiscono.
La previsione per un cliente, in dollari per acquisto, secondo il modello degli autori:
| Acquisti ripetuti | Peso della media del cliente | Media osservata 20 $ | 50 $ | 100 $ |
|---|---|---|---|---|
| 1 | 0,6949 | 24,63 | 45,48 | 80,22 |
| 2 | 0,8200 | 22,73 | 47,33 | 88,33 |
| 4 | 0,9011 | 21,50 | 48,53 | 93,59 |
| 8 | 0,9480 | 20,79 | 49,23 | 96,63 |
Per il cliente con un unico riacquisto di 100 $, ci si attende 80,22 $ per acquisto; per quello con sei riacquisti di 20 $, 21,03 $. Il peso della media del cliente raggiunge il 90%, una soglia scelta dalla pagina, al quarto riacquisto; con i parametri stimati su 78 settimane, al settimo. Gli autori ritengono, senza una soglia numerica, che servano sette o otto acquisti prima di fidarsi della media osservata [C45].
La variante della pagina, stimata su tutti gli acquisti delle settimane da 1 a 39: p̂ = 9,8813, q̂ = 3,3988, γ̂ = 7,9286, media della popolazione 32,66 $. Per un cliente il cui unico acquisto è costato 100 $, la variante si attende 86,85 $, con un peso di 0,80 dato alla sua media. Per uno stesso cliente, il primo acquisto è più o meno pari ai riacquisti: 36,14 $ in media per i 946 clienti che hanno riacquistato, contro 35,08 $ per la media dei loro riacquisti, con un rapporto mediano di 0,97. Invece i 1.411 clienti che non hanno riacquistato avevano fatto un primo acquisto di soli 30,88 $: i clienti il cui primo acquisto era più piccolo hanno riacquistato meno. La variante mescola questi due gruppi, e la sua media della popolazione ne risulta abbassata.
La validazione sulle settimane da 40 a 78. Dei 946 clienti che hanno riacquistato, 491 acquistano di nuovo. Errore sulla loro spesa media per acquisto, in dollari, e scarto di errore assoluto rispetto alla media di tutti gli acquisti:
| Previsione | Errore assoluto medio | Radice dell'errore quadratico medio | Errore medio | Scarto rispetto alla media di tutti gli acquisti |
|---|---|---|---|---|
| Media degli acquisti ripetuti | 17,35 | 29,65 | 2,30 | +1,26 (errore standard 0,45) |
| Media di tutti gli acquisti | 16,09 | 28,28 | 2,05 | — |
| Media della popolazione | 18,94 | 31,62 | 2,67 | +2,85 (0,91) |
| Modello degli autori | 16,37 | 28,06 | 2,17 | +0,28 (0,41) |
| Variante della pagina | 15,78 | 27,83 | 2,19 | −0,31 (0,09) |
Il modello degli autori riduce l'errore del 5,6% rispetto alla media dei soli riacquisti del cliente, cioè 0,98 $ per acquisto (errore standard 0,25), ma non fa meglio della media di tutti gli acquisti: il suo scarto, +0,28 $, è inferiore al suo errore standard. La variante fa meglio di questa media semplice, dell'1,9%, cioè 0,31 $ per acquisto; rispetto al modello degli autori, il suo vantaggio, 0,59 $ (errore standard 0,37), non è netto. È un miglioramento medio: la variante batte la media semplice per 285 clienti su 491, cioè il 58,0%.
Per altri 193 clienti, che non avevano fatto alcun riacquisto durante la stima ma acquistano dopo, il valore del loro unico acquisto sbaglia di 20,25 $, la media della popolazione, previsione del modello degli autori, di 20,92 $, la variante di 18,75 $. Il vantaggio della variante è netto rispetto all'unico acquisto, 1,51 $ (errore standard 0,44), ma non rispetto alla media della popolazione, 2,17 $ (errore standard 1,72). Sui 684 clienti che acquistano in queste settimane, l'errore vale 17,27 $ per la media di tutti gli acquisti, 17,65 $ per il modello degli autori, 16,62 $ per la variante; lo scarto tra la variante e il modello degli autori, 1,03 $ (errore standard 0,55), non è netto.
Il ritorno verso la media, per fascia di media dei riacquisti, previsioni del modello degli autori e della variante:
| Fascia di media dei riacquisti | Clienti | Media dei riacquisti | Modello degli autori | Variante | Spesa osservata dopo | Osservata meno modello degli autori |
|---|---|---|---|---|---|---|
| Meno di 20 $ | 149 | 14,84 | 19,40 | 19,65 | 26,82 | 7,42 (errore standard 1,61) |
| Da 20 a 50 $ | 255 | 32,78 | 33,16 | 32,91 | 33,57 | 0,41 (1,10) |
| 50 $ e oltre | 87 | 79,07 | 70,84 | 71,03 | 69,20 | −1,64 (5,70) |
I due modelli spingono le medie estreme nella direzione giusta, ma non abbastanza: gli importi per acquisto piccoli sono nettamente sottoprevisti, di 7,42 $ per acquisto; quelli elevati sono sovraprevisti di 1,64 $, entro il margine del caso.
Il totale della base. Moltiplicata per il numero di acquisti effettivamente fatti, la previsione del modello degli autori dà 68.181,97 $ di spesa sulle settimane da 40 a 78, contro 70.976,39 $ osservati, cioè −3,9%; la variante, −4,6%; la media di tutti gli acquisti, −4,2%. Per numero di riacquisti durante la stima, spesa totale media per cliente in queste settimane:
| Riacquisti | Clienti | Osservata | Prevista dal modello degli autori | Scarto |
|---|---|---|---|---|
| 0 | 1.411 | 8,30 | 8,33 | −0,03 (errore standard 0,55) |
| 1 | 439 | 27,42 | 23,16 | 4,26 (1,82) |
| 2 | 214 | 51,92 | 53,72 | −1,80 (3,95) |
| 3 | 100 | 63,19 | 56,23 | 6,96 (4,47) |
| 4 | 62 | 90,98 | 100,75 | −9,77 (6,54) |
| 5 | 38 | 124,45 | 105,70 | 18,75 (13,68) |
| 6 | 29 | 127,17 | 126,74 | 0,43 (8,29) |
| 7 e oltre | 64 | 246,04 | 237,63 | 8,42 (12,84) |
Solo la riga di un riacquisto si scosta oltre il caso: questi clienti sono sottoprevisti di 4,26 $. Gli autori, che non riportano errori standard, giudicano a occhio che nessuna distorsione particolare metta in discussione le loro ipotesi [C50].
La dispersione di un cliente attorno alla sua media. Per i 293 clienti con almeno tre riacquisti, il coefficiente di variazione mediano dei loro acquisti vale 0,47. Calcolato su pochi acquisti, un coefficiente di variazione è in media più piccolo di quello vero: il modello se ne attende quindi 0,36 e non 0,40, e nel 95% delle 200 simulazioni, tra 0,34 e 0,38. Gli acquisti di un cliente variano quindi nettamente più di quanto il modello supponga, soprattutto quando la sua spesa è elevata: 0,38 per i 61 clienti sotto i 20 $, 0,48 per i 180 da 20 a 50 $, 0,50 per i 52 da 50 $ in su.
10
Le ipotesi di validità
- Una spesa indipendente dalla frequenza [C16]. Qui la correlazione è di 0,11, dimezzata togliendo un solo cliente [C38, C39], e gli autori non vi vedono una violazione seria [C41]. Ma i clienti che non riacquistano avevano fatto un primo acquisto più piccolo, 30,88 $ contro 36,14 $ (scarto di 5,26 $, errore standard 1,47): un indizio che spesa e frequenza non sono del tutto indipendenti. Per prodotti di cui i clienti fanno scorta ci si può attendere un legame ancora più forte tra il ritmo degli acquisti e il loro importo [C51]. I vostri grandi acquirenti acquistano anche più spesso, o meno spesso?
- Una spesa media stabile nel tempo per ogni cliente [C15]. La log-verosimiglianza cambia appena passando da 39 a 78 settimane [C42, C43], ma i parametri si spostano: il peso di un solo riacquisto passa da 0,69 a 0,59, e il cliente con un unico riacquisto di 100 $ passa da 80,22 $ a 73,99 $. Il livello medio, invece, è cambiato poco: un riacquisto valeva in media 38,81 $ durante la stima, un acquisto 37,71 $ dopo. I vostri prezzi, la vostra offerta o la vostra clientela sono cambiati dal periodo di stima?
- Lo stesso coefficiente di variazione per tutti i clienti [C19]. I dati lo smentiscono: gli acquisti di un cliente variano più del previsto, soprattutto tra i grandi clienti. È una pista per spiegare l'insufficiente ritorno verso la media, ma non spiega la sottoprevisione degli importi per acquisto piccoli, la cui dispersione è vicina a quella del modello. I vostri grandi clienti hanno importi per acquisto più irregolari di quelli piccoli?
- Una distribuzione gamma degli importi, senza soglie di prezzo. Il modello non conosce i prezzi tondi o psicologici, in ,99: colloca la moda a 19 $ quando i dati la collocano al prezzo di un disco, 15 $ [C35, C36, C37]. Gli autori hanno preferito un modello semplice a un adattamento migliore [C52]. I vostri importi per acquisto si concentrano su pochi prezzi?
- Solo acquisti ripetuti, nel modello degli autori: il primo acquisto non entra nella media, e i clienti senza riacquisti ricevono la media della popolazione [C48]. Quale quota dei vostri clienti non ha ancora riacquistato?
- Verificabile solo indirettamente: la distribuzione gamma inversa delle vere medie, poiché non si osserva mai una vera media, solo medie di pochi acquisti; si giudica dall'adattamento della distribuzione delle medie osservate. Non verificabile qui: che la media di un cliente resti stabile oltre il 30 giugno 1998.
11
Diagnostica e incertezza
- Adattamento: confrontare la distribuzione delle medie osservate con quella prevista dal modello. Qui la media teorica si scosta da quella osservata di soli 0,0925 $, ma la moda prevista, 19 $, supera quella osservata, 14,96 $ [C35].
- Indipendenza: calcolare la correlazione tra spesa media e numero di acquisti, con e senza i clienti estremi [C38, C40], e confrontare il primo acquisto di chi riacquista e di chi non riacquista.
- Dispersione di un cliente: confrontare il coefficiente di variazione osservato degli acquisti di ciascun cliente con quello del modello; qui 0,47 contro 0,36.
- Validazione fuori periodo: confrontare il modello con le medie semplici, compresa la media di tutti gli acquisti, con l'errore standard di ogni scarto. Ponderato per il numero di acquisti fatti dopo, l'errore assoluto medio mantiene la stessa classifica: 13,44 $ per la variante, 13,60 $ per il modello degli autori, 13,80 $ per la media di tutti gli acquisti, 14,61 $ per la media dei riacquisti.
- Incertezza di stima, con il bootstrap sui 946 clienti, intervalli al 95% nominale: la media della popolazione va da 33,26 a 37,02 $; la previsione per il cliente con un unico riacquisto di 100 $, da 72,95 a 88,58 $; il peso di un solo riacquisto, da 0,59 a 0,82; il coefficiente di variazione, da 0,30 a 0,46; la deviazione standard delle vere medie, da 21,75 a 32,58 $. I dati distinguono male p da γ: p va da 4,68 a 10,85 e γ da 7,42 a 24,47, mentre le previsioni, che li combinano, restano più stabili. Questi intervalli riguardano previsioni medie, non quanto un cliente spenderà realmente: un singolo acquisto varia molto di più.
- Ciò che la validazione non verifica: riguarda solo i clienti che acquistano di nuovo, ciascuno con lo stesso peso qualunque sia il suo numero di acquisti; usa il numero di acquisti effettivamente fatti sulle settimane da 40 a 78 e non giudica la previsione di questo numero, che spetta a un altro modello [C49]. Queste settimane comprendono le feste di fine anno 1997, che potrebbero alzare la spesa, cosa che il livello medio non mostra. Nulla si dice oltre il 30 giugno 1998.
- Ciò che questi dati non possono stabilire: un solo rivenditore, un solo prodotto, clienti acquisiti nel 1997; il risultato non si trasferisce senza controllo.
12
Interpretazione
Tre insegnamenti. Primo, la media dei riacquisti di un cliente è una cattiva previsione quando ha acquistato poco: un unico riacquisto di 100 $ annuncia circa 80 $, non 100 $. Il modello quantifica questo ritorno verso la media invece di indovinarlo.
Secondo, su questi dati il modello degli autori non aggiunge nulla rispetto a una media semplice di tutti gli acquisti, primo compreso: batte la media dei soli riacquisti perché corregge, ma si priva dell'informazione del primo acquisto. Alimentato con tutti gli acquisti, lo stesso modello fa un po' meglio di questa media semplice, in media sui clienti; ma è stato scelto a posteriori, e il suo vantaggio sul modello degli autori non è netto. Nessuno dei due prevede meglio il totale della base: il miglioramento riguarda il valore di ciascun cliente, non il fatturato complessivo.
Infine, il modello corregge troppo poco: i clienti sotto i 20 $ hanno poi speso 26,82 $ per acquisto, quando ne prevedeva 19,40. Questi dati non ne rivelano la causa. Una dispersione di ciascun cliente più forte del previsto è misurata qui, ma riguarda soprattutto i grandi clienti; le soglie di prezzo, la forma della distribuzione delle vere medie, il legame tra spesa e frequenza o un cambiamento nel tempo restano possibili.
13
Conclusioni ammesse e vietate
- Ammesso: «Per un cliente di CDNOW che ha riacquistato una sola volta, per 100 $, il modello degli autori prevede una spesa media di circa 80 $ per acquisto per i suoi acquisti successivi, da 72,95 a 88,58 $ al 95% nominale contando solo l'incertezza di stima.»
- Ammesso: «Sulle settimane da 40 a 78, il modello stimato su tutti gli acquisti, una variante scelta dopo una prima lettura di queste settimane, sbaglia in media di 15,78 $ per acquisto, contro 16,09 $ della media di tutti gli acquisti del cliente; va confermato su altri dati.»
- Vietato: presentare la previsione del modello come il valore di un cliente. Prevede solo l'importo per acquisto; va combinata con un modello del numero di acquisti, come fanno gli autori [C49], poi con un margine e un tasso di attualizzazione [C55, C56].
- Vietato: affermare che il modello degli autori prevede meglio della media passata del cliente senza dire quale: batte la media dei riacquisti, non la media di tutti gli acquisti.
- Vietato: concluderne che un'azione di marketing farebbe spendere di più. Il modello descrive delle spese; non misura l'effetto di alcuna azione.
- Vietato: applicare i parametri di CDNOW a un'altra impresa, o applicare il modello senza aver verificato che la spesa dei vostri clienti non dipenda dalla loro frequenza d'acquisto [C51].
14
Decisione di marketing possibile
- Valutare ogni cliente con una previsione corretta, non con la media dei suoi soli riacquisti; in mancanza di un modello, la media di tutti i suoi acquisti fa quasi altrettanto bene. Il modello stimato su tutti gli acquisti può essere preso in considerazione, poi validato sui propri dati, su un periodo non ancora esaminato. Moltiplicare poi per il numero di acquisti futuri atteso, ciascuno riportato al suo valore di oggi, e per il margine, come fanno gli autori, che adottano un margine del 30% e un'attualizzazione del 15% annuo [C49, C55, C56].
- Né sovrastimare un singolo acquisto elevato, né sottostimarne uno piccolo: un unico riacquisto di 100 $ vale una previsione di 80,22 $ secondo il modello degli autori, e un cliente con 20 $ di media dopo un solo riacquisto, 24,63 $; i dati mostrano anzi che la correzione dovrebbe essere più forte per gli importi per acquisto piccoli.
- Controllare sui propri dati, prima di servirsene, l'indipendenza tra spesa e frequenza, la dispersione degli acquisti di ciascun cliente e la validazione rispetto alla media di tutti gli acquisti; ristimare dopo ogni cambiamento di prezzo.
La decisione resta umana e coinvolge la direzione marketing e, per il valore dei clienti, la direzione finanziaria.
15
Quando usarlo, quando non usarlo
- Usare: acquisti ripetuti di importo variabile, al di fuori degli abbonamenti, quando si vuole il valore di ciascun cliente; a complemento di un modello del numero di acquisti, come quello della pagina sulla stima della CLV non contrattuale o quello della pagina sul valore di un cliente stagionale.
- Usare con prudenza quando la spesa dipende dalla frequenza, per esempio per prodotti di cui si fa scorta [C51]: serve allora un modello che colleghi il numero di acquisti e il loro importo invece di supporli indipendenti. Prudenza anche quando i prezzi si concentrano su pochi valori [C37], o quando gli acquisti di un cliente sono molto irregolari.
- Non usare per un abbonamento a prezzo fisso, dove l'importo è noto: si veda la pagina sul valore di un abbonato; né per valutare l'intera base con i clienti futuri: si veda la pagina sul valore della base clienti.
- Non usare per misurare l'effetto di un'azione sulla spesa: serve un esperimento.
- Per esprimere l'incertezza di un risultato, si veda la pagina sull'espressione dell'incertezza; per giudicare una previsione su un periodo tenuto da parte, quella sulla validazione di una previsione di marketing.
16
Implementazioni riproducibili
- Python 3.14.5, solo libreria standard: msc-p046-reference.py, da eseguire con
python msc-p046-reference.py - R 4.6.1, solo base: msc-p046-reference.R, da eseguire con
Rscript msc-p046-reference.R - I dati non sono ridistribuiti: scaricare il campione CDNOW da brucehardie.com/datasets e collocare
CDNOW_sample.txtaccanto ai programmi. - I due programmi stampano esattamente le stesse righe; la loro impronta sha256, dopo normalizzazione dei fine riga, è registrata nel manifest del dossier. Seme dichiarato 20261007. Nessuna libreria di terze parti: il software non convalida il metodo, lo riproduce.
17
Cosa si consegna
Per ogni cliente, il numero di acquisti, il loro importo medio e la previsione corretta con il suo peso; i parametri stimati e il loro intervallo; il controllo di indipendenza tra spesa e frequenza e quello della dispersione di ciascun cliente; la validazione su un periodo tenuto da parte, rispetto alla media di tutti gli acquisti, con gli errori standard; e le ipotesi da verificare prima di decidere.
18
Riferimenti e livello di evidenza
- Fader, P. S., Hardie, B. G. S. & Lee, K. L. (2005). RFM and CLV: Using Iso-Value Curves for Customer Base Analysis. Journal of Marketing Research 42(4), 415–430. — versione degli autori diffusa da Bruce Hardie, testo integrale verificato; vi sono citati Schmittlein e Peterson (1994) e Colombo e Jiang (1999).
- Fader, P. S. & Hardie, B. G. S. (2013). The Gamma-Gamma Model of Monetary Value. Nota tecnica. brucehardie.com/notes/025 — testo integrale verificato.
- Campione CDNOW e relativa documentazione, pubblicati da Bruce Hardie: brucehardie.com/datasets (CDNOW_sample.zip); la coorte completa conta 23.570 clienti [C04].
- Livello di evidenza: dati reali, un rivenditore, 1997 e 1998; risultati pubblicati ritrovati a partire dai dati, tranne l'asimmetria; validazione su 39 settimane tenute da parte, con una variante aggiunta dopo una prima lettura di queste settimane; riproducibile in Python e in R. Non è una prova che il modello si adatti alla vostra impresa.
Connessioni metodologiche

