Wie viel gibt ein Kunde pro Kauf aus? Das Gamma-Gamma-Modell
Gamma-Gamma-Modell: die Ausgaben pro Kauf jedes Kunden aus früheren Käufen vorhersagen, an echten CDNOW-Daten und einem zurückgehaltenen Zeitraum geprüft.
Wissenschaftliche Redaktion: Marketing Science Center
Direkte Antwort
Die durchschnittlichen Ausgaben pro Kauf jedes Kunden aus Zahl und Betrag seiner Käufe vorhersagen, mit Intervall, und die Vorhersage an einem zurückgehaltenen Zeitraum gegen einfache Mittelwerte validieren.
Gamma-Gamma-Modell: die Ausgaben pro Kauf jedes Kunden aus früheren Käufen vorhersagen, an echten CDNOW-Daten und einem zurückgehaltenen Zeitraum geprüft.
01
Das Wichtigste in Kürze
Der Wert eines Kunden hängt von zwei Dingen ab: wie oft er kaufen wird und wie viel er bei jedem Kauf ausgeben wird. Das Gamma-Gamma-Modell von Fader, Hardie und Lee behandelt das Zweite [C02]: Es prognostiziert die durchschnittlichen Ausgaben pro Kauf, den durchschnittlichen Kaufbetrag, jedes Kunden aus seinen bisherigen Käufen [C01]. Seine Regel: Die Prognose zieht den beobachteten Durchschnitt eines Kunden zum Durchschnitt aller Kunden hin, umso stärker, je weniger er gekauft hat [C20, C21].
Das Programm der Seite wendet es auf die von den Autoren veröffentlichten realen Daten an: 2.357 Kunden des Online-Plattenhändlers CDNOW, gewonnen im ersten Quartal 1997 [C03, C04]. Es findet die von den Autoren zu diesen Daten veröffentlichten Ergebnisse wieder, mit Ausnahme einer deskriptiven Kennzahl. Dann beurteilt es die Prognosen anhand von neununddreißig Wochen, die die Schätzung nicht gesehen hat, für die 491 Kunden, die erneut kaufen:
- Das Modell der Autoren, das nur die Wiederholungskäufe verwendet, liegt im Mittel um 16,37 $ pro Kauf daneben; das ist deutlich besser als der Durchschnitt allein dieser Käufe, 17,35 $, aber nicht besser als der Durchschnitt aller Käufe des Kunden, den ersten eingeschlossen, 16,09 $;
- dasselbe Modell, mit allen Käufen geschätzt, eine von der Seite nach einer ersten Auswertung dieser Wochen hinzugefügte Variante, liegt um 15,78 $ daneben: etwas besser als dieser einfache Durchschnitt, aber ohne deutliche Abweichung vom Modell der Autoren. Sie muss sich an anderen Daten noch bestätigen.
Das Modell unterschätzt außerdem die Streuung der Käufe eines Kunden um seinen Durchschnitt, und es korrigiert die niedrigen Kaufbeträge zu wenig. Es dient dazu, Durchschnitte zu korrigieren, die auf wenigen Käufen beruhen; die Summe über den Kundenstamm prognostiziert es nicht besser.
02
Die Situation
Ein Online-Plattenhändler hat seine Kunden im ersten Quartal 1997 gewonnen. Am 30. September 1997 haben 946 der 2.357 Kunden der Stichprobe mindestens einmal wieder gekauft [C07]. Um ihren Wert zu beziffern, verfügt das Marketingteam bereits über ein Modell, das prognostiziert, wie viele Käufe jeder tätigen wird, etwa das der Seite zur Schätzung des nicht vertraglichen CLV; ihm fehlt der Betrag dieser Käufe.
Zwei Kunden bereiten ihm Kopfzerbrechen. Der erste hat ein einziges Mal wieder gekauft, für 100 $; der zweite sechsmal, für durchschnittlich 20 $. Soll man für den ersten 100 $ prognostizieren, für den zweiten 20 $ oder etwas anderes?
Die Daten der Seite sind die von CDNOW, so wie Bruce Hardie sie veröffentlicht: eine systematische Stichprobe von einem Zehntel der Kohorte [C03], also 6.919 Zeilen mit Kaufdatum, Zahl der Tonträger und Betrag in Dollar [C05].
03
Die wissenschaftliche Frage
Welcher durchschnittliche Kaufbetrag ist von einem Kunden zu erwarten, wenn man die Zahl x seiner Wiederholungskäufe und deren durchschnittlichen Betrag z̄ kennt? Der beobachtete Durchschnitt ist nur eine unvollkommene Schätzung des wahren Durchschnitts des Kunden, den man nicht sieht [C08]; er muss also korrigiert werden, es ist anzugeben, um wie viel, und zu prüfen, ob die Korrektur besser prognostiziert als die einfachen Durchschnitte.
04
Warum die einfache Methode scheitert
Drei verbreitete Behelfslösungen:
- Den bisherigen Durchschnitt des Kunden nehmen. Die Autoren fragen, ob es ein Modell braucht, und antworten, dass man sich nicht unbedingt auf diesen Durchschnitt verlassen kann [C09]: Wenn die durchschnittlichen Ausgaben aller Kunden 35 $ betragen, was ist dann für einen Kunden zu prognostizieren, dessen einziger Wiederholungskauf 100 $ gekostet hat [C10]? In den zurückgehaltenen Wochen (Holdout) gaben die Kunden, deren Durchschnitt der Wiederholungskäufe unter 20 $ lag, im Mittel 14,84 $, danach 26,82 $ pro Kauf aus; die, deren Durchschnitt 50 $ erreichte oder überstieg, im Mittel 79,07 $, gaben 69,20 $ aus. Die extremen Abweichungen weniger Käufe wiederholen sich tendenziell nicht. Den ersten Kauf in den Durchschnitt einzubeziehen, mildert diesen Mangel bereits.
- Den Durchschnitt aller Kunden nehmen. Er verwischt die echten Unterschiede zwischen den Kunden: In den zurückgehaltenen Wochen ist er die schlechteste der verglichenen Prognosen.
- Eine Normalverteilung annehmen, wie Schmittlein und Peterson: Sie lässt negative Ausgaben zu und ist symmetrisch [C11], während Ausgaben schief verteilt sind, mit einem langen Ausläufer zu hohen Beträgen [C12]. Hier übersteigt der Mittelwert der Kaufbeträge, 35,08 $, den Median, 27,50 $, der wiederum den Modus, 14,96 $, übersteigt.
Die prognostizierte Zahl der Käufe mit dem beobachteten Durchschnitt des Kunden zu multiplizieren, ist verlockend; die Autoren schreiben, dass dies die Regression zur Mitte ignoriert [C46, C47].
05
Die Intuition
Das Modell beruht auf drei grundlegenden Annahmen [C14, C15, C16]: Der Betrag jedes Kaufs eines Kunden schwankt zufällig um seinen eigenen Durchschnitt; diese Durchschnitte unterscheiden sich von Kunde zu Kunde, ändern sich aber nicht im Zeitverlauf; und ihre Verteilung über die Kunden hängt nicht von der Kaufhäufigkeit ab. Hinzu kommen zwei Annahmen zur Verteilungsform, die weiter unten erläutert werden.
Aus dem gesamten Kundenstamm lernt das Modell zweierlei: wie stark die Käufe eines Kunden um seinen Durchschnitt schwanken und wie stark die Durchschnitte von Kunde zu Kunde schwanken. Für jeden Kunden ist die Prognose ein gewichteter Durchschnitt aus dem Mittelwert der Population und dem beobachteten Durchschnitt des Kunden [C20]; je mehr der Kunde gekauft hat, desto stärker zählt sein eigener Durchschnitt [C21]. Bei diesen Daten gibt bereits ein einziger Wiederholungskauf dem Durchschnitt des Kunden ein Gewicht von 0,69; vier Wiederholungskäufe ein Gewicht von 0,90.
06
Die benötigten Daten
Für jeden Kunden, über den Schätzzeitraum:
- die Zahl x seiner Wiederholungskäufe, also ohne den ersten Kauf;
- der durchschnittliche Betrag z̄ dieser Wiederholungskäufe: Die deskriptive Tabelle der Autoren bezieht sich auf den durchschnittlichen Wert der Wiederholungskäufe [C07, C24].
Käufe desselben Tages werden addiert und zählen als ein einziger Kauf; mit dieser Konvention werden die 946 Kunden und die deskriptive Tabelle der Autoren exakt wiedergefunden. Kunden ohne Wiederholungskauf gehen nicht in die Schätzung der Autoren ein; ihre Prognose ist der Mittelwert der Population [C48]. Die Variante der Seite zählt auch den ersten Kauf: Alle Kunden gehen ein, außer 8, deren einziger Kauf in der Datei mit 0 $ verbucht ist.
Anschließend ist die Unabhängigkeitsannahme zu prüfen: Die Autoren messen eine Korrelation von 0,11 zwischen durchschnittlichen Ausgaben und Zahl der Käufe [C38], die sie nicht für stark genug halten, um das Modell infrage zu stellen [C41].
07
Das formale Modell
Dieser Abschnitt richtet sich an Praktiker. Wer entscheidet, kann ihn überspringen und bei „Die offengelegte Berechnung“ weiterlesen: Der Satz „Kurz gesagt“ an seinem Ende genügt.
- z₁, …, z_x: die Beträge der x Wiederholungskäufe eines Kunden; z̄ ihr Durchschnitt. Z bezeichnet den Betrag eines Kaufs; ein Dach, wie in p̂, bezeichnet einen geschätzten Wert.
- Jeder Betrag folgt einer Gammaverteilung mit Form p und Rate ν (die Autoren sagen „Skala“; der Erwartungswert beträgt ζ = p/ν, die wahren durchschnittlichen Ausgaben des Kunden) [C17]. Der Parameter p ist für alle gleich: Alle Kunden haben denselben Variationskoeffizienten, die Standardabweichung eines Kaufs im Verhältnis zum Durchschnitt des Kunden, 1/√p [C19].
- ν variiert zwischen den Kunden gemäß einer Gammaverteilung mit Form q und Rate γ [C18]; diese beiden Annahmen zur Verteilungsform bilden das Gamma-Gamma-Modell [C53]. Der wahre Durchschnitt ζ = p/ν folgt dann einer inversen Gammaverteilung. Die Gammaverteilung hat ähnliche Eigenschaften wie die Lognormalverteilung, mit einem etwas dünneren Ausläufer; anders als die Lognormalverteilung liefert sie geschlossene Formeln [C13]. Das Modell passt das von Colombo und Jiang an [C54].
- Verteilung des beobachteten Durchschnitts: f(z̄ | x) = Γ(px + q) / (Γ(px) Γ(q)) × γ^q z̄^(px−1) x^(px) / (γ + x z̄)^(px+q), wobei Γ die Gammafunktion ist, die die Fakultät fortsetzt, nicht zu verwechseln mit dem Parameter γ. Diese Formel gibt die Wahrscheinlichkeitsdichte eines nach x Käufen beobachteten Durchschnitts z̄ an.
- Mittelwert der Population: E(Z) = pγ / (q − 1).
- Prognose für einen Kunden: E(Z | z̄, x) = p(γ + x z̄) / (px + q − 1), also der gewichtete Durchschnitt (1 − w) E(Z) + w z̄, mit einem Gewicht w = px / (px + q − 1) für den Durchschnitt des Kunden [C20, C21].
- Schätzung: Man wählt die Werte von p, q und γ, die die beobachteten Durchschnitte der 946 Kunden am plausibelsten machen, also das Maximum der Log-Likelihood, der Summe der ln f(z̄ | x), gefunden mit einem gängigen numerischen Verfahren [C22].
Kurz gesagt: Jeder Kunde hat seine wahren durchschnittlichen Ausgaben, die seine ersten Käufe nur teilweise offenbaren; solange er wenig gekauft hat, prognostiziert man einen Wert zwischen seinem Durchschnitt und dem aller Kunden, und mit jedem Kauf näher an seinem eigenen.
08
Die offengelegte Berechnung
- Daten. Die veröffentlichte Datei, unverändert eingelesen: 6.919 Zeilen, 2.357 Kunden, 244.091,94 $; nach Addition der Käufe desselben Tages bleiben 6.696 Kauftage. Schätzung anhand der Wochen 1 bis 39, bis zum 30. September 1997; die Wochen 40 bis 78, vom 1. Oktober 1997 bis zum 30. Juni 1998, werden zurückgehalten, wie bei den Autoren [C06].
- Prüfung an den veröffentlichten Werten. Vor jedem Ergebnis finden beide Programme die 946 Kunden mit Wiederholungskauf wieder [C07], die acht Zeilen der deskriptiven Tabelle der technischen Notiz [C24, C25, C26, C27, C28, C29, C30, C31], die drei Parameter [C23], die Abweichung von neun Cent zwischen theoretischem und beobachtetem Mittelwert [C34], die beiden Modi [C35, C36], die Korrelationen [C38, C39, C40], die Log-Likelihoods des Artikels [C42] und den Mittelwert über 78 Wochen [C44]. Andernfalls brechen sie mit einem Fehler ab. Die Quartile werden nach der Weibull-Regel berechnet, mit der Position (n + 1) × Wahrscheinlichkeit, der einzigen gängigen Regel, die beide veröffentlichten Werte wiederfindet.
- Maximum-Likelihood-Schätzung auf den Logarithmen von p, q und γ, mit dem Nelder-Mead-Simplex, einem Algorithmus, der Schritt für Schritt die beste Anpassung sucht, bis zur Stabilität neu gestartet; die Programme prüfen anschließend, dass die Steigung der Likelihood dort null ist. Die Log-Gamma-Funktion ist in beiden Sprachen vollständig ausgeschrieben.
- Variante der Seite: dasselbe Modell, mit allen Käufen der Wochen 1 bis 39 geschätzt, den ersten eingeschlossen. Sie wurde nach einer ersten Auswertung der zurückgehaltenen Wochen infolge einer Prüfung hinzugefügt: Ihre Validierung ist daher nicht blind, und ihre Standardfehler berücksichtigen diese Wahl nicht.
- Validierung an den zurückgehaltenen Wochen: Fünf Prognosen der durchschnittlichen Ausgaben pro Kauf werden mit dem verglichen, was die Kunden ausgegeben haben: der Durchschnitt der Wiederholungskäufe, der Durchschnitt aller Käufe, der Mittelwert der Population, das Modell der Autoren und die Variante. Der Fehler ist die beobachtete Ausgabe minus die Prognose; ist er positiv, zeigt er eine zu niedrige Prognose an. Jede Abweichung wird mit ihrem Standardfehler angegeben, der nur die Unschärfe aus der Auswahl der Kunden misst; eine Abweichung von mehr als zwei Standardfehlern gilt als deutlich. Die Abweichungen werden vor dem Runden berechnet.
- Streuung eines Kunden um seinen Durchschnitt: Für die Kunden mit mindestens drei Wiederholungskäufen wird der beobachtete Variationskoeffizient ihrer Käufe mit dem verglichen, den 200 Simulationen des Modells mit denselben Kaufzahlen ergeben.
- Unsicherheit: Bootstrap, der 1.000 Mal erneut zufällig, mit Zurücklegen, 946 Kunden aus den 946 zieht und das Modell jedes Mal neu schätzt; Intervall vom 25. bis zum 975. sortierten Wert. Diese Intervalle heißen nominal 95 %: Das ist das von der Methode angestrebte Niveau, das hier nichts exakt garantiert. Der Pseudozufallszahlengenerator ist vollständig ausgeschrieben (Startwert 20261007; s ← 1103515245 · s + 12345 mod 2³¹), damit Python und R dieselben Zahlen ziehen.
- Invarianten: 19 Identitäten, darunter die Verteilung von z̄, deren Integral 1 ergibt, ihr Erwartungswert gleich pγ / (q − 1) und die Prognose gleich dem gewichteten Durchschnitt; die Programme brechen ab, wenn eine davon verletzt ist.
09
Das vollständige Zahlenbeispiel
Die veröffentlichten Ergebnisse, neu berechnet. Durchschnittlicher Wert der Wiederholungskäufe pro Kunde, Wochen 1 bis 39, in Dollar:
| Kennzahl | Neu berechnet | Veröffentlicht |
|---|---|---|
| Minimum | 2,99 | 2,99 [C24] |
| Erstes Quartil | 15,745 | 15,75 [C25] |
| Median | 27,4975 | 27,50 [C26] |
| Drittes Quartil | 41,7956 | 41,80 [C27] |
| Maximum | 299,6338 | 299,63 [C28] |
| Mittelwert | 35,0778 | 35,08 [C29] |
| Standardabweichung | 30,2835 | 30,28 [C30] |
| Modus | 14,96 | 14,96 [C31] |
Die Parameter werden wiedergefunden: p̂ = 6,2496, q̂ = 3,7442, γ̂ = 15,4435, gegenüber veröffentlichten 6,25, 3,74 und 15,44 [C23]. Der Solver in der Arbeitsmappe der Autoren hält an der vierten Nachkommastelle an einer leicht anderen Stelle an, weil die Likelihood-Fläche fast flach ist; das hier erreichte Maximum liegt minimal höher. Der theoretische Mittelwert, 35,1704 $, übersteigt den beobachteten um 0,0925 $, die neun Cent der Autoren [C34]. Der Modus der angepassten Verteilung liegt bei 19 $, der der Daten bei 14,96 $, wie veröffentlicht [C35, C36]. Die Korrelation zwischen durchschnittlichen Ausgaben und Zahl der Käufe beträgt 0,1139, und 0,0570 ohne den Kunden mit 21 Käufen und 299,63 $ Durchschnitt; der Test, ob diese Korrelation null ist, ergibt dann einen p-Wert von 0,0801. Das sind die veröffentlichten 0,11, 0,06 und 0,08 [C38, C39, C40].
Zwei Abweichungen bleiben.
- Die Log-Likelihood. Im Maximum ergibt die Formel der technischen Notiz −4.055,92. Der Artikel veröffentlicht −4.659 [C42]. Die Abweichung ist genau die Summe der ln x der 946 Kunden, 603,37: −4.055,92 − 603,37 = −4.659,29. Der Artikel hat also vermutlich die Likelihood der Gesamtausgaben x z̄ berechnet, obwohl die angegebene Formel die des Durchschnitts z̄ ist; das Maximum und damit die Parameter sind dieselben. Mit dieser Konvention ergeben die auf den 78 Wochen geschätzten Parameter −4.661,41 für die Wochen 1 bis 39, die veröffentlichten −4.661 [C42], und einen Mittelwert der Population von 35,81 $, die „36 $“ der Autoren [C44].
- Die Schiefe. Der Artikel gibt eine Schiefe von 4 und eine Wölbung von 17 an [C32, C33]. Die Seite findet 17,15 für die Wölbung, als Exzess gegenüber der Normalverteilung, aber 3,40 für die Schiefe; keine der erprobten Definitionsvarianten ergibt 4.
Das angepasste Modell. Die wahren Durchschnitte der Kunden haben einen Mittelwert von 35,17 $ und eine Standardabweichung von 26,63 $. Das Modell schätzt den Variationskoeffizienten der Käufe eines Kunden um seinen eigenen Durchschnitt auf 0,40; das Folgende zeigt, dass die Daten dem widersprechen.
Die Prognose für einen Kunden, in Dollar pro Kauf, nach dem Modell der Autoren:
| Wiederholungskäufe | Gewicht des Kundendurchschnitts | Beobachteter Durchschnitt 20 $ | 50 $ | 100 $ |
|---|---|---|---|---|
| 1 | 0,6949 | 24,63 | 45,48 | 80,22 |
| 2 | 0,8200 | 22,73 | 47,33 | 88,33 |
| 4 | 0,9011 | 21,50 | 48,53 | 93,59 |
| 8 | 0,9480 | 20,79 | 49,23 | 96,63 |
Für den Kunden mit dem einzigen Wiederholungskauf von 100 $ erwartet man 80,22 $ pro Kauf; für den mit sechs Wiederholungskäufen zu 20 $ 21,03 $. Das Gewicht des Kundendurchschnitts erreicht 90 %, eine von der Seite gewählte Schwelle, beim vierten Wiederholungskauf; mit den auf 78 Wochen geschätzten Parametern beim siebten. Die Autoren urteilen, ohne bezifferte Schwelle, dass es sieben oder acht Käufe braucht, bevor man sich auf den beobachteten Durchschnitt verlassen kann [C45].
Die Variante der Seite, mit allen Käufen der Wochen 1 bis 39 geschätzt: p̂ = 9,8813, q̂ = 3,3988, γ̂ = 7,9286, Mittelwert der Population 32,66 $. Für einen Kunden, dessen einziger Kauf 100 $ gekostet hat, erwartet die Variante 86,85 $, mit einem Gewicht von 0,80 für seinen Durchschnitt. Beim selben Kunden ist der erste Kauf etwa so groß wie die Wiederholungskäufe: im Mittel 36,14 $ bei den 946 Kunden mit Wiederholungskauf, gegenüber 35,08 $ für den Durchschnitt ihrer Wiederholungskäufe, bei einem medianen Verhältnis von 0,97. Dagegen hatten die 1.411 Kunden ohne Wiederholungskauf einen ersten Kauf von nur 30,88 $ getätigt: Kunden mit kleinerem ersten Kauf haben seltener wieder gekauft. Die Variante vermischt diese beiden Gruppen, und ihr Mittelwert der Population wird dadurch gesenkt.
Die Validierung anhand der Wochen 40 bis 78. Von den 946 Kunden mit Wiederholungskauf kaufen 491 erneut. Fehler bei ihren durchschnittlichen Ausgaben pro Kauf, in Dollar, und Abweichung des absoluten Fehlers gegenüber dem Durchschnitt aller Käufe:
| Prognose | Mittlerer absoluter Fehler | Wurzel des mittleren quadratischen Fehlers | Mittlerer Fehler | Abweichung gegenüber dem Durchschnitt aller Käufe |
|---|---|---|---|---|
| Durchschnitt der Wiederholungskäufe | 17,35 | 29,65 | 2,30 | +1,26 (Standardfehler 0,45) |
| Durchschnitt aller Käufe | 16,09 | 28,28 | 2,05 | — |
| Mittelwert der Population | 18,94 | 31,62 | 2,67 | +2,85 (0,91) |
| Modell der Autoren | 16,37 | 28,06 | 2,17 | +0,28 (0,41) |
| Variante der Seite | 15,78 | 27,83 | 2,19 | −0,31 (0,09) |
Das Modell der Autoren senkt den Fehler gegenüber dem Durchschnitt allein der Wiederholungskäufe des Kunden um 5,6 %, also um 0,98 $ pro Kauf (Standardfehler 0,25), ist aber nicht besser als der Durchschnitt aller Käufe: Seine Abweichung, +0,28 $, ist kleiner als ihr Standardfehler. Die Variante ist um 1,9 % besser als dieser einfache Durchschnitt, also um 0,31 $ pro Kauf; gegenüber dem Modell der Autoren ist ihr Vorsprung, 0,59 $ (Standardfehler 0,37), nicht deutlich. Es ist eine durchschnittliche Verbesserung: Die Variante schlägt den einfachen Durchschnitt bei 285 von 491 Kunden, also bei 58,0 %.
Für 193 weitere Kunden, die während der Schätzung keinen Wiederholungskauf getätigt hatten, danach aber kaufen, liegt der Wert ihres einzigen Kaufs um 20,25 $ daneben, der Mittelwert der Population, die Prognose des Modells der Autoren, um 20,92 $, die Variante um 18,75 $. Der Vorsprung der Variante ist gegenüber dem einzigen Kauf deutlich, 1,51 $ (Standardfehler 0,44), gegenüber dem Mittelwert der Population aber nicht, 2,17 $ (Standardfehler 1,72). Bei den 684 Kunden, die in diesen Wochen kaufen, beträgt der Fehler 17,27 $ für den Durchschnitt aller Käufe, 17,65 $ für das Modell der Autoren und 16,62 $ für die Variante; die Abweichung zwischen der Variante und dem Modell der Autoren, 1,03 $ (Standardfehler 0,55), ist nicht deutlich.
Die Regression zur Mitte, nach Klassen des Durchschnitts der Wiederholungskäufe, Prognosen des Modells der Autoren und der Variante:
| Klasse des Durchschnitts der Wiederholungskäufe | Kunden | Durchschnitt der Wiederholungskäufe | Modell der Autoren | Variante | Danach beobachtete Ausgaben | Beobachtet minus Modell der Autoren |
|---|---|---|---|---|---|---|
| Unter 20 $ | 149 | 14,84 | 19,40 | 19,65 | 26,82 | 7,42 (Standardfehler 1,61) |
| 20 bis 50 $ | 255 | 32,78 | 33,16 | 32,91 | 33,57 | 0,41 (1,10) |
| 50 $ und mehr | 87 | 79,07 | 70,84 | 71,03 | 69,20 | −1,64 (5,70) |
Beide Modelle ziehen die extremen Durchschnitte in die richtige Richtung, aber nicht genug: Die niedrigen Kaufbeträge werden deutlich zu niedrig prognostiziert, um 7,42 $ pro Kauf; die hohen Kaufbeträge werden um 1,64 $ zu hoch prognostiziert, im Rahmen des Zufalls.
Die Summe über den Kundenstamm. Mit der Zahl der tatsächlich getätigten Käufe multipliziert, ergibt die Prognose des Modells der Autoren 68.181,97 $ Ausgaben in den Wochen 40 bis 78, gegenüber 70.976,39 $ beobachtet, also −3,9 %; die Variante −4,6 %; der Durchschnitt aller Käufe −4,2 %. Nach Zahl der Wiederholungskäufe während der Schätzung, durchschnittliche Gesamtausgaben pro Kunde in diesen Wochen:
| Wiederholungskäufe | Kunden | Beobachtet | Prognose des Modells der Autoren | Abweichung |
|---|---|---|---|---|
| 0 | 1.411 | 8,30 | 8,33 | −0,03 (Standardfehler 0,55) |
| 1 | 439 | 27,42 | 23,16 | 4,26 (1,82) |
| 2 | 214 | 51,92 | 53,72 | −1,80 (3,95) |
| 3 | 100 | 63,19 | 56,23 | 6,96 (4,47) |
| 4 | 62 | 90,98 | 100,75 | −9,77 (6,54) |
| 5 | 38 | 124,45 | 105,70 | 18,75 (13,68) |
| 6 | 29 | 127,17 | 126,74 | 0,43 (8,29) |
| 7 und mehr | 64 | 246,04 | 237,63 | 8,42 (12,84) |
Nur die Zeile mit einem Wiederholungskauf weicht über den Zufall hinaus ab: Diese Kunden werden um 4,26 $ zu niedrig prognostiziert. Die Autoren, die keinen Standardfehler angeben, urteilen nach Augenmaß, dass keine besondere Verzerrung ihre Annahmen infrage stellt [C50].
Die Streuung eines Kunden um seinen Durchschnitt. Für die 293 Kunden mit mindestens drei Wiederholungskäufen beträgt der mediane Variationskoeffizient ihrer Käufe 0,47. Aus wenigen Käufen berechnet, ist ein Variationskoeffizient im Mittel kleiner als der wahre: Das Modell erwartet daher 0,36 und nicht 0,40, und in 95 % der 200 Simulationen zwischen 0,34 und 0,38. Die Käufe eines Kunden schwanken also deutlich stärker, als das Modell annimmt, vor allem bei hohen Ausgaben: 0,38 für die 61 Kunden unter 20 $, 0,48 für die 180 von 20 bis 50 $, 0,50 für die 52 mit 50 $ und mehr.
10
Die Gültigkeitsannahmen
- Ausgaben unabhängig von der Häufigkeit [C16]. Hier beträgt die Korrelation 0,11 und halbiert sich, wenn man einen einzigen Kunden herausnimmt [C38, C39]; die Autoren sehen darin keine ernsthafte Verletzung [C41]. Die Kunden ohne Wiederholungskauf hatten jedoch einen kleineren ersten Kauf getätigt, 30,88 $ gegenüber 36,14 $ (Abstand 5,26 $, Standardfehler 1,47): ein Hinweis, dass Ausgaben und Häufigkeit nicht ganz unabhängig sind. Bei Produkten, die die Kunden bevorraten, kann man einen noch stärkeren Zusammenhang zwischen Kaufrhythmus und Betrag erwarten [C51]. Kaufen Ihre Kunden mit hohen Beträgen auch häufiger, oder seltener?
- Stabile durchschnittliche Ausgaben im Zeitverlauf für jeden Kunden [C15]. Die Log-Likelihood ändert sich kaum, wenn man von 39 auf 78 Wochen übergeht [C42, C43], aber die Parameter verschieben sich: Das Gewicht eines einzigen Wiederholungskaufs sinkt von 0,69 auf 0,59, und der Kunde mit dem einzigen Wiederholungskauf von 100 $ von 80,22 $ auf 73,99 $. Das durchschnittliche Niveau hat sich dagegen kaum verändert: Ein Wiederholungskauf betrug während der Schätzung im Mittel 38,81 $, ein Kauf danach 37,71 $. Haben sich Ihre Preise, Ihr Angebot oder Ihre Kundschaft seit dem Schätzzeitraum verändert?
- Derselbe Variationskoeffizient für alle Kunden [C19]. Die Daten widersprechen dem: Die Käufe eines Kunden schwanken stärker als prognostiziert, vor allem bei großen Kunden. Das ist ein Ansatz zur Erklärung der unzureichenden Regression zur Mitte, erklärt aber nicht die zu niedrige Prognose der niedrigen Kaufbeträge, deren Streuung nahe an der des Modells liegt. Kaufen Ihre großen Kunden unregelmäßiger ein als die kleinen?
- Eine Gammaverteilung der Beträge, ohne Preisschwellen. Das Modell kennt keine runden oder psychologischen Preise auf ,99: Es legt den Modus auf 19 $, während die Daten ihn auf den Preis eines Tonträgers legen, 15 $ [C35, C36, C37]. Die Autoren haben ein einfaches Modell einer besseren Anpassung vorgezogen [C52]. Konzentrieren sich Ihre Kaufbeträge auf wenige Preise?
- Nur Wiederholungskäufe, im Modell der Autoren: Der erste Kauf geht nicht in den Durchschnitt ein, und Kunden ohne Wiederholungskauf erhalten den Mittelwert der Population [C48]. Welcher Anteil Ihrer Kunden hat noch nicht wieder gekauft?
- Nur indirekt prüfbar: die inverse Gammaverteilung der wahren Durchschnitte, da man nie einen wahren Durchschnitt beobachtet, nur Durchschnitte weniger Käufe; sie lässt sich an der Anpassung der Verteilung der beobachteten Durchschnitte beurteilen. Hier nicht prüfbar: dass der Durchschnitt eines Kunden über den 30. Juni 1998 hinaus stabil bleibt.
11
Diagnostik und Unsicherheit
- Anpassung: die Verteilung der beobachteten Durchschnitte mit der vom Modell prognostizierten vergleichen. Hier weicht der theoretische Mittelwert nur um 0,0925 $ vom beobachteten ab, aber der prognostizierte Modus, 19 $, übersteigt den beobachteten, 14,96 $ [C35].
- Unabhängigkeit: die Korrelation zwischen durchschnittlichen Ausgaben und Zahl der Käufe berechnen, mit und ohne die extremen Kunden [C38, C40], und den ersten Kauf der Kunden mit und ohne Wiederholungskauf vergleichen.
- Streuung eines Kunden: den beobachteten Variationskoeffizienten der Käufe jedes Kunden mit dem des Modells vergleichen; hier 0,47 gegenüber 0,36.
- Validierung außerhalb des Schätzzeitraums: das Modell mit den einfachen Durchschnitten vergleichen, einschließlich des Durchschnitts aller Käufe, mit dem Standardfehler jeder Abweichung. Gewichtet mit der Zahl der danach getätigten Käufe behält der mittlere absolute Fehler dieselbe Rangfolge: 13,44 $ für die Variante, 13,60 $ für das Modell der Autoren, 13,80 $ für den Durchschnitt aller Käufe, 14,61 $ für den Durchschnitt der Wiederholungskäufe.
- Schätzunsicherheit, per Bootstrap über die 946 Kunden, Intervalle nominal 95 %: Der Mittelwert der Population reicht von 33,26 bis 37,02 $; die Prognose für den Kunden mit dem einzigen Wiederholungskauf von 100 $ von 72,95 bis 88,58 $; das Gewicht eines einzigen Wiederholungskaufs von 0,59 bis 0,82; der Variationskoeffizient von 0,30 bis 0,46; die Standardabweichung der wahren Durchschnitte von 21,75 bis 32,58 $. Die Daten unterscheiden p schlecht von γ: p reicht von 4,68 bis 10,85 und γ von 7,42 bis 24,47, während die Prognosen, die sie kombinieren, stabiler bleiben. Diese Intervalle betreffen durchschnittliche Prognosen, nicht das, was ein Kunde tatsächlich ausgeben wird: Ein einzelner Kauf schwankt viel stärker.
- Was die Validierung nicht prüft: Sie betrifft nur die Kunden, die erneut kaufen, jeder mit gleichem Gewicht, unabhängig von seiner Zahl an Käufen; sie verwendet die Zahl der in den Wochen 40 bis 78 tatsächlich getätigten Käufe und beurteilt nicht die Prognose dieser Zahl, die Sache eines anderen Modells ist [C49]. Diese Wochen umfassen die Feiertage zum Jahresende 1997, die die Ausgaben erhöhen könnten, was das mittlere Niveau nicht zeigt. Über den 30. Juni 1998 hinaus wird nichts ausgesagt.
- Was diese Daten nicht entscheiden können: ein einziger Händler, ein einziges Produkt, 1997 gewonnene Kunden; das Ergebnis lässt sich nicht ohne Prüfung übertragen.
12
Interpretation
Drei Lehren. Erstens ist der Durchschnitt der Wiederholungskäufe eines Kunden eine schlechte Prognose, wenn er wenig gekauft hat: Ein einziger Wiederholungskauf von 100 $ lässt etwa 80 $ erwarten, nicht 100 $. Das Modell beziffert diese Regression zur Mitte, statt sie zu erraten.
Zweitens bringt das Modell der Autoren bei diesen Daten nichts gegenüber einem einfachen Durchschnitt aller Käufe, den ersten eingeschlossen: Es schneidet besser ab als der Durchschnitt allein der Wiederholungskäufe, weil es korrigiert, verzichtet aber auf die Information des ersten Kaufs. Mit allen Käufen gespeist, schneidet dasselbe Modell etwas besser ab als dieser einfache Durchschnitt, im Mittel über die Kunden; es wurde aber nachträglich gewählt, und sein Vorsprung vor dem Modell der Autoren ist nicht deutlich. Keines prognostiziert die Summe über den Kundenstamm besser: Die Verbesserung betrifft den Wert jedes einzelnen Kunden, nicht den Gesamtumsatz.
Schließlich korrigiert das Modell zu wenig: Die Kunden unter 20 $ gaben danach 26,82 $ pro Kauf aus, während es 19,40 prognostizierte. Diese Daten liefern die Ursache dafür nicht. Eine stärkere Streuung jedes Kunden als angenommen wird hier gemessen, betrifft aber vor allem die großen Kunden; Preisschwellen, die Form der Verteilung der wahren Durchschnitte, der Zusammenhang zwischen Ausgaben und Häufigkeit oder eine Veränderung im Zeitverlauf bleiben möglich.
13
Zulässige und unzulässige Schlussfolgerungen
- Zulässig: „Für einen Kunden von CDNOW, der ein einziges Mal für 100 $ wieder gekauft hat, prognostiziert das Modell der Autoren durchschnittliche Ausgaben von etwa 80 $ pro Kauf für seine folgenden Käufe, von 72,95 bis 88,58 $ bei nominal 95 %, wenn man nur die Schätzunsicherheit berücksichtigt.“
- Zulässig: „In den Wochen 40 bis 78 liegt das mit allen Käufen geschätzte Modell, eine nach einer ersten Auswertung dieser Wochen gewählte Variante, im Mittel um 15,78 $ pro Kauf daneben, gegenüber 16,09 $ beim Durchschnitt aller Käufe des Kunden; das muss sich an anderen Daten noch bestätigen.“
- Unzulässig: die Prognose des Modells als Wert eines Kunden darzustellen. Es prognostiziert nur den Betrag pro Kauf; es muss mit einem Modell der Zahl der Käufe kombiniert werden, wie es die Autoren tun [C49], dann mit einer Marge und einem Diskontsatz [C55, C56].
- Unzulässig: zu behaupten, das Modell der Autoren prognostiziere besser als der bisherige Durchschnitt des Kunden, ohne zu sagen, welcher: Es schlägt den Durchschnitt der Wiederholungskäufe, nicht den Durchschnitt aller Käufe.
- Unzulässig: daraus zu folgern, eine Marketingmaßnahme würde die Kunden zu höheren Ausgaben bewegen. Das Modell beschreibt Ausgaben; es misst die Wirkung keiner Maßnahme.
- Unzulässig: die Parameter von CDNOW auf ein anderes Unternehmen anzuwenden, oder das Modell anzuwenden, ohne geprüft zu haben, dass die Ausgaben Ihrer Kunden nicht von ihrer Kaufhäufigkeit abhängen [C51].
14
Mögliche Marketingentscheidung
- Jeden Kunden mit einer korrigierten Prognose bewerten, nicht mit dem Durchschnitt allein seiner Wiederholungskäufe; ohne Modell schneidet der Durchschnitt aller seiner Käufe fast ebenso gut ab. Das mit allen Käufen geschätzte Modell kann in Betracht gezogen und dann an den eigenen Daten validiert werden, an einem Zeitraum, den man noch nicht betrachtet hat. Danach mit der erwarteten Zahl künftiger Käufe, jeder auf seinen heutigen Wert abgezinst, und mit der Marge multiplizieren, wie es die Autoren tun, die eine Marge von 30 % und eine Abzinsung von 15 % pro Jahr ansetzen [C49, C55, C56].
- Einen einzelnen großen Kauf weder überschätzen noch einen kleinen unterschätzen: Ein einziger Wiederholungskauf von 100 $ ergibt nach dem Modell der Autoren eine Prognose von 80,22 $, und ein Kunde mit 20 $ Durchschnitt nach einem einzigen Wiederholungskauf eine von 24,63 $; die Daten zeigen sogar, dass die Korrektur bei niedrigen Kaufbeträgen stärker ausfallen müsste.
- An den eigenen Daten prüfen, bevor man das Modell nutzt: die Unabhängigkeit zwischen Ausgaben und Häufigkeit, die Streuung der Käufe jedes Kunden und die Validierung gegenüber dem Durchschnitt aller Käufe; nach jeder Preisänderung neu schätzen.
Die Entscheidung bleibt menschlich und betrifft die Marketingleitung und, für den Kundenwert, die Finanzabteilung.
15
Wann einsetzen, wann nicht
- Einsetzen: bei Wiederholungskäufen mit schwankenden Beträgen, außerhalb von Abonnements, wenn man den Wert jedes Kunden braucht; als Ergänzung zu einem Modell der Zahl der Käufe, etwa dem der Seite zur Schätzung des nicht vertraglichen CLV oder dem der Seite zum Wert saisonaler Kunden.
- Mit Vorsicht einsetzen, wenn die Ausgaben von der Häufigkeit abhängen, etwa bei Produkten, die man bevorratet [C51]: Dann braucht man ein Modell, das Zahl und Betrag der Käufe miteinander verknüpft, statt sie als unabhängig anzunehmen. Vorsicht auch, wenn sich die Preise auf wenige Werte konzentrieren [C37] oder wenn die Käufe eines Kunden sehr unregelmäßig sind.
- Nicht einsetzen für ein Abonnement zum Festpreis, bei dem der Betrag bekannt ist: siehe die Seite zum Wert eines Abonnenten; auch nicht, um den gesamten Kundenstamm einschließlich der künftigen Kunden zu bewerten: siehe die Seite zum Wert des Kundenstamms.
- Nicht einsetzen, um die Wirkung einer Maßnahme auf die Ausgaben zu messen: Dafür braucht man ein Experiment.
- Um die Unsicherheit eines Ergebnisses auszudrücken, siehe die Seite zum Ausdrücken von Unsicherheit; um eine Prognose an einem zurückgehaltenen Zeitraum zu beurteilen, die zur Validierung einer Marketingprognose.
16
Reproduzierbare Implementierungen
- Python 3.14.5, nur Standardbibliothek: msc-p046-reference.py, Aufruf mit
python msc-p046-reference.py - R 4.6.1, nur Basis: msc-p046-reference.R, Aufruf mit
Rscript msc-p046-reference.R - Die Daten werden nicht weiterverbreitet: die CDNOW-Stichprobe unter brucehardie.com/datasets herunterladen und
CDNOW_sample.txtneben die Programme legen. - Beide Programme geben genau dieselben Zeilen aus; ihr sha256-Fingerabdruck nach Normalisierung der Zeilenenden ist im Manifest des Dossiers verzeichnet. Deklarierter Startwert 20261007. Keine Drittbibliothek: Die Software validiert die Methode nicht, sie reproduziert sie.
17
Ergebnisdokument
Für jeden Kunden die Zahl der Käufe, ihr durchschnittlicher Betrag und die korrigierte Prognose mit ihrem Gewicht; die geschätzten Parameter mit ihrem Intervall; die Prüfung der Unabhängigkeit zwischen Ausgaben und Häufigkeit und die der Streuung jedes Kunden; die Validierung an einem zurückgehaltenen Zeitraum, gegenüber dem Durchschnitt aller Käufe, mit den Standardfehlern; und die vor der Entscheidung zu prüfenden Annahmen.
18
Literatur und Evidenzniveau
- Fader, P. S., Hardie, B. G. S. & Lee, K. L. (2005). RFM and CLV: Using Iso-Value Curves for Customer Base Analysis. Journal of Marketing Research 42(4), 415–430. — Autorenversion, verbreitet von Bruce Hardie, Volltext geprüft; Schmittlein und Peterson (1994) sowie Colombo und Jiang (1999) werden dort zitiert.
- Fader, P. S. & Hardie, B. G. S. (2013). The Gamma-Gamma Model of Monetary Value. Technische Notiz. brucehardie.com/notes/025 — Volltext geprüft.
- CDNOW-Stichprobe und ihre Beschreibung, veröffentlicht von Bruce Hardie: brucehardie.com/datasets (CDNOW_sample.zip); die vollständige Kohorte umfasst 23.570 Kunden [C04].
- Evidenzniveau: reale Daten, ein Händler, 1997 und 1998; veröffentlichte Ergebnisse aus den Daten wiedergefunden, außer der Schiefe; Validierung an 39 zurückgehaltenen Wochen, mit einer Variante, die nach einer ersten Auswertung dieser Wochen hinzugefügt wurde; reproduzierbar in Python und R. Das ist kein Beleg dafür, dass das Modell zu Ihrem Unternehmen passt.
Methodische Verbindungen

