Wie erstellt man eine nützliche Kundensegmentierung?
Eine nützliche Segmentierung verbindet zulässige Variablen, Distanz, Algorithmus, Stabilität und Entscheidungszweck. Gruppen sind keine natürlichen Wesenheiten, sondern bedingte Repräsentationen.
Wissenschaftliche Redaktion: Marketing Science Center
Direkte Antwort
Eine handlungsorientierte deskriptive Partition erstellen und ihre Unsicherheit dokumentieren.
Eine nützliche Segmentierung verbindet zulässige Variablen, Distanz, Algorithmus, Stabilität und Entscheidungszweck. Gruppen sind keine natürlichen Wesenheiten, sondern bedingte Repräsentationen.
01 · PROTOKOLL
Operative Zusammenfassung
Neunhundert Kunden werden durch eine vollständig erklärte Konstruktion ohne Zufallsziehung in vier Segmente geteilt. Im versiegelten synthetischen Fall betragen die Größen 283, 246, 184 und 187, die mittlere Silhouette 0,407973 und der bereinigte Rand-Index zwischen zwei unabhängigen Neuaufbauten 0,984661. Der Umsatz des Folgequartals, der nie zur Segmentbildung diente, reicht je Segment von 69,260000 bis 644,625668, ein Verhältnis von 9,307330. Die vier Prüfungen bestehen. Verdikt: SEGMENTATION_READABLE_FOR_ACTION.
02 · PROTOKOLL
Konkrete Marketingsituation
Ein CRM-Team möchte seine Basis nicht länger als einen Block behandeln. Für jeden Kunden liegen Recency, Frequenz, durchschnittlicher Warenkorb, Zahl der gekauften Kategorien und Onlineanteil vor. Es will vier Gruppen, weil vier die Zahl der Beziehungsprogramme ist, die es wirklich betreiben kann. Die Frage ist nicht, die wahren Gruppen zu finden, die es so nicht gibt, sondern eine Aufteilung zu erhalten, die trägt und beim Entscheiden hilft.
03 · PROTOKOLL
Wissenschaftliche Frage
Ist die Vier-Segment-Aufteilung für diese neunhundert Kunden, diese fünf erklärten Variablen und diese erklärte Distanz getrennt, ausgewogen, auf anderen Beobachtungen reproduzierbar, und unterscheidet sie ein Ergebnis, das die Konstruktion nie gesehen hat? Die Frage betrifft nicht die Existenz natürlicher Gruppen, sondern die Tragfähigkeit einer erklärten Aufteilung und ihren Nutzen für eine Entscheidung.
04 · PROTOKOLL
Warum der einfache Ansatz scheitern kann
Einen Partitionsalgorithmus laufen zu lassen und die Gruppen zu kommentieren erzeugt immer Gruppen: Das Verfahren fabriziert so viele, wie man verlangt, selbst in einer strukturlosen Wolke. Andere Variablen, Skalen oder Distanzen ändern das Ergebnis, und eine andere Startziehung kann die Grenzen verschieben. Ohne Prüfungen beschreibt man ein Artefakt des Algorithmus und nennt es Kundensegmentierung. Der Ausdruck „wahres Segment“ hat in der Literatur ohnehin keine operative Definition.
05 · PROTOKOLL
Intuition der Methode
Die Methode besteht darin, alles vor dem Hinsehen zu erklären: die fünf Variablen, ihre Transformation, ihre Skalierung, die Distanz, die Zahl der Segmente, den Startpunkt der Zentren und die vier Schwellen. Der Start wird nicht gelost: Es sind die Beobachtungen an vier festen Rängen eines erklärten Summenscores. Die Aufteilung wird dann vier Fragen unterworfen: Sind die Segmente getrennt, sind alle ansprechbar, erscheinen sie beim Neuaufbau auf anderen Kunden wieder, und unterscheiden sie ein Ergebnis außerhalb der Konstruktion?
06 · PROTOKOLL
Erforderliche Daten
Vor jeder Lektüre festgeschrieben: die lückenlos geordnete Kundenkennung, Recency, Frequenz, durchschnittlicher Warenkorb, Zahl der Kategorien, Onlineanteil, Umsatz des Folgequartals, die erklärten Transformationen, die Standardisierung, die vom Entscheidungskontext auf vier festgelegte Segmentzahl, der erklärte Start und die vier Schwellen. Der Umsatz geht nie in die Konstruktion ein. Die versiegelte Datei enthält neunhundert Kunden. Der Fall ist synthetisch und wird so ausgewiesen.
07 · PROTOKOLL
Formales Modell und Symbole
Jeder Kunde ist ein Vektor aus fünf standardisierten Koordinaten: Logarithmus der Recency, Frequenz, Logarithmus des Warenkorbs, Zahl der Kategorien, Onlineanteil. Die Distanz ist quadratisch euklidisch. Ein Segment ist eine Menge von Kunden, die ihrem Zentrum näher sind als jedem anderen; das Zentrum ist der Mittelwert seiner Mitglieder. Die Silhouette eines Kunden vergleicht die mittlere Distanz zu den Mitgliedern des eigenen Segments mit jener zum nächstgelegenen Segment. Der bereinigte Rand-Index vergleicht zwei Aufteilungen und korrigiert zufällige Übereinstimmung.
08 · PROTOKOLL
Deklarierte Berechnung
Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende Datei ablehnen; die fünf Variablen über die ganze Datei transformieren und standardisieren; die vier Startzentren an den erklärten Rängen des Summenscores setzen und iterieren, bis sich die Zuordnungen nicht mehr ändern oder hundert Durchläufe erreicht sind, mit Abbruch bei leerem Segment; Größen und Anteile berichten und die Ausgewogenheitsschwelle anwenden; die mittlere Silhouette auf der erklärten systematischen Stichprobe berechnen; getrennt auf geraden und ungeraden Kunden neu aufbauen, die ganze Datei unter jeder Lösung neu zuordnen und den bereinigten Rand-Index berechnen; Ergebnismittelwerte je Segment, ihr Verhältnis und die erklärte Varianz berechnen, dann die Verdiktregel anwenden.
09 · PROTOKOLL
Durchgängiges Zahlenbeispiel
Synthetische Illustration — Lehrwerte, nicht beobachtet
In der versiegelten Datei: 900 Kunden, 4 Segmente. Größen 283, 246, 184, 187; Anteile 0,314444, 0,273333, 0,204444 und 0,207778; kleinster Anteil 0,204444, Prüfung bestanden. Mittlere Silhouette 0,407973, Prüfung bestanden. Bereinigter Rand-Index zwischen den beiden Neuaufbauten 0,984661, Prüfung bestanden. Mittlerer Umsatz je Segment: 192,210318; 106,899593; 69,260000; 644,625668. Verhältnis von höchstem zu niedrigstem 9,307330 und erklärte Varianz 0,692635, Prüfung bestanden. Verdikt: SEGMENTATION_READABLE_FOR_ACTION.
10 · PROTOKOLL
Validitätsannahmen
Die Konstruktion setzt voraus, dass die fünf Variablen beschreiben, was das Team unterscheiden will, dass die Standardisierung ihnen ein vertretbares Gewicht gibt, dass die euklidische Distanz auf diesen Koordinaten sinnvoll ist und dass vier Segmente einer realen Handlungsfähigkeit entsprechen. Sie setzt keine natürlichen Gruppen voraus. Drei Dinge sind hier nicht prüfbar: die Relevanz der gewählten Variablen, die zeitliche Stabilität der Aufteilung und ob ein Segment anders auf eine Maßnahme reagiert, was ein Experiment verlangt.
11 · PROTOKOLL
Diagnostik und Unsicherheit
Die Silhouette misst eine relative Trennung unter der erklärten Distanz, keine geometrische Wahrheit: Mit anderen Variablen fiele sie anders aus. Sie wird hier auf einer systematischen Stichprobe berechnet, aber gegen alle Kunden; eine Standardbibliothek, die Distanzen auf die Stichprobe beschränkt, liefert für diese Datei 0,406210 statt 0,407973, und die Seite sagt das, statt eine einzige Definition zu suggerieren. Der bereinigte Rand-Index erreicht 0,984661, weil die synthetische Struktur scharf ist; auf realen Daten ist ein Wert über 0,60 bereits beruhigend. Keine dieser Zahlen ist ein p-Wert.
12 · PROTOKOLL
Robustheit und Alternativen
Vor dem Ergebnis erklärte Alternativen: die Aufteilung mit drei oder fünf Segmenten wiederholen und die vier Prüfungen vergleichen; die Standardisierung durch eine explizite Gewichtung ersetzen und beide Profile veröffentlichen; den Onlineanteil streichen, der eher einen Akquisitionskanal als ein Verhalten abbildet; oder die Partition durch ein Verfahren mit Teilzugehörigkeiten ersetzen. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie die Segmente verändert.
13 · PROTOKOLL
Interpretation des Ergebnisses
Die vier Prüfungen bestehen, also darf die Aufteilung Entscheidungen tragen. Das nutzbare Ergebnis ist das Segmentprofil und die Wertlücke dazwischen: Ein Segment bündelt einen mittleren Umsatz von 644,625668 im Folgequartal, ein anderes 69,260000, und die Aufteilung erklärt 69,2635 Prozent der Umsatzvarianz. Diese Struktur rechtfertigt differenzierte Programme. Sie sagt nicht, dass ein Programm ein Segment stärker bewegt als ein anderes: Das ist eine Assoziation, gemessen an einem Ergebnis außerhalb der Konstruktion, kein Effekt.
14 · PROTOKOLL
Zulässige Schlussfolgerungen
Zulässig: die Segmentprofile, ihre Größen, ihre Trennung, ihre Reproduzierbarkeit und ihre Wertlücke zu veröffentlichen; vier unterschiedliche Beziehungsprogramme aufzubauen; den Anteil jedes Segments über die Zeit zu verfolgen; zu schließen, dass die Basis nicht homogen ist und vier Gruppen unter den erklärten Kriterien tragen. Ebenfalls zulässig: zu sagen, dass diese Segmente von den gewählten Variablen abhängen, und die Aufteilung bei geänderten Variablen neu zu veröffentlichen.
15 · PROTOKOLL
Unzulässige Schlussfolgerungen
Unzulässig: diese vier Segmente als die wahren Gruppen der Kundschaft darzustellen; zu behaupten, jemand gehöre dauerhaft zu seinem Segment, obwohl sich die Position mit den Käufen verschiebt; die Umsatzlücke der Segmentzugehörigkeit als Effekt zuzuschreiben; die Segmentzahl nach Sicht der Profile zu wählen und die Prüfungen dann als vorab festgelegt zu veröffentlichen; oder diese Segmente auf einen anderen Markt zu übertragen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.
16 · PROTOKOLL
Mögliche Marketingentscheidung
Die vernünftige Entscheidung besteht darin, jedem Segment ein eigenes Beziehungsprogramm zu geben, dimensioniert nach Anteil und Wertlücke, und die Wirkung dieser Programme dann mit einem Experiment zu messen statt durch den Vergleich der Segmente untereinander. Das wertdichteste Segment rechtfertigt den größten Aufwand, doch nichts garantiert bislang, dass es am besten reagiert: Das zeigt die nächste Kampagne mit einer Kontrollgruppe je Segment.
17 · PROTOKOLL
Wann die Methode geeignet oder ungeeignet ist
Diese Methode einsetzen, wenn das Team weiß, wie viele Programme es betreiben kann und welche Variablen beschreiben, was es unterscheiden will. Als reines Explorationswerkzeug meiden: Ohne erklärten Zweck sagt kein Kriterium, dass eine Aufteilung besser ist als eine andere. Ebenfalls meiden, wenn die gewählten Variablen vor allem den Akquisitionskanal messen, wenn die Basis eben erneuert wurde oder wenn eigentlich die Wirkung einer Maßnahme gemessen werden soll, was ein Experiment verlangt.
18 · PROTOKOLL
Implementierungen und Endergebnis
Die CC0-CSV enthält die neunhundert synthetischen Kunden. Python und R sind die Referenzimplementierungen; SPSS führt dieselbe Berechnung in einem Python-Block aus; SAS erhält dieselben vier erklärten Startpunkte, wendet aber eigene Zuordnungsreihenfolge und Konvergenzregel an und prüft Ausgewogenheit und Nutzen, statt jede Dezimale zu reproduzieren. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die erklärten Variablen und die Distanz, die Segmentzahl und ihre Begründung, den erklärten Start, die vier Schwellen, die sieben nummerierten Schritte, die Profile, die vier Prüfungen, das Verdikt und die Softwareversionen.
Synthetische Daten · CC0
msc-p031-segmentation-panel.csv ↓Reproduzierbarkeitsprotokoll
msc-p031-reproducibility-readme.md ↓Python-Referenz · MIT
msc-p031-reference.py ↓R-Referenz · MIT
msc-p031-reference.R ↓SPSS-Implementierung · MIT
msc-p031-secondary.sps ↓SAS-Implementierung · MIT
msc-p031-secondary.sas ↓19 · PROTOKOLL
Quellen und Evidenzniveau
Hennig erinnert daran, dass eine Partitionsanalyse durch die Transparenz ihrer Entscheidungen wissenschaftlich wird, nicht durch die Eindeutigkeit ihres Ergebnisses, und dass der Begriff der wahren Gruppe selten definiert bleibt. Von Luxburg, Williamson und Guyon zeigen, dass kein allgemeines Verfahren Partitionsmethoden ohne Berücksichtigung des Nutzungskontexts ordnet. Romano et al. verorten den bereinigten Rand-Index unter den zufallskorrigierten Maßen. Ullmann, Hennig und Boulesteix formalisieren die Validierung einer Aufteilung auf anderen Beobachtungen durch Teilung der Datei in zwei Hälften. Grundlegende Referenzen: Hennig (2015, arXiv-Preprint; in Pattern Recognition Letters erschienen, begutachtet) und von Luxburg, Williamson und Guyon (2012, begutachtete Proceedings, ohne DOI). Neuere Entwicklungen: Romano et al. (2016, Journal of Machine Learning Research, begutachtet, ohne DOI) und Ullmann, Hennig und Boulesteix (2021, arXiv-Preprint; in WIREs Data Mining and Knowledge Discovery erschienen, begutachtet).
- Hennig (2015) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- von Luxburg, Williamson & Guyon (2012) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Romano et al. (2016) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Ullmann, Hennig & Boulesteix (2021) Volltext geprüft, mit kurzem im Original verorteten Auszug.
Methodische Verbindungen

