Wie prüft man die Stabilität einer Segmentierung?
Stabilität prüft, ob eine ähnliche Struktur bei Resampling, Zeitvariation oder vernünftiger Merkmalsstörung wiederkehrt. Sie garantiert keinen Geschäftsnutzen.
Wissenschaftliche Redaktion: Marketing Science Center
Direkte Antwort
Lösungen vergleichen und Zuordnungsrobustheit quantifizieren.
Stabilität prüft, ob eine ähnliche Struktur bei Resampling, Zeitvariation oder vernünftiger Merkmalsstörung wiederkehrt. Sie garantiert keinen Geschäftsnutzen.
01 · PROTOKOLL
Operative Zusammenfassung
Für 360 Kunden wird eine Lösung mit vier Segmenten vorgeschlagen. Sie wird auf 40 mit Zurücklegen gezogenen Resamples neu gebildet, und die Wiederfindung jedes Segments wird über den Jaccard-Index gemessen. Das schwächste Segment wird nur zu 0,664749 wiedergefunden, unter der erklärten Schwelle von 0,75. Schlimmer: Eine strukturlose Referenz, gewonnen durch Permutation jeder Variablen, findet ihre eigenen Segmente zu 0,829190 wieder, also besser als die echte Datei. Verdikt: PROPOSED_SEGMENTATION_NOT_STABLE. Die Lösung mit drei Segmenten trägt dagegen bei 0,986949.
02 · PROTOKOLL
Konkrete Marketingsituation
Eine Marketingleitung hat von einem Dienstleister eine Segmentierung in vier Gruppen erhalten, samt Namen, Personas und einem Programm je Gruppe. Bevor vier getrennte Budgets gebunden werden, stellt das Team eine einfache Frage: Kämen diese vier Gruppen zurück, wenn dieselbe Arbeit auf einer leicht anderen Stichprobe derselben Kunden wiederholt würde? Niemand fragt, ob die Gruppen wahr sind. Gefragt wird, ob sie tragen.
03 · PROTOKOLL
Wissenschaftliche Frage
Erscheint für diese 360 Kunden, diese drei erklärten Variablen, diese erklärte Distanz und dieses erklärte Resampling-Verfahren jedes der vier vorgeschlagenen Segmente oft genug wieder, um ein eigenes Budget zu rechtfertigen? Und übertrifft dieses Wiederauftauchen, was eine Datei ganz ohne Struktur allein durch Resampling bereits erzeugt? Die Frage betrifft weder die Existenz der Gruppen noch ihren Nutzen, sondern ihre Reproduzierbarkeit unter Störung.
04 · PROTOKOLL
Warum der einfache Ansatz scheitern kann
Die Lösung einmal anzusehen sagt nichts: Ein Partitionsalgorithmus liefert stets die verlangte Gruppenzahl, und in einer einzelnen Ziehung wirkt diese Zahl immer sauber. Die Berechnung ohne Datenänderung zu wiederholen sagt ebenfalls nichts, da der Start deterministisch ist. Und eine hohe Wiederfindung ohne Vergleichsmaßstab kann völlig in die Irre führen: In dieser Datei erreicht die strukturlose Referenz bei vier Segmenten 0,829190 — eine Zahl, die man gern als Beleg für Robustheit läse, stünde sie nicht neben etwas anderem.
05 · PROTOKOLL
Intuition der Methode
Die Idee passt in einen Satz: Die Datei stören, genau dieselbe Arbeit wiederholen und sehen, was zurückkommt. Jede Störung ist ein mit Zurücklegen gezogenes Resample in der Größe der Datei. Nach jedem Neuaufbau werden alle ursprünglichen Kunden den neuen Zentren zugeordnet, sodass beide Aufteilungen dieselben Menschen betreffen und sich ohne Kunstgriff vergleichen lassen. Jedes Ausgangssegment erhält dann die beste Wiederfindung, die es gegenüber den neu gebildeten Segmenten erreicht. Alles wird ein zweites Mal auf einer strukturlosen Referenz gemessen, um zu erfahren, was Rauschen allein erzeugt.
06 · PROTOKOLL
Erforderliche Daten
Vor jeder Lektüre festgeschrieben: die lückenlos geordnete Kundenkennung, Recency, Frequenz, durchschnittlicher Warenkorb, die erklärten Transformationen, die Standardisierung, die Distanz, der deterministische Start, die geprüften Segmentzahlen (2, 3 und 4), die vorgeschlagene Zahl (4), die 40 Resamples, die arithmetische Rekursion, die sie erzeugt, die strukturlose Referenz und die beiden Schwellen. Die versiegelte Datei enthält 360 Kunden. Der Fall ist synthetisch und wird so ausgewiesen.
07 · PROTOKOLL
Formales Modell und Symbole
Jeder Kunde ist ein Vektor aus drei standardisierten Koordinaten: Logarithmus der Recency, Frequenz, Logarithmus des Warenkorbs. Die Distanz ist quadratisch euklidisch, und ein Segment sammelt die Kunden, die ihrem Zentrum näher sind als jedem anderen. Die Wiederfindung eines Segments S durch ein neu gebildetes Segment R ist der Jaccard-Index, also die Zahl der gemeinsamen Kunden geteilt durch die Zahl der Kunden in einem der beiden. Die Resamples stammen aus einer erklärten Rekursion: Der nächste Zustand ist (1103515245 × Zustand + 12345) modulo 2^31, und der gezogene Kunde ist der Zustand modulo der Kundenzahl.
08 · PROTOKOLL
Deklarierte Berechnung
Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende Datei ablehnen; die drei Variablen über die ganze Datei transformieren und standardisieren; die strukturlose Referenz durch unabhängige Permutation jeder Variablen mit derselben Rekursion bilden; für jede geprüfte Segmentzahl die Aufteilung auf der ganzen Datei bilden und die Zusammensetzung jedes Segments festhalten; die 40 Resamples ziehen, neu aufbauen, alle ursprünglichen Kunden neu zuordnen und jedem Segment seinen besten Jaccard-Wert geben, mit Abbruch, wenn ein Resample die verlangte Zahl nicht liefert; über die Resamples mitteln, dasselbe unverändert auf der strukturlosen Referenz wiederholen, dann die schwächste Wiederfindung, jene der Referenz und ihre Differenz berechnen; die beiden Schwellen anwenden und dann die Verdiktregel auf die vorgeschlagene Zahl.
09 · PROTOKOLL
Durchgängiges Zahlenbeispiel
Synthetische Illustration — Lehrwerte, nicht beobachtet
In der versiegelten Datei: 360 Kunden, 40 Resamples. Bei zwei Segmenten Wiederfindungen 0,977481 und 0,976322; die schwächste beträgt 0,976322, die strukturlose Referenz 0,647971, die Differenz 0,328351, also STABLE. Bei drei Segmenten: 0,990139, 0,986949 und 0,997222; schwächste 0,986949, Referenz 0,606088, Differenz 0,380860, also STABLE. Bei vier Segmenten, der vorgeschlagenen Zahl: 0,848874, 0,664749, 0,827341 und 0,979621; schwächste 0,664749, unter der Schwelle von 0,75, Referenz 0,829190 und Differenz −0,164441, also NOT_STABLE. Verdikt: PROPOSED_SEGMENTATION_NOT_STABLE.
10 · PROTOKOLL
Validitätsannahmen
Das Verfahren setzt voraus, dass die Kunden der Datei als austauschbare Beobachtungen einer Population behandelt werden dürfen, was das Ziehen mit Zurücklegen erst rechtfertigt; dass die drei Variablen beschreiben, was das Team unterscheiden will; und dass die durch Permutation gewonnene Referenz die gemeinsame Struktur tatsächlich zerstört und jede Randverteilung erhält. Es setzt nicht voraus, dass vier Segmente existieren, noch dass drei die richtige Zahl ist. Drei Dinge sind hier nicht prüfbar: die Relevanz der Variablen, das Fortbestehen der Aufteilung über die Zeit und die unterschiedliche Reaktion eines Segments auf eine Maßnahme.
11 · PROTOKOLL
Diagnostik und Unsicherheit
Die mittlere Wiederfindung beruht auf 40 Resamples: Ein Intervall steht nicht dabei, weil die Unsicherheit des Mittelwerts bei dieser Ziehungszahl in derselben Größenordnung läge wie die Unterschiede, die man lesen will — und die Seite sagt das, statt eine Genauigkeit vorzuführen, die sie nicht hat. Entscheidend ist nicht das rohe Niveau, sondern die Differenz: Bei vier Segmenten ist sie negativ, −0,164441, das heißt, die echte Datei reproduziert ihre Segmente schlechter als eine Datei ohne Struktur. Keine dieser Zahlen ist ein p-Wert, und keine prüft eine Hypothese.
12 · PROTOKOLL
Robustheit und Alternativen
Vor dem Ergebnis erklärte Alternativen: das Ziehen mit Zurücklegen durch Teilstichproben ohne Zurücklegen fester Größe ersetzen und prüfen, ob die Schlussfolgerung vom Schema abhängt; den Jaccard-Index durch den bereinigten Rand-Index ersetzen, der die ganze Aufteilung statt jedes Segments beurteilt; die Zahl der Resamples erhöhen, um die Mittelwerte zu verengen; oder die Variablen mit einem erklärten Rauschen statt durch Ziehung stören. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt umkehrt.
13 · PROTOKOLL
Interpretation des Ergebnisses
Die vorgeschlagene Lösung trägt nicht. Eines ihrer vier Segmente löst sich auf, sobald die Berechnung auf leicht anderen Kunden wiederholt wird, und das Ganze reproduziert sich schlechter als eine Datei ohne Struktur. Die Aufteilung in drei Segmente kehrt dagegen fast unversehrt zurück. Doch hier endet die Lektüre: Auch die Zwei-Segment-Aufteilung ist stabil, was zeigt, dass eine gute Wiederfindung nicht die richtige Gruppenzahl benennt. Stabilität scheidet Kandidaten aus; sie krönt keinen.
14 · PROTOKOLL
Zulässige Schlussfolgerungen
Zulässig: es abzulehnen, vier Budgets an die vorgeschlagene Lösung zu binden; die Wiederfindung jedes Segments, die strukturlose Referenz und die Differenz zu veröffentlichen; zu sagen, dass eines der vier Segmente sich unter Resampling auflöst; drei Segmente als ernsthaften Kandidaten zu behalten, sofern dies mit etwas anderem als Stabilität begründet wird; und von einem Dienstleister diese drei Zahlen zu jeder gelieferten Segmentierung zu verlangen. Ebenfalls zulässig: zu sagen, dass dieses Ergebnis für diese Variablen und diesen Zeitraum gilt, und die Prüfung bei einer Änderung zu wiederholen.
15 · PROTOKOLL
Unzulässige Schlussfolgerungen
Unzulässig: zu schließen, drei sei die wahre Segmentzahl, obwohl auch zwei die Schwellen erreicht; eine hohe Wiederfindung als Beleg für vorhandene Struktur zu lesen, obwohl die strukturlose Referenz bei vier Segmenten 0,829190 erreicht; Stabilität als Maß geschäftlichen Nutzens auszugeben; zu schließen, ein stabiles Segment reagiere besser auf ein Angebot; oder die Berechnung mit mehreren Schwellen zu wiederholen und nur die bequeme zu veröffentlichen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.
16 · PROTOKOLL
Mögliche Marketingentscheidung
Die vernünftige Entscheidung ist, die Vier-Gruppen-Segmentierung mit den drei Zahlen, die sie widerlegen, an ihren Urheber zurückzugeben und keines der vier Programme in dieser Form zu finanzieren. Will das Team weitergehen, setzt es bei der Drei-Segment-Lösung an, begründet sie mit seiner Betreuungskapazität und der Wertlücke zwischen den Gruppen und misst dann die tatsächliche Wirkung jedes Programms mit einem Experiment samt Kontrollgruppe in jedem Segment. Stabilität bedingt das Recht weiterzumachen; sie ersetzt die Messung nicht.
17 · PROTOKOLL
Wann die Methode geeignet oder ungeeignet ist
Diese Prüfung einsetzen, sooft eine Segmentierung als Grundlage für Budgets geliefert wird, und vor jedem Produktivgang. Als alleiniges Kriterium für die Wahl der Segmentzahl meiden, da sie keine benennt. Ebenfalls meiden, wenn die Basis eben erneuert wurde, wenn die Variablen nicht beschreiben, was unterschieden werden soll, oder wenn eigentlich die Wirkung einer Maßnahme auf ein Segment gefragt ist, was ein Experiment und kein Resampling verlangt.
18 · PROTOKOLL
Implementierungen und Endergebnis
Die CC0-CSV enthält die 360 synthetischen Kunden. Python und R sind die Referenzimplementierungen; SPSS führt dieselbe Berechnung in einem Python-Block aus; SAS reproduziert die erklärte Rekursion exakt, zieht also dieselben Resamples, überlässt die Gruppierung aber der eigenen Prozedur und prüft die Kennzeichen statt jeder Dezimale. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die erklärten Variablen und die Distanz, die Resampling-Rekursion, die strukturlose Referenz, die beiden Schwellen, die sieben nummerierten Schritte, die Wiederfindung jedes Segments für jede geprüfte Zahl, die Differenzen, die Kennzeichen, das Verdikt und die Softwareversionen.
Synthetische Daten · CC0
msc-p032-stability-panel.csv ↓Reproduzierbarkeitsprotokoll
msc-p032-reproducibility-readme.md ↓Python-Referenz · MIT
msc-p032-reference.py ↓R-Referenz · MIT
msc-p032-reference.R ↓SPSS-Implementierung · MIT
msc-p032-secondary.sps ↓SAS-Implementierung · MIT
msc-p032-secondary.sas ↓19 · PROTOKOLL
Quellen und Evidenzniveau
Von Luxburg erläutert, dass eine Stabilitätsprüfung verlangt, den Algorithmus auf leicht verschiedenen Datensätzen erneut laufen zu lassen, und dass ein stabiles Ergebnis bei zu kleiner Segmentzahl keine brauchbare Schlussfolgerung trägt; sie erinnert zudem daran, dass der Wert mit dem einer strukturlosen Referenzverteilung verglichen wird und dass das Ziehen mit Zurücklegen das Standardschema der Bootstrap-Literatur ist. Hennig hält fest, dass Stabilität mit wenigen Gruppen leichter zu erreichen ist und dass Variablen für die gestellte Frage gewählt werden müssen. Ullmann, Hennig und Boulesteix verorten die Stabilitätsanalyse in einem Validierungsrahmen und erinnern an die verbreitete Praxis, die stabilste Segmentzahl zu behalten. Ullmann und Mitautoren zeigen schließlich, dass die Segmentzahl eine Einstellung ist, deren Folgen zu prüfen sind, und dass Schutz vor Überoptimismus vorab festgelegte Regeln verlangt. Grundlegende Referenzen: von Luxburg (2010, arXiv-Preprint; erschienen in Foundations and Trends in Machine Learning, begutachtet) und Hennig (2015, arXiv-Preprint; erschienen in Pattern Recognition Letters, begutachtet). Neuere Entwicklungen: Ullmann, Hennig und Boulesteix (2021, arXiv-Preprint; erschienen in WIREs Data Mining and Knowledge Discovery, begutachtet) und Ullmann et al. (2022, Advances in Data Analysis and Classification, CC-BY-Open-Access, begutachtet).
- von Luxburg (2010) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Hennig (2015) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Ullmann, Hennig & Boulesteix (2021) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Ullmann et al. (2022) Volltext geprüft, mit kurzem im Original verorteten Auszug.
Methodische Verbindungen

