Research & Evidence

Methode suchen

Titel, Fragen, Gebiete und MSC-Kennungen durchsuchen.

41 Ergebnisse
  1. MSC-P-001Wie wird aus einer Marketingbehauptung eine testbare Frage?Entscheidungswissenschaft↗
  2. MSC-P-002Korrelation oder Kausalität: Welche Aussage trägt eine Analyse wirklich?Marketingmessung↗
  3. MSC-P-003Wie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?Entscheidungswissenschaft↗
  4. MSC-P-004Signifikanz oder Effektgröße: Welches Ergebnis ist zu interpretieren?Entscheidungswissenschaft↗
  5. MSC-P-005Wie misst man ein nicht direkt beobachtbares Marketingkonstrukt?Marktforschung↗
  6. MSC-P-006Wie wird eine Messskala entwickelt und validiert?Marktforschung↗
  7. MSC-P-007Alpha oder Omega: Wie wird die Reliabilität einer Skala beurteilt?Marktforschung↗
  8. MSC-P-009PCA, EFA oder CFA: Welche Methode passt?Marktforschung↗
  9. MSC-P-010Wann sollte ein Marketingexperiment durchgeführt werden?Marketingmessung↗
  10. MSC-P-011Wie plant man einen A/B-Test, der tatsächlich einen Effekt schätzt?Marketingmessung↗
  11. MSC-P-012Wie viele Beobachtungen braucht ein Experiment?Entscheidungswissenschaft↗
  12. MSC-P-013Wie misst man den inkrementellen Kampagneneffekt mit einer Kontrollgruppe?Marketingmessung↗
  13. MSC-P-017Wie erkennt man Selektion, Kontamination und Ausfall in einem Experiment?Marketingmessung↗
  14. MSC-P-018Prädiktive oder kausale Regression: Was soll geschätzt werden?Marketingmodelle↗
  15. MSC-P-019Wie diagnostiziert man eine Marketingregression vor der Interpretation?Marketingmodelle↗
  16. MSC-P-022Wie schätzt man Preiselastizität und ihre Unsicherheit?Preisforschung↗
  17. MSC-P-026Logit vs Probit: Wie wählt man für eine Kaufwahrscheinlichkeit?Kundenforschung↗
  18. MSC-P-029Welche Kunden haben die höchste Abwanderungswahrscheinlichkeit?Kundenforschung↗
  19. MSC-P-027TAM, UTAUT oder UTAUT2: Welcher Rahmen eignet sich zur Untersuchung der Technologieakzeptanz?Marktforschung↗
  20. MSC-H-001Messung und Kausalität: Wie lässt sich ein Marketingeffekt belegen?Marketingmessung↗
  21. MSC-H-002Marketing-Reaktionsmodelle: Form, Verzögerung und SättigungMarketingmodelle↗
  22. MSC-H-003Preisforschung: Preis, Nachfrage und Deckungsbeitrag verbindenPreisforschung↗
  23. MSC-H-004Kunden- und Wahlforschung: Verhalten, Wert und HeterogenitätKundenforschung↗
  24. MSC-H-005Messwissenschaft: valide Indikatoren entwickelnMarktforschung↗
  25. MSC-H-006Statistische Entscheidungsmethoden: wählen, quantifizieren, validierenEntscheidungswissenschaft↗
  26. MSC-P-008Wie validiert man eine Marketing-Messskala?Marktforschung↗
  27. MSC-P-014Wie plant man ein geografisches Marketingexperiment?Marketingmessung↗
  28. MSC-P-015Wie schätzt man einen Effekt mit Difference-in-Differences?Marketingmessung↗
  29. MSC-P-020Wie behandelt man Preisendogenität?Preisforschung↗
  30. MSC-P-021Feste oder zufällige Effekte: Welches Panelmodell passt?Marketingmodelle↗
  31. MSC-P-023Wie schätzt man eine Nachfragefunktion?Preisforschung↗
  32. MSC-P-024Wie simuliert man ein Preis-Mengen-Margen-Szenario?Preisforschung↗
  33. MSC-P-028Wie schätzt man CLV mit BG/NBD und Gamma-Gamma?Kundenforschung↗
  34. MSC-P-030Wie analysiert man Kundenbindung mit Überlebensmodellen?Kundenforschung↗
  35. MSC-P-043Was ist ein Abonnent wert, wenn erst sechs Monate Bindungsdaten vorliegen?Kundenforschung↗
  36. MSC-P-031Wie erstellt man eine nützliche Kundensegmentierung?Kundenforschung↗
  37. MSC-P-032Wie prüft man die Stabilität einer Segmentierung?Kundenforschung↗
  38. MSC-P-033Wie validiert man eine Marketingprognose?Entscheidungswissenschaft↗
  39. MSC-P-034Wie erstellt man eine Monte-Carlo-Simulation für Marketingentscheidungen?Entscheidungswissenschaft↗
  40. MSC-P-035Wie modelliert man Sättigung und Adstock?Marketingmodelle↗
  41. MSC-P-039Welchen statistischen Test sollte man wählen?Entscheidungswissenschaft↗
← Alle Methoden
METHODEN-DOSSIERMSC-P-032KundenforschungGeprüftes wissenschaftliches Dossier

Wie prüft man die Stabilität einer Segmentierung?

Stabilität prüft, ob eine ähnliche Struktur bei Resampling, Zeitvariation oder vernünftiger Merkmalsstörung wiederkehrt. Sie garantiert keinen Geschäftsnutzen.

Wissenschaftliche Redaktion: Marketing Science Center

Direkte Antwort

Lösungen vergleichen und Zuordnungsrobustheit quantifizieren.

Stabilität prüft, ob eine ähnliche Struktur bei Resampling, Zeitvariation oder vernünftiger Merkmalsstörung wiederkehrt. Sie garantiert keinen Geschäftsnutzen.

Hennig, 2007Rousseeuw, 1987

01 · PROTOKOLL

Operative Zusammenfassung

Für 360 Kunden wird eine Lösung mit vier Segmenten vorgeschlagen. Sie wird auf 40 mit Zurücklegen gezogenen Resamples neu gebildet, und die Wiederfindung jedes Segments wird über den Jaccard-Index gemessen. Das schwächste Segment wird nur zu 0,664749 wiedergefunden, unter der erklärten Schwelle von 0,75. Schlimmer: Eine strukturlose Referenz, gewonnen durch Permutation jeder Variablen, findet ihre eigenen Segmente zu 0,829190 wieder, also besser als die echte Datei. Verdikt: PROPOSED_SEGMENTATION_NOT_STABLE. Die Lösung mit drei Segmenten trägt dagegen bei 0,986949.

02 · PROTOKOLL

Konkrete Marketingsituation

Eine Marketingleitung hat von einem Dienstleister eine Segmentierung in vier Gruppen erhalten, samt Namen, Personas und einem Programm je Gruppe. Bevor vier getrennte Budgets gebunden werden, stellt das Team eine einfache Frage: Kämen diese vier Gruppen zurück, wenn dieselbe Arbeit auf einer leicht anderen Stichprobe derselben Kunden wiederholt würde? Niemand fragt, ob die Gruppen wahr sind. Gefragt wird, ob sie tragen.

03 · PROTOKOLL

Wissenschaftliche Frage

Erscheint für diese 360 Kunden, diese drei erklärten Variablen, diese erklärte Distanz und dieses erklärte Resampling-Verfahren jedes der vier vorgeschlagenen Segmente oft genug wieder, um ein eigenes Budget zu rechtfertigen? Und übertrifft dieses Wiederauftauchen, was eine Datei ganz ohne Struktur allein durch Resampling bereits erzeugt? Die Frage betrifft weder die Existenz der Gruppen noch ihren Nutzen, sondern ihre Reproduzierbarkeit unter Störung.

04 · PROTOKOLL

Warum der einfache Ansatz scheitern kann

Die Lösung einmal anzusehen sagt nichts: Ein Partitionsalgorithmus liefert stets die verlangte Gruppenzahl, und in einer einzelnen Ziehung wirkt diese Zahl immer sauber. Die Berechnung ohne Datenänderung zu wiederholen sagt ebenfalls nichts, da der Start deterministisch ist. Und eine hohe Wiederfindung ohne Vergleichsmaßstab kann völlig in die Irre führen: In dieser Datei erreicht die strukturlose Referenz bei vier Segmenten 0,829190 — eine Zahl, die man gern als Beleg für Robustheit läse, stünde sie nicht neben etwas anderem.

05 · PROTOKOLL

Intuition der Methode

Die Idee passt in einen Satz: Die Datei stören, genau dieselbe Arbeit wiederholen und sehen, was zurückkommt. Jede Störung ist ein mit Zurücklegen gezogenes Resample in der Größe der Datei. Nach jedem Neuaufbau werden alle ursprünglichen Kunden den neuen Zentren zugeordnet, sodass beide Aufteilungen dieselben Menschen betreffen und sich ohne Kunstgriff vergleichen lassen. Jedes Ausgangssegment erhält dann die beste Wiederfindung, die es gegenüber den neu gebildeten Segmenten erreicht. Alles wird ein zweites Mal auf einer strukturlosen Referenz gemessen, um zu erfahren, was Rauschen allein erzeugt.

06 · PROTOKOLL

Erforderliche Daten

Vor jeder Lektüre festgeschrieben: die lückenlos geordnete Kundenkennung, Recency, Frequenz, durchschnittlicher Warenkorb, die erklärten Transformationen, die Standardisierung, die Distanz, der deterministische Start, die geprüften Segmentzahlen (2, 3 und 4), die vorgeschlagene Zahl (4), die 40 Resamples, die arithmetische Rekursion, die sie erzeugt, die strukturlose Referenz und die beiden Schwellen. Die versiegelte Datei enthält 360 Kunden. Der Fall ist synthetisch und wird so ausgewiesen.

07 · PROTOKOLL

Formales Modell und Symbole

Jeder Kunde ist ein Vektor aus drei standardisierten Koordinaten: Logarithmus der Recency, Frequenz, Logarithmus des Warenkorbs. Die Distanz ist quadratisch euklidisch, und ein Segment sammelt die Kunden, die ihrem Zentrum näher sind als jedem anderen. Die Wiederfindung eines Segments S durch ein neu gebildetes Segment R ist der Jaccard-Index, also die Zahl der gemeinsamen Kunden geteilt durch die Zahl der Kunden in einem der beiden. Die Resamples stammen aus einer erklärten Rekursion: Der nächste Zustand ist (1103515245 × Zustand + 12345) modulo 2^31, und der gezogene Kunde ist der Zustand modulo der Kundenzahl.

08 · PROTOKOLL

Deklarierte Berechnung

Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende Datei ablehnen; die drei Variablen über die ganze Datei transformieren und standardisieren; die strukturlose Referenz durch unabhängige Permutation jeder Variablen mit derselben Rekursion bilden; für jede geprüfte Segmentzahl die Aufteilung auf der ganzen Datei bilden und die Zusammensetzung jedes Segments festhalten; die 40 Resamples ziehen, neu aufbauen, alle ursprünglichen Kunden neu zuordnen und jedem Segment seinen besten Jaccard-Wert geben, mit Abbruch, wenn ein Resample die verlangte Zahl nicht liefert; über die Resamples mitteln, dasselbe unverändert auf der strukturlosen Referenz wiederholen, dann die schwächste Wiederfindung, jene der Referenz und ihre Differenz berechnen; die beiden Schwellen anwenden und dann die Verdiktregel auf die vorgeschlagene Zahl.

09 · PROTOKOLL

Durchgängiges Zahlenbeispiel

Synthetische Illustration — Lehrwerte, nicht beobachtet

In der versiegelten Datei: 360 Kunden, 40 Resamples. Bei zwei Segmenten Wiederfindungen 0,977481 und 0,976322; die schwächste beträgt 0,976322, die strukturlose Referenz 0,647971, die Differenz 0,328351, also STABLE. Bei drei Segmenten: 0,990139, 0,986949 und 0,997222; schwächste 0,986949, Referenz 0,606088, Differenz 0,380860, also STABLE. Bei vier Segmenten, der vorgeschlagenen Zahl: 0,848874, 0,664749, 0,827341 und 0,979621; schwächste 0,664749, unter der Schwelle von 0,75, Referenz 0,829190 und Differenz −0,164441, also NOT_STABLE. Verdikt: PROPOSED_SEGMENTATION_NOT_STABLE.

10 · PROTOKOLL

Validitätsannahmen

Das Verfahren setzt voraus, dass die Kunden der Datei als austauschbare Beobachtungen einer Population behandelt werden dürfen, was das Ziehen mit Zurücklegen erst rechtfertigt; dass die drei Variablen beschreiben, was das Team unterscheiden will; und dass die durch Permutation gewonnene Referenz die gemeinsame Struktur tatsächlich zerstört und jede Randverteilung erhält. Es setzt nicht voraus, dass vier Segmente existieren, noch dass drei die richtige Zahl ist. Drei Dinge sind hier nicht prüfbar: die Relevanz der Variablen, das Fortbestehen der Aufteilung über die Zeit und die unterschiedliche Reaktion eines Segments auf eine Maßnahme.

11 · PROTOKOLL

Diagnostik und Unsicherheit

Die mittlere Wiederfindung beruht auf 40 Resamples: Ein Intervall steht nicht dabei, weil die Unsicherheit des Mittelwerts bei dieser Ziehungszahl in derselben Größenordnung läge wie die Unterschiede, die man lesen will — und die Seite sagt das, statt eine Genauigkeit vorzuführen, die sie nicht hat. Entscheidend ist nicht das rohe Niveau, sondern die Differenz: Bei vier Segmenten ist sie negativ, −0,164441, das heißt, die echte Datei reproduziert ihre Segmente schlechter als eine Datei ohne Struktur. Keine dieser Zahlen ist ein p-Wert, und keine prüft eine Hypothese.

12 · PROTOKOLL

Robustheit und Alternativen

Vor dem Ergebnis erklärte Alternativen: das Ziehen mit Zurücklegen durch Teilstichproben ohne Zurücklegen fester Größe ersetzen und prüfen, ob die Schlussfolgerung vom Schema abhängt; den Jaccard-Index durch den bereinigten Rand-Index ersetzen, der die ganze Aufteilung statt jedes Segments beurteilt; die Zahl der Resamples erhöhen, um die Mittelwerte zu verengen; oder die Variablen mit einem erklärten Rauschen statt durch Ziehung stören. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt umkehrt.

13 · PROTOKOLL

Interpretation des Ergebnisses

Die vorgeschlagene Lösung trägt nicht. Eines ihrer vier Segmente löst sich auf, sobald die Berechnung auf leicht anderen Kunden wiederholt wird, und das Ganze reproduziert sich schlechter als eine Datei ohne Struktur. Die Aufteilung in drei Segmente kehrt dagegen fast unversehrt zurück. Doch hier endet die Lektüre: Auch die Zwei-Segment-Aufteilung ist stabil, was zeigt, dass eine gute Wiederfindung nicht die richtige Gruppenzahl benennt. Stabilität scheidet Kandidaten aus; sie krönt keinen.

14 · PROTOKOLL

Zulässige Schlussfolgerungen

Zulässig: es abzulehnen, vier Budgets an die vorgeschlagene Lösung zu binden; die Wiederfindung jedes Segments, die strukturlose Referenz und die Differenz zu veröffentlichen; zu sagen, dass eines der vier Segmente sich unter Resampling auflöst; drei Segmente als ernsthaften Kandidaten zu behalten, sofern dies mit etwas anderem als Stabilität begründet wird; und von einem Dienstleister diese drei Zahlen zu jeder gelieferten Segmentierung zu verlangen. Ebenfalls zulässig: zu sagen, dass dieses Ergebnis für diese Variablen und diesen Zeitraum gilt, und die Prüfung bei einer Änderung zu wiederholen.

15 · PROTOKOLL

Unzulässige Schlussfolgerungen

Unzulässig: zu schließen, drei sei die wahre Segmentzahl, obwohl auch zwei die Schwellen erreicht; eine hohe Wiederfindung als Beleg für vorhandene Struktur zu lesen, obwohl die strukturlose Referenz bei vier Segmenten 0,829190 erreicht; Stabilität als Maß geschäftlichen Nutzens auszugeben; zu schließen, ein stabiles Segment reagiere besser auf ein Angebot; oder die Berechnung mit mehreren Schwellen zu wiederholen und nur die bequeme zu veröffentlichen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.

16 · PROTOKOLL

Mögliche Marketingentscheidung

Die vernünftige Entscheidung ist, die Vier-Gruppen-Segmentierung mit den drei Zahlen, die sie widerlegen, an ihren Urheber zurückzugeben und keines der vier Programme in dieser Form zu finanzieren. Will das Team weitergehen, setzt es bei der Drei-Segment-Lösung an, begründet sie mit seiner Betreuungskapazität und der Wertlücke zwischen den Gruppen und misst dann die tatsächliche Wirkung jedes Programms mit einem Experiment samt Kontrollgruppe in jedem Segment. Stabilität bedingt das Recht weiterzumachen; sie ersetzt die Messung nicht.

17 · PROTOKOLL

Wann die Methode geeignet oder ungeeignet ist

Diese Prüfung einsetzen, sooft eine Segmentierung als Grundlage für Budgets geliefert wird, und vor jedem Produktivgang. Als alleiniges Kriterium für die Wahl der Segmentzahl meiden, da sie keine benennt. Ebenfalls meiden, wenn die Basis eben erneuert wurde, wenn die Variablen nicht beschreiben, was unterschieden werden soll, oder wenn eigentlich die Wirkung einer Maßnahme auf ein Segment gefragt ist, was ein Experiment und kein Resampling verlangt.

18 · PROTOKOLL

Implementierungen und Endergebnis

Die CC0-CSV enthält die 360 synthetischen Kunden. Python und R sind die Referenzimplementierungen; SPSS führt dieselbe Berechnung in einem Python-Block aus; SAS reproduziert die erklärte Rekursion exakt, zieht also dieselben Resamples, überlässt die Gruppierung aber der eigenen Prozedur und prüft die Kennzeichen statt jeder Dezimale. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die erklärten Variablen und die Distanz, die Resampling-Rekursion, die strukturlose Referenz, die beiden Schwellen, die sieben nummerierten Schritte, die Wiederfindung jedes Segments für jede geprüfte Zahl, die Differenzen, die Kennzeichen, das Verdikt und die Softwareversionen.

19 · PROTOKOLL

Quellen und Evidenzniveau

Von Luxburg erläutert, dass eine Stabilitätsprüfung verlangt, den Algorithmus auf leicht verschiedenen Datensätzen erneut laufen zu lassen, und dass ein stabiles Ergebnis bei zu kleiner Segmentzahl keine brauchbare Schlussfolgerung trägt; sie erinnert zudem daran, dass der Wert mit dem einer strukturlosen Referenzverteilung verglichen wird und dass das Ziehen mit Zurücklegen das Standardschema der Bootstrap-Literatur ist. Hennig hält fest, dass Stabilität mit wenigen Gruppen leichter zu erreichen ist und dass Variablen für die gestellte Frage gewählt werden müssen. Ullmann, Hennig und Boulesteix verorten die Stabilitätsanalyse in einem Validierungsrahmen und erinnern an die verbreitete Praxis, die stabilste Segmentzahl zu behalten. Ullmann und Mitautoren zeigen schließlich, dass die Segmentzahl eine Einstellung ist, deren Folgen zu prüfen sind, und dass Schutz vor Überoptimismus vorab festgelegte Regeln verlangt. Grundlegende Referenzen: von Luxburg (2010, arXiv-Preprint; erschienen in Foundations and Trends in Machine Learning, begutachtet) und Hennig (2015, arXiv-Preprint; erschienen in Pattern Recognition Letters, begutachtet). Neuere Entwicklungen: Ullmann, Hennig und Boulesteix (2021, arXiv-Preprint; erschienen in WIREs Data Mining and Knowledge Discovery, begutachtet) und Ullmann et al. (2022, Advances in Data Analysis and Classification, CC-BY-Open-Access, begutachtet).

  1. von Luxburg (2010) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  2. Hennig (2015) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  3. Ullmann, Hennig & Boulesteix (2021) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  4. Ullmann et al. (2022) Volltext geprüft, mit kurzem im Original verorteten Auszug.

Methodische Verbindungen

Übergeordnetes GebietKunden- und Wahlforschung: Verhalten, Wert und HeterogenitätValidiertWie erstellt man eine nützliche Kundensegmentierung?Vergleichen mitWie validiert man eine Marketingprognose?

Als Nächstes

MSC-H-004Kunden- und Wahlforschung: Verhalten, Wert und Heterogenität→MSC-P-031Wie erstellt man eine nützliche Kundensegmentierung?→MSC-P-019Wie diagnostiziert man eine Marketingregression vor der Interpretation?→MSC-P-033Wie validiert man eine Marketingprognose?→