Research & Evidence

Methode suchen

Titel, Fragen, Gebiete und MSC-Kennungen durchsuchen.

41 Ergebnisse
  1. MSC-P-001Wie wird aus einer Marketingbehauptung eine testbare Frage?Entscheidungswissenschaft↗
  2. MSC-P-002Korrelation oder Kausalität: Welche Aussage trägt eine Analyse wirklich?Marketingmessung↗
  3. MSC-P-003Wie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?Entscheidungswissenschaft↗
  4. MSC-P-004Signifikanz oder Effektgröße: Welches Ergebnis ist zu interpretieren?Entscheidungswissenschaft↗
  5. MSC-P-005Wie misst man ein nicht direkt beobachtbares Marketingkonstrukt?Marktforschung↗
  6. MSC-P-006Wie wird eine Messskala entwickelt und validiert?Marktforschung↗
  7. MSC-P-007Alpha oder Omega: Wie wird die Reliabilität einer Skala beurteilt?Marktforschung↗
  8. MSC-P-009PCA, EFA oder CFA: Welche Methode passt?Marktforschung↗
  9. MSC-P-010Wann sollte ein Marketingexperiment durchgeführt werden?Marketingmessung↗
  10. MSC-P-011Wie plant man einen A/B-Test, der tatsächlich einen Effekt schätzt?Marketingmessung↗
  11. MSC-P-012Wie viele Beobachtungen braucht ein Experiment?Entscheidungswissenschaft↗
  12. MSC-P-013Wie misst man den inkrementellen Kampagneneffekt mit einer Kontrollgruppe?Marketingmessung↗
  13. MSC-P-017Wie erkennt man Selektion, Kontamination und Ausfall in einem Experiment?Marketingmessung↗
  14. MSC-P-018Prädiktive oder kausale Regression: Was soll geschätzt werden?Marketingmodelle↗
  15. MSC-P-019Wie diagnostiziert man eine Marketingregression vor der Interpretation?Marketingmodelle↗
  16. MSC-P-022Wie schätzt man Preiselastizität und ihre Unsicherheit?Preisforschung↗
  17. MSC-P-026Logit vs Probit: Wie wählt man für eine Kaufwahrscheinlichkeit?Kundenforschung↗
  18. MSC-P-029Welche Kunden haben die höchste Abwanderungswahrscheinlichkeit?Kundenforschung↗
  19. MSC-P-027TAM, UTAUT oder UTAUT2: Welcher Rahmen eignet sich zur Untersuchung der Technologieakzeptanz?Marktforschung↗
  20. MSC-H-001Messung und Kausalität: Wie lässt sich ein Marketingeffekt belegen?Marketingmessung↗
  21. MSC-H-002Marketing-Reaktionsmodelle: Form, Verzögerung und SättigungMarketingmodelle↗
  22. MSC-H-003Preisforschung: Preis, Nachfrage und Deckungsbeitrag verbindenPreisforschung↗
  23. MSC-H-004Kunden- und Wahlforschung: Verhalten, Wert und HeterogenitätKundenforschung↗
  24. MSC-H-005Messwissenschaft: valide Indikatoren entwickelnMarktforschung↗
  25. MSC-H-006Statistische Entscheidungsmethoden: wählen, quantifizieren, validierenEntscheidungswissenschaft↗
  26. MSC-P-008Wie validiert man eine Marketing-Messskala?Marktforschung↗
  27. MSC-P-014Wie plant man ein geografisches Marketingexperiment?Marketingmessung↗
  28. MSC-P-015Wie schätzt man einen Effekt mit Difference-in-Differences?Marketingmessung↗
  29. MSC-P-020Wie behandelt man Preisendogenität?Preisforschung↗
  30. MSC-P-021Feste oder zufällige Effekte: Welches Panelmodell passt?Marketingmodelle↗
  31. MSC-P-023Wie schätzt man eine Nachfragefunktion?Preisforschung↗
  32. MSC-P-024Wie simuliert man ein Preis-Mengen-Margen-Szenario?Preisforschung↗
  33. MSC-P-028Wie schätzt man CLV mit BG/NBD und Gamma-Gamma?Kundenforschung↗
  34. MSC-P-030Wie analysiert man Kundenbindung mit Überlebensmodellen?Kundenforschung↗
  35. MSC-P-043Was ist ein Abonnent wert, wenn erst sechs Monate Bindungsdaten vorliegen?Kundenforschung↗
  36. MSC-P-031Wie erstellt man eine nützliche Kundensegmentierung?Kundenforschung↗
  37. MSC-P-032Wie prüft man die Stabilität einer Segmentierung?Kundenforschung↗
  38. MSC-P-033Wie validiert man eine Marketingprognose?Entscheidungswissenschaft↗
  39. MSC-P-034Wie erstellt man eine Monte-Carlo-Simulation für Marketingentscheidungen?Entscheidungswissenschaft↗
  40. MSC-P-035Wie modelliert man Sättigung und Adstock?Marketingmodelle↗
  41. MSC-P-039Welchen statistischen Test sollte man wählen?Entscheidungswissenschaft↗
← Alle Methoden
METHODEN-DOSSIERMSC-P-039Grundlagen der EvidenzGeprüftes wissenschaftliches Dossier

Welchen statistischen Test sollte man wählen?

Die Wahl beginnt bei Frage, Estimand, Stichprobendesign, Variablentyp und Abhängigkeiten. Der Testname ist nur der letzte Schritt.

Wissenschaftliche Redaktion: Marketing Science Center

Direkte Antwort

Ein kohärentes Verfahren wählen und Effekt, Intervall sowie Annahmen berichten.

Die Wahl beginnt bei Frage, Estimand, Stichprobendesign, Variablentyp und Abhängigkeiten. Der Testname ist nur der letzte Schritt.

Welch, 1947ASA, 2016

01 · PROTOKOLL

Operative Zusammenfassung

Drei Verfahren werden an 2000 simulierten Datensätzen geprüft: Welchs Test, der Rangtest und die verbreitete Regel, die zuerst auf Normalität testet und dann wählt. Unter den beiden erklärten Nullhypothesen halten alle drei ihr angekündigtes Niveau von 0,05 — die zweistufige Regel verwirft in 0,060000 und 0,056000 der Fälle. Verdikt: PRETEST_RULE_HOLDS_ITS_LEVEL. Doch der eigentliche Unterschied liegt anderswo: Bei schiefen Daten entdeckt Welch nur 0,319500 der Effekte gegenüber 0,422500 beim Rangtest. Die Wahl wird in Trennschärfe bezahlt, nicht im Niveau.

02 · PROTOKOLL

Konkrete Marketingsituation

Ein Team hat in zwei Gruppen von je dreißig Personen die Zeit bis zur Kaufentscheidung gemessen. Die Tabellenkalkulation bietet einen Student-Test an, ein Kollege rät zu einem nichtparametrischen Test, weil „die Daten nicht normal sind“, ein anderer schlägt vor, zuerst die Normalität zu prüfen und die Antwort entscheiden zu lassen. Drei Ratschläge, drei Verfahren, und kein offensichtlicher Weg, dies aus dieser einen Datei zu klären.

03 · PROTOKOLL

Wissenschaftliche Frage

Verwirft jedes dieser drei erklärten Verfahren bei diesem nominalen Niveau von 0,05, diesen beiden erklärten Nullhypothesen und diesen 2000 Wiederholungen so oft, wie es behauptet? Und wenn ja: Welches entdeckt einen echten Effekt am besten? Die Frage betrifft nicht die Datei des Teams, die allein nichts klären kann, sondern das Verhalten der Verfahren selbst, wenn die Wahrheit bekannt ist.

04 · PROTOKOLL

Warum der einfache Ansatz scheitern kann

Die Datei anzusehen und p-Werte zu vergleichen klärt nichts: In dieser Datei berichten die drei Verfahren 0,012060, 0,010993 und 0,010993, und keine Entscheidung würde sich ändern. Das ist die übliche Falle — man glaubt, einen Test durch den Blick auf die eigenen Daten zu wählen, während ein einzelner Datensatz nicht sagen kann, ob ein Verfahren hält, was es verspricht. Und die Normalität zu prüfen, um zu entscheiden, heißt, die Daten ihren eigenen Richter wählen zu lassen — was nicht dasselbe ist wie ein Test zu 5 %.

05 · PROTOKOLL

Intuition der Methode

Die Methode besteht darin, die Frage umzudrehen. Statt zu fragen, welcher Test zu diesen Daten passt, fertigt man Tausende Datensätze an, deren Wahrheit man kennt, wendet jedes Verfahren auf alle an und zählt. Unter einer Nullhypothese verwirft ein bei 5 % ehrliches Verfahren etwa fünfmal von hundert: Verwirft es öfter, ist es kein Test zu 5 %, wie immer es heißt. Unter einer Alternativhypothese zählt man erneut, und diese Zahl heißt Trennschärfe. Zwei Zählungen, zwei verschiedene Eigenschaften.

06 · PROTOKOLL

Erforderliche Daten

Vor jeder Lektüre festgeschrieben: die lückenlose Einheitenkennung, die auf zwei Werte beschränkte Gruppe, das gemessene Ergebnis, die drei Verfahren, das nominale Niveau von 0,05, das Niveau des Normalitätstests, die drei Szenarien, die 2000 Wiederholungen, die 25 Einheiten je Gruppe, die Rekursion, die die Ziehungen erzeugt, und die Toleranz auf dem Niveau. Die versiegelte Arbeitsdatei enthält 60 Einheiten. Der Fall ist synthetisch und wird so ausgewiesen.

07 · PROTOKOLL

Formales Modell und Symbole

Welchs Test vergleicht Mittelwerte, indem er ihre Differenz durch einen Standardfehler teilt, der ungleiche Varianzen zulässt, mit Satterthwaite-Freiheitsgraden. Der Rangtest ersetzt jeden Wert durch seinen Rang in der vereinigten Stichprobe, summiert die Ränge einer Gruppe und vergleicht diese Summe mit ihrem Wert ohne Unterschied, über eine Normalapproximation mit Bindungskorrektur und ohne Stetigkeitskorrektur. Der erklärte Normalitätstest ist der von Jarque-Bera: Er verbindet Schiefe und Wölbung zu einer Statistik, die mit einer Chi-Quadrat-Verteilung mit zwei Freiheitsgraden verglichen wird.

08 · PROTOKOLL

Deklarierte Berechnung

Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende Datei ablehnen; die drei Verfahren auf der Arbeitsdatei ausführen und festhalten, was die zweistufige Regel wählte; für jedes Szenario die Rekursion auf ihren Startwert zurücksetzen; 2000 Wiederholungen zweier Gruppen zu je 25 per Box-Muller ziehen, für die schiefen Szenarien exponenzieren und der zweiten Gruppe die erklärte Verschiebung geben; die drei Verfahren auf jede Wiederholung anwenden und Verwerfungen sowie den gewählten Test notieren; durch die Zahl der Wiederholungen teilen; die erklärte Toleranz auf die beiden Nullszenarien anwenden, dann die Verdiktregel allein auf die zweistufige Regel.

09 · PROTOKOLL

Durchgängiges Zahlenbeispiel

Synthetische Illustration — Lehrwerte, nicht beobachtet

In der versiegelten Arbeitsdatei: 30 Einheiten je Gruppe, Welch liefert eine Statistik von 2,640102 bei 37,036660 Freiheitsgraden und einen Rand von 0,012060; der Rangtest liefert 278,000000, einen standardisierten Wert von −2,542921 und einen Rand von 0,010993; Jarque-Bera liefert 54,410246 und 37,041217, sodass die zweistufige Regel den Rangtest wählt und 0,010993 berichtet. Über die 2000 Wiederholungen: unter der normalen Null 0,058500 für Welch, 0,053500 für den Rangtest, 0,060000 für die Regel, die in 0,953500 der Fälle Welch wählte; unter der schiefen Null 0,049000, 0,053500 und 0,056000, wobei Welch in 0,058000 der Fälle gewählt wurde. Die sechs Prüfungen bestehen. Unter der schiefen Alternative 0,319500, 0,422500 und 0,424500. Verdikt: PRETEST_RULE_HOLDS_ITS_LEVEL.

10 · PROTOKOLL

Validitätsannahmen

Die Simulation setzt voraus, dass die Einheiten unabhängig sind, dass die beiden Gruppen unter der Null austauschbar sind und dass die erklärten Verteilungen — normal und lognormal — interessierende Situationen abbilden. Sie setzt zudem voraus, dass der erklärte Generator Ziehungen liefert, die der Unabhängigkeit nahe genug kommen, damit die Zählungen deutbar sind. Drei Dinge sind hier nicht prüfbar: das Verhalten der Verfahren bei ungleichen Varianzen und ungleichen Gruppengrößen, jenes anderer Normalitätstests, und ob Mittelwert oder Rang die Frage beantwortet, die das Team tatsächlich stellt.

11 · PROTOKOLL

Diagnostik und Unsicherheit

Die Diagnose passt in zwei Lesarten. Das Niveau: Die sechs Raten unter der Null reichen von 0,049000 bis 0,060000, alle innerhalb der Toleranz von 0,0125 um 0,05, deren Standardfehler bei 2000 Wiederholungen etwa 0,0049 beträgt — die Toleranz entspricht also rund zweieinhalb Standardfehlern. Die Trennschärfe: Unter der schiefen Alternative ist der Abstand zwischen Welch und dem Rangtest, 0,319500 gegen 0,422500, weit größer als alles, was die Niveaus trennt. Und der Anteil der Welch-Wahlen durch die zweistufige Regel, 0,953500 bei normalen gegen 0,058000 bei schiefen Daten, zeigt, dass diese Regel kein drittes Verfahren ist, sondern eine Weiche.

12 · PROTOKOLL

Robustheit und Alternativen

Vor dem Ergebnis erklärte Alternativen: die Simulation mit ungleichen Varianzen und ungleichen Gruppengrößen wiederholen, jener Konstellation, für die die Literatur die größten Verzerrungen meldet; Jarque-Bera durch Shapiro-Wilk ersetzen, den verbreitetsten Normalitätstest; die Zahl der Wiederholungen erhöhen, um die Raten zu verengen; oder die beiden Tests durch einen Quantilvergleich ersetzen, der eine andere Frage beantwortet als Mittelwert oder Rang. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt umkehrt.

13 · PROTOKOLL

Interpretation des Ergebnisses

Das Ergebnis ist nicht die erwartete Verurteilung. In den hier erklärten Konstellationen hält die zweistufige Regel ihr Niveau, und die neben diesem Dossier versiegelte begutachtete Studie fand dasselbe, erinnerte aber daran, dass das Verfahren formal unzulässig bleibt. Beide Aussagen gelten zugleich: Die Testwahl an den Daten auszurichten bricht die Logik des Tests, und in genau diesen Konstellationen zeigt sich der Schaden nicht im Gesamtniveau. Was sich zeigt, ist die verlorene Trennschärfe, wenn ein Mittelwerttest auf schiefe Daten angewandt wird.

14 · PROTOKOLL

Zulässige Schlussfolgerungen

Zulässig: den Test aus der Frage, dem Stichprobendesign und der Ergebnisskala zu wählen, bevor man die Daten sieht; die Effektgröße und ihr Intervall neben dem p-Wert zu veröffentlichen; zu sagen, dass die drei Verfahren in dieser Datei übereinstimmen; einen Rangtest zu verwenden, wenn die Verteilung sichtbar schief ist und die Frage eine allgemeine Verschiebung statt eines Mittelwerts betrifft; und diese Art Simulation zu wiederholen, bevor eine automatische Regel eingeführt wird.

15 · PROTOKOLL

Unzulässige Schlussfolgerungen

Unzulässig: aus diesem Dossier zu schließen, die zweistufige Regel sei korrekt, obwohl sie formal fehlerhaft bleibt und nur in den erklärten Konstellationen geprüft wurde; diese Raten auf ungleiche Varianzen oder ungleiche Gruppengrößen zu übertragen, die nicht untersucht wurden; den Test zu wählen, nachdem man gesehen hat, welches Verfahren den kleinsten p-Wert liefert; einen p-Wert allein als Ergebnis darzustellen; oder eine ausbleibende Verwerfung als Beleg für fehlende Wirkung zu lesen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.

16 · PROTOKOLL

Mögliche Marketingentscheidung

Die vernünftige Entscheidung ist, die Testwahl vor der Erhebung ins Protokoll zu schreiben — aus der gestellten Frage und dem Stichprobendesign — und dabei zu bleiben. Ist die erwartete Verteilung schief, führt das hier zum Rangtest, der ein Drittel mehr Effekte entdeckt. Besteht das Team auf einer Mittelwertdifferenz, weil der Mittelwert den wirtschaftlichen Wert trägt, bleibt es bei Welch und nimmt die geringere Trennschärfe bewusst hin. Was keine automatische Regel an seiner Stelle tut, ist zu entscheiden, welche der beiden Fragen es stellt.

17 · PROTOKOLL

Wann die Methode geeignet oder ungeeignet ist

Diesen Ansatz nutzen, bevor ein Analyseverfahren in einem Protokoll oder Werkzeug festgeschrieben wird. Ihn nicht als Mittel verwenden, einen Test nachträglich zu wählen — genau das verbietet er. Ebenfalls meiden, wenn die Einheiten nicht unabhängig sind — Messwiederholungen, Cluster, Panels —, da keines der drei geprüften Verfahren das berücksichtigt. Und meiden, wenn die Frage einen Kausaleffekt betrifft: Die Testwahl ersetzt kein Design, das diesen Effekt identifiziert.

18 · PROTOKOLL

Implementierungen und Endergebnis

Die CC0-CSV enthält die 60 synthetischen Einheiten der Arbeitsdatei. Python und R sind die Referenzimplementierungen; der SPSS-Block ist keine Neuschreibung, sondern wird aus der Berechnung der Referenz erzeugt, sodass beide nicht auseinanderlaufen können; SAS reproduziert die erklärte Rekursion und implementiert den Rangtest in einem Datenschritt, bezieht seine Verteilungsränder aber aus eigenen Funktionen. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die drei erklärten Verfahren, das nominale Niveau, die drei Szenarien, die Rekursion und ihre in Doppelarithmetik exakte Form, die Toleranz, die sieben nummerierten Schritte, die Ergebnisse der Arbeitsdatei, die Verwerfungsraten je Szenario, den Anteil jeder Testwahl, die sechs Kennzeichen, das Verdikt und die Softwareversionen.

19 · PROTOKOLL

Quellen und Evidenzniveau

Rochon, Gondan und Kieser beschreiben genau die hier geprüfte Regel — das Ergebnis des Vortests bestimmt die danach verwendete Methode —, stellen fest, dass dieser Vortest den bedingten Fehler ernsthaft verändert, schließen, dass das zweistufige Verfahren aus formaler Sicht als unzulässig gelten kann, und beobachten gleichwohl, dass es das nominale Niveau zufriedenstellend zu halten schien. Greenland und Mitautoren erinnern daran, dass jede Inferenzmethode auf einem komplexen Geflecht von Annahmen ruht und dass ein sehr kleiner p-Wert nicht sagt, welche davon falsch ist. Lakens erinnert daran, dass die Effektgröße das wichtigste Ergebnis einer empirischen Studie ist. Rousselet, Pernet und Wilcox erinnern daran, dass eine Verteilung über ihren Mittelwert zusammenzufassen eine Entscheidung ist, keine Selbstverständlichkeit. Grundlegende Referenzen: Rochon, Gondan und Kieser (2012, BMC Medical Research Methodology, CC-BY-Open-Access, begutachtet) und Greenland et al. (2016, European Journal of Epidemiology, Open Access, begutachtet). Neuere Entwicklungen: Lakens (2013, Frontiers in Psychology, CC-BY-Open-Access, begutachtet) und Rousselet, Pernet und Wilcox (2017, akzeptiertes Manuskript im Repositorium der Universität Edinburgh; erschienen im European Journal of Neuroscience, begutachtet).

  1. Rochon, Gondan & Kieser (2012) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  2. Greenland et al. (2016) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  3. Lakens (2013) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  4. Rousselet, Pernet & Wilcox (2017) Volltext geprüft, mit kurzem im Original verorteten Auszug.

Methodische Verbindungen

Übergeordnetes GebietStatistische Entscheidungsmethoden: wählen, quantifizieren, validierenErfordertSignifikanz oder Effektgröße: Welches Ergebnis ist zu interpretieren?Vergleichen mitWie viele Beobachtungen braucht ein Experiment?

Als Nächstes

MSC-H-006Statistische Entscheidungsmethoden: wählen, quantifizieren, validieren→MSC-P-003Wie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?→MSC-P-004Signifikanz oder Effektgröße: Welches Ergebnis ist zu interpretieren?→MSC-P-012Wie viele Beobachtungen braucht ein Experiment?→