Welchen statistischen Test sollte man wählen?
Die Wahl beginnt bei Frage, Estimand, Stichprobendesign, Variablentyp und Abhängigkeiten. Der Testname ist nur der letzte Schritt.
Wissenschaftliche Redaktion: Marketing Science Center
Direkte Antwort
Ein kohärentes Verfahren wählen und Effekt, Intervall sowie Annahmen berichten.
Die Wahl beginnt bei Frage, Estimand, Stichprobendesign, Variablentyp und Abhängigkeiten. Der Testname ist nur der letzte Schritt.
01 · PROTOKOLL
Operative Zusammenfassung
Drei Verfahren werden an 2000 simulierten Datensätzen geprüft: Welchs Test, der Rangtest und die verbreitete Regel, die zuerst auf Normalität testet und dann wählt. Unter den beiden erklärten Nullhypothesen halten alle drei ihr angekündigtes Niveau von 0,05 — die zweistufige Regel verwirft in 0,060000 und 0,056000 der Fälle. Verdikt: PRETEST_RULE_HOLDS_ITS_LEVEL. Doch der eigentliche Unterschied liegt anderswo: Bei schiefen Daten entdeckt Welch nur 0,319500 der Effekte gegenüber 0,422500 beim Rangtest. Die Wahl wird in Trennschärfe bezahlt, nicht im Niveau.
02 · PROTOKOLL
Konkrete Marketingsituation
Ein Team hat in zwei Gruppen von je dreißig Personen die Zeit bis zur Kaufentscheidung gemessen. Die Tabellenkalkulation bietet einen Student-Test an, ein Kollege rät zu einem nichtparametrischen Test, weil „die Daten nicht normal sind“, ein anderer schlägt vor, zuerst die Normalität zu prüfen und die Antwort entscheiden zu lassen. Drei Ratschläge, drei Verfahren, und kein offensichtlicher Weg, dies aus dieser einen Datei zu klären.
03 · PROTOKOLL
Wissenschaftliche Frage
Verwirft jedes dieser drei erklärten Verfahren bei diesem nominalen Niveau von 0,05, diesen beiden erklärten Nullhypothesen und diesen 2000 Wiederholungen so oft, wie es behauptet? Und wenn ja: Welches entdeckt einen echten Effekt am besten? Die Frage betrifft nicht die Datei des Teams, die allein nichts klären kann, sondern das Verhalten der Verfahren selbst, wenn die Wahrheit bekannt ist.
04 · PROTOKOLL
Warum der einfache Ansatz scheitern kann
Die Datei anzusehen und p-Werte zu vergleichen klärt nichts: In dieser Datei berichten die drei Verfahren 0,012060, 0,010993 und 0,010993, und keine Entscheidung würde sich ändern. Das ist die übliche Falle — man glaubt, einen Test durch den Blick auf die eigenen Daten zu wählen, während ein einzelner Datensatz nicht sagen kann, ob ein Verfahren hält, was es verspricht. Und die Normalität zu prüfen, um zu entscheiden, heißt, die Daten ihren eigenen Richter wählen zu lassen — was nicht dasselbe ist wie ein Test zu 5 %.
05 · PROTOKOLL
Intuition der Methode
Die Methode besteht darin, die Frage umzudrehen. Statt zu fragen, welcher Test zu diesen Daten passt, fertigt man Tausende Datensätze an, deren Wahrheit man kennt, wendet jedes Verfahren auf alle an und zählt. Unter einer Nullhypothese verwirft ein bei 5 % ehrliches Verfahren etwa fünfmal von hundert: Verwirft es öfter, ist es kein Test zu 5 %, wie immer es heißt. Unter einer Alternativhypothese zählt man erneut, und diese Zahl heißt Trennschärfe. Zwei Zählungen, zwei verschiedene Eigenschaften.
06 · PROTOKOLL
Erforderliche Daten
Vor jeder Lektüre festgeschrieben: die lückenlose Einheitenkennung, die auf zwei Werte beschränkte Gruppe, das gemessene Ergebnis, die drei Verfahren, das nominale Niveau von 0,05, das Niveau des Normalitätstests, die drei Szenarien, die 2000 Wiederholungen, die 25 Einheiten je Gruppe, die Rekursion, die die Ziehungen erzeugt, und die Toleranz auf dem Niveau. Die versiegelte Arbeitsdatei enthält 60 Einheiten. Der Fall ist synthetisch und wird so ausgewiesen.
07 · PROTOKOLL
Formales Modell und Symbole
Welchs Test vergleicht Mittelwerte, indem er ihre Differenz durch einen Standardfehler teilt, der ungleiche Varianzen zulässt, mit Satterthwaite-Freiheitsgraden. Der Rangtest ersetzt jeden Wert durch seinen Rang in der vereinigten Stichprobe, summiert die Ränge einer Gruppe und vergleicht diese Summe mit ihrem Wert ohne Unterschied, über eine Normalapproximation mit Bindungskorrektur und ohne Stetigkeitskorrektur. Der erklärte Normalitätstest ist der von Jarque-Bera: Er verbindet Schiefe und Wölbung zu einer Statistik, die mit einer Chi-Quadrat-Verteilung mit zwei Freiheitsgraden verglichen wird.
08 · PROTOKOLL
Deklarierte Berechnung
Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende Datei ablehnen; die drei Verfahren auf der Arbeitsdatei ausführen und festhalten, was die zweistufige Regel wählte; für jedes Szenario die Rekursion auf ihren Startwert zurücksetzen; 2000 Wiederholungen zweier Gruppen zu je 25 per Box-Muller ziehen, für die schiefen Szenarien exponenzieren und der zweiten Gruppe die erklärte Verschiebung geben; die drei Verfahren auf jede Wiederholung anwenden und Verwerfungen sowie den gewählten Test notieren; durch die Zahl der Wiederholungen teilen; die erklärte Toleranz auf die beiden Nullszenarien anwenden, dann die Verdiktregel allein auf die zweistufige Regel.
09 · PROTOKOLL
Durchgängiges Zahlenbeispiel
Synthetische Illustration — Lehrwerte, nicht beobachtet
In der versiegelten Arbeitsdatei: 30 Einheiten je Gruppe, Welch liefert eine Statistik von 2,640102 bei 37,036660 Freiheitsgraden und einen Rand von 0,012060; der Rangtest liefert 278,000000, einen standardisierten Wert von −2,542921 und einen Rand von 0,010993; Jarque-Bera liefert 54,410246 und 37,041217, sodass die zweistufige Regel den Rangtest wählt und 0,010993 berichtet. Über die 2000 Wiederholungen: unter der normalen Null 0,058500 für Welch, 0,053500 für den Rangtest, 0,060000 für die Regel, die in 0,953500 der Fälle Welch wählte; unter der schiefen Null 0,049000, 0,053500 und 0,056000, wobei Welch in 0,058000 der Fälle gewählt wurde. Die sechs Prüfungen bestehen. Unter der schiefen Alternative 0,319500, 0,422500 und 0,424500. Verdikt: PRETEST_RULE_HOLDS_ITS_LEVEL.
10 · PROTOKOLL
Validitätsannahmen
Die Simulation setzt voraus, dass die Einheiten unabhängig sind, dass die beiden Gruppen unter der Null austauschbar sind und dass die erklärten Verteilungen — normal und lognormal — interessierende Situationen abbilden. Sie setzt zudem voraus, dass der erklärte Generator Ziehungen liefert, die der Unabhängigkeit nahe genug kommen, damit die Zählungen deutbar sind. Drei Dinge sind hier nicht prüfbar: das Verhalten der Verfahren bei ungleichen Varianzen und ungleichen Gruppengrößen, jenes anderer Normalitätstests, und ob Mittelwert oder Rang die Frage beantwortet, die das Team tatsächlich stellt.
11 · PROTOKOLL
Diagnostik und Unsicherheit
Die Diagnose passt in zwei Lesarten. Das Niveau: Die sechs Raten unter der Null reichen von 0,049000 bis 0,060000, alle innerhalb der Toleranz von 0,0125 um 0,05, deren Standardfehler bei 2000 Wiederholungen etwa 0,0049 beträgt — die Toleranz entspricht also rund zweieinhalb Standardfehlern. Die Trennschärfe: Unter der schiefen Alternative ist der Abstand zwischen Welch und dem Rangtest, 0,319500 gegen 0,422500, weit größer als alles, was die Niveaus trennt. Und der Anteil der Welch-Wahlen durch die zweistufige Regel, 0,953500 bei normalen gegen 0,058000 bei schiefen Daten, zeigt, dass diese Regel kein drittes Verfahren ist, sondern eine Weiche.
12 · PROTOKOLL
Robustheit und Alternativen
Vor dem Ergebnis erklärte Alternativen: die Simulation mit ungleichen Varianzen und ungleichen Gruppengrößen wiederholen, jener Konstellation, für die die Literatur die größten Verzerrungen meldet; Jarque-Bera durch Shapiro-Wilk ersetzen, den verbreitetsten Normalitätstest; die Zahl der Wiederholungen erhöhen, um die Raten zu verengen; oder die beiden Tests durch einen Quantilvergleich ersetzen, der eine andere Frage beantwortet als Mittelwert oder Rang. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt umkehrt.
13 · PROTOKOLL
Interpretation des Ergebnisses
Das Ergebnis ist nicht die erwartete Verurteilung. In den hier erklärten Konstellationen hält die zweistufige Regel ihr Niveau, und die neben diesem Dossier versiegelte begutachtete Studie fand dasselbe, erinnerte aber daran, dass das Verfahren formal unzulässig bleibt. Beide Aussagen gelten zugleich: Die Testwahl an den Daten auszurichten bricht die Logik des Tests, und in genau diesen Konstellationen zeigt sich der Schaden nicht im Gesamtniveau. Was sich zeigt, ist die verlorene Trennschärfe, wenn ein Mittelwerttest auf schiefe Daten angewandt wird.
14 · PROTOKOLL
Zulässige Schlussfolgerungen
Zulässig: den Test aus der Frage, dem Stichprobendesign und der Ergebnisskala zu wählen, bevor man die Daten sieht; die Effektgröße und ihr Intervall neben dem p-Wert zu veröffentlichen; zu sagen, dass die drei Verfahren in dieser Datei übereinstimmen; einen Rangtest zu verwenden, wenn die Verteilung sichtbar schief ist und die Frage eine allgemeine Verschiebung statt eines Mittelwerts betrifft; und diese Art Simulation zu wiederholen, bevor eine automatische Regel eingeführt wird.
15 · PROTOKOLL
Unzulässige Schlussfolgerungen
Unzulässig: aus diesem Dossier zu schließen, die zweistufige Regel sei korrekt, obwohl sie formal fehlerhaft bleibt und nur in den erklärten Konstellationen geprüft wurde; diese Raten auf ungleiche Varianzen oder ungleiche Gruppengrößen zu übertragen, die nicht untersucht wurden; den Test zu wählen, nachdem man gesehen hat, welches Verfahren den kleinsten p-Wert liefert; einen p-Wert allein als Ergebnis darzustellen; oder eine ausbleibende Verwerfung als Beleg für fehlende Wirkung zu lesen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.
16 · PROTOKOLL
Mögliche Marketingentscheidung
Die vernünftige Entscheidung ist, die Testwahl vor der Erhebung ins Protokoll zu schreiben — aus der gestellten Frage und dem Stichprobendesign — und dabei zu bleiben. Ist die erwartete Verteilung schief, führt das hier zum Rangtest, der ein Drittel mehr Effekte entdeckt. Besteht das Team auf einer Mittelwertdifferenz, weil der Mittelwert den wirtschaftlichen Wert trägt, bleibt es bei Welch und nimmt die geringere Trennschärfe bewusst hin. Was keine automatische Regel an seiner Stelle tut, ist zu entscheiden, welche der beiden Fragen es stellt.
17 · PROTOKOLL
Wann die Methode geeignet oder ungeeignet ist
Diesen Ansatz nutzen, bevor ein Analyseverfahren in einem Protokoll oder Werkzeug festgeschrieben wird. Ihn nicht als Mittel verwenden, einen Test nachträglich zu wählen — genau das verbietet er. Ebenfalls meiden, wenn die Einheiten nicht unabhängig sind — Messwiederholungen, Cluster, Panels —, da keines der drei geprüften Verfahren das berücksichtigt. Und meiden, wenn die Frage einen Kausaleffekt betrifft: Die Testwahl ersetzt kein Design, das diesen Effekt identifiziert.
18 · PROTOKOLL
Implementierungen und Endergebnis
Die CC0-CSV enthält die 60 synthetischen Einheiten der Arbeitsdatei. Python und R sind die Referenzimplementierungen; der SPSS-Block ist keine Neuschreibung, sondern wird aus der Berechnung der Referenz erzeugt, sodass beide nicht auseinanderlaufen können; SAS reproduziert die erklärte Rekursion und implementiert den Rangtest in einem Datenschritt, bezieht seine Verteilungsränder aber aus eigenen Funktionen. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die drei erklärten Verfahren, das nominale Niveau, die drei Szenarien, die Rekursion und ihre in Doppelarithmetik exakte Form, die Toleranz, die sieben nummerierten Schritte, die Ergebnisse der Arbeitsdatei, die Verwerfungsraten je Szenario, den Anteil jeder Testwahl, die sechs Kennzeichen, das Verdikt und die Softwareversionen.
Synthetische Daten · CC0
msc-p039-two-group-outcome.csv ↓Reproduzierbarkeitsprotokoll
msc-p039-reproducibility-readme.md ↓Python-Referenz · MIT
msc-p039-reference.py ↓R-Referenz · MIT
msc-p039-reference.R ↓SPSS-Implementierung · MIT
msc-p039-secondary.sps ↓SAS-Implementierung · MIT
msc-p039-secondary.sas ↓19 · PROTOKOLL
Quellen und Evidenzniveau
Rochon, Gondan und Kieser beschreiben genau die hier geprüfte Regel — das Ergebnis des Vortests bestimmt die danach verwendete Methode —, stellen fest, dass dieser Vortest den bedingten Fehler ernsthaft verändert, schließen, dass das zweistufige Verfahren aus formaler Sicht als unzulässig gelten kann, und beobachten gleichwohl, dass es das nominale Niveau zufriedenstellend zu halten schien. Greenland und Mitautoren erinnern daran, dass jede Inferenzmethode auf einem komplexen Geflecht von Annahmen ruht und dass ein sehr kleiner p-Wert nicht sagt, welche davon falsch ist. Lakens erinnert daran, dass die Effektgröße das wichtigste Ergebnis einer empirischen Studie ist. Rousselet, Pernet und Wilcox erinnern daran, dass eine Verteilung über ihren Mittelwert zusammenzufassen eine Entscheidung ist, keine Selbstverständlichkeit. Grundlegende Referenzen: Rochon, Gondan und Kieser (2012, BMC Medical Research Methodology, CC-BY-Open-Access, begutachtet) und Greenland et al. (2016, European Journal of Epidemiology, Open Access, begutachtet). Neuere Entwicklungen: Lakens (2013, Frontiers in Psychology, CC-BY-Open-Access, begutachtet) und Rousselet, Pernet und Wilcox (2017, akzeptiertes Manuskript im Repositorium der Universität Edinburgh; erschienen im European Journal of Neuroscience, begutachtet).
- Rochon, Gondan & Kieser (2012) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Greenland et al. (2016) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Lakens (2013) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Rousselet, Pernet & Wilcox (2017) Volltext geprüft, mit kurzem im Original verorteten Auszug.
Methodische Verbindungen

