Wie viele Beobachtungen braucht ein Experiment?
Die Stichprobengröße hängt von Basisrate oder Varianz, MDE, Alpha, Power, Zuteilung, Ausfall und Clustering ab. Sie wird vor dem Test berechnet und aufgerundet.
Wissenschaftliche Redaktion : Marketing Science Center
Direkte Antwort
Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
Die Stichprobengröße hängt von Basisrate oder Varianz, MDE, Alpha, Power, Zuteilung, Ausfall und Clustering ab. Sie wird vor dem Test berechnet und aufgerundet.
01
Operative Zusammenfassung
Wissenschaftliche Frage und Geltungsbereich
Wie viele Beobachtungen braucht ein Experiment?
Vertretbar
Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
Unzulässig
Beobachtete Post-hoc-Power als Evidenz verwenden.
02
Drei Leseebenen
- 01
Entscheidungsebene — Ergebnis mit deklarierter Entscheidung, Nutzenschwelle und Fehlerkosten verbinden.
- 02
Praxis — Population, Einheit, Horizont, verfügbare Variablen und Analyseregel vor der Berechnung festlegen.
- 03
Analyse — Berechnung reproduzieren, Unsicherheit quantifizieren und Diagnosen, Fehlschläge sowie Sensitivitäten dokumentieren.
03
Konkrete Marketingsituation
Die Stichprobengröße hängt von Basisrate oder Varianz, MDE, Alpha, Power, Zuteilung, Ausfall und Clustering ab. Sie wird vor dem Test berechnet und aufgerundet.
04
Wissenschaftliche Frage und Geltungsbereich
Wie viele Beobachtungen braucht ein Experiment?
n je Arm für ein binäres Ergebnis, MDE, α und 1−β; gleiche Zuteilung, Normalapproximation
Benötigte Daten
Randomisierungseinheit je Arm
Population, Analyseeinheit, Ursprungsdatum und Horizont müssen im Ergebnis deklariert sein. Andernfalls ändert sich der Estimand unbemerkt.
05
Warum eine einfache Analyse scheitern kann
- Beobachtete Post-hoc-Power als Evidenz verwenden.
- Zweiseitige Approximation für binäre Ergebnisse
- Gleiche Zuteilung
- Aufrunden und für Ausfall sowie Clusterung anpassen
06
Intuition der Methode
Die Methode macht aus einer Assoziation nicht automatisch Evidenz. Sie verbindet eine deklarierte Frage mit Estimand, Spezifikation, kompatiblen Daten und begrenzter Interpretationsregel.
n je Arm für ein binäres Ergebnis, MDE, α und 1−β; gleiche Zuteilung, Normalapproximation
07
Benötigte Daten
Wörterbuch wissenschaftlicher Symbole
p0- Ausgangswahrscheinlichkeit des Ereignisses im Vergleichsarm. Einheit:
Wahrscheinlichkeit· Typ:Zahl in (0, 1)· Rolle:Eingabe p1- Zielwahrscheinlichkeit des Ereignisses, die den kleinsten Effekt darstellt, für dessen Entdeckung das Design ausgelegt ist. Einheit:
Wahrscheinlichkeit· Typ:Zahl in (0, 1)· Rolle:Eingabe p_bar- Planungsmittelwert (p0 + p1) / 2 für die Normalapproximation bei gleicher Zuteilung. Einheit:
Wahrscheinlichkeit· Typ:Zahl· Rolle:abgeleitet alpha- Vorab festgelegte zweiseitige Wahrscheinlichkeit eines Fehlers erster Art. Einheit:
Wahrscheinlichkeit· Typ:Zahl in (0, 1)· Rolle:Eingabe power- Vorab festgelegte Wahrscheinlichkeit, beim Zielunterschied unter dem Planungsmodell die Nullhypothese abzulehnen. Einheit:
Wahrscheinlichkeit· Typ:Zahl in (0, 1)· Rolle:Eingabe z_alpha- Standardnormalquantil 1 − alpha/2, aus alpha berechnet. Einheit:
dimensionslos· Typ:positive Zahl· Rolle:abgeleitet z_power- Standardnormalquantil bei der deklarierten Power, aus der Power berechnet. Einheit:
dimensionslos· Typ:Zahl· Rolle:abgeleitet n_raw- Nicht gerundete Stichprobengröße je Arm nach Normalapproximation vor Designanpassungen. Einheit:
Randomisierungseinheit je Arm· Typ:positive Zahl· Rolle:abgeleitet n_planned- Operative Stichprobengröße je Arm nach Aufrundung und separat deklarierter Anpassung für Ausfall oder Clusterung. Einheit:
Randomisierungseinheit je Arm· Typ:positive Ganzzahl· Rolle:Ausgabe
Exakte versiegelte Engine-Eingaben
baseline_rate- Wert:
0.10· Einheit:Wahrscheinlichkeit· Typ:Zahl· Datenstatus:synthetisch target_rate- Wert:
0.12· Einheit:Wahrscheinlichkeit· Typ:Zahl· Datenstatus:synthetisch alpha_two_sided- Wert:
0.05· Einheit:Wahrscheinlichkeit· Typ:Zahl· Datenstatus:deklarierter Parameter power- Wert:
0.80· Einheit:Wahrscheinlichkeit· Typ:Zahl· Datenstatus:deklarierter Parameter attrition_rate- Wert:
0· Einheit:Wahrscheinlichkeit· Typ:Zahl· Datenstatus:deklarierter Parameter design_effect- Wert:
1· Einheit:dimensionslos· Typ:Zahl· Datenstatus:deklarierter Parameter
08
Formales Modell
Formales Modell
p_bar = (baseline_rate + target_rate)/2; z_alpha = Φ⁻¹(1−alpha_two_sided/2); z_power = Φ⁻¹(power); n_raw = [z_alpha×sqrt(2p_bar(1−p_bar)) + z_power×sqrt(baseline_rate(1−baseline_rate)+target_rate(1−target_rate))]^2/(target_rate−baseline_rate)^2; n_planned = ceil(n_raw×design_effect/(1−attrition_rate))Belegte Aussagen: MSC-P012-C01 · MSC-P012-C02 · MSC-P012-C03 · MSC-P012-C04 · MSC-P012-C05
Wissenschaftliche Frage und Geltungsbereich
n je Arm für ein binäres Ergebnis, MDE, α und 1−β; gleiche Zuteilung, Normalapproximation
09
Deklarierte Berechnung
- 01
Binäre Ergebnisraten, zweiseitiges alpha, Power, gleiche Zuteilung und einen von null verschiedenen Zielunterschied prüfen.
- 02
Beide Normalquantile aus alpha und Power berechnen und anschließend die Planungsformel für zwei Anteile auswerten.
- 03
Aufrunden und den Geltungsbereich der Approximation berichten; Ausfall- oder Designeffekte nur bei expliziter Angabe anwenden.
10
Zahlenbeispiel oder Anwendungsfall
Berechnetes Beispiel — synthetische Daten oder deklarierte Parameter; keine realen Beobachtungen
Versiegelte Eingaben
baseline_rate=0.10 [Wahrscheinlichkeit]target_rate=0.12 [Wahrscheinlichkeit]alpha_two_sided=0.05 [Wahrscheinlichkeit]power=0.80 [Wahrscheinlichkeit]attrition_rate=0 [Wahrscheinlichkeit]design_effect=1 [dimensionslos]
Reproduzierbare Ergebnisse
computed_z_alpha=1.959964computed_z_power=0.841621raw_n_per_arm=3840.847482planned_n_per_arm=3841
Geprüftes Dossier: Aussagen sind mit Quellen auf Passagebene verknüpft, die Python/R-Berechnung ist reproduziert, Grenzen sind explizit und die unabhängige wissenschaftliche Prüfung ist abgeschlossen.
11
Validitätsannahmen
- Sind das primäre binäre Ergebnis und sein festes Beobachtungsfenster deklariert?
- Sind p0 und p1 vertretbare Planungswerte und keine nachträglich beobachteten Raten?
- Erfordert die Zuweisungsstruktur Anpassungen für Ausfall, ungleiche Zuteilung oder ein Clusterdesign?
12
Diagnostik und Unsicherheit
Diagnostik und Unsicherheit
Zweiseitige Approximation für binäre Ergebnisse · Gleiche Zuteilung · Aufrunden und für Ausfall sowie Clusterung anpassen
Begrenzte Diagnose
Normalapproximation bei gleicher Zuteilung; die Quantile werden aus alpha und Power berechnet, anschließend wird das Ergebnis aufgerundet.
Expliziter Unsicherheitsvertrag · design_sensitivity
Methode : Deterministische Berechnung der Referenz-Engine auf dem versiegelten Eingabeausschnitt.
Ziel : Sensitivität der erforderlichen Stichprobengröße gegenüber vorab festgelegtem alpha, Power, Ausfall und Designeffekt.
Engine-Nachweis : metric.raw_n_per_arm= · metric.planned_n_per_arm= · metric.z_alpha_two_sided= · metric.z_power=
Interpretation : Das Ergebnis ist eine deterministische Planungsgröße, bedingt auf alle deklarierten Designeingaben, und kein Konfidenzintervall für den künftigen Effekt.
Stoppen, wenn
Beobachtete Post-hoc-Power als Evidenz verwenden.
13
Ergebnisinterpretation
- Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
- Das Ergebnis gilt bedingt auf deklarierte Population, Horizont, Spezifikation und Diagnosen. Es darf nicht ohne neue Begründung auf eine andere Entscheidung übertragen werden.
14
Vertretbare und unzulässige Schlussfolgerung
Vertretbar
Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
Unzulässig
Beobachtete Post-hoc-Power als Evidenz verwenden.
15
Mögliche Marketingentscheidung
- 01
Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
- 02
Das Ergebnis gilt bedingt auf deklarierte Population, Horizont, Spezifikation und Diagnosen. Es darf nicht ohne neue Begründung auf eine andere Entscheidung übertragen werden.
16
Wann einsetzen — wann stoppen
Einsetzen, wenn
Einen Test für einen vorab definierten Mindesteffekt dimensionieren.
Randomisierungseinheit je Arm
Stoppen, wenn
Beobachtete Post-hoc-Power als Evidenz verwenden.
Methodische Alternativen
- Ein exaktes oder simulationsbasiertes Binärdesign verwenden, wenn die Normalapproximation schwach ist.
- Bei geclusterter Zuweisung eine Berechnung für clusterrandomisierte Designs mit Intraklassenkorrelation verwenden.
- Sequenzielle oder gruppensequenzielle Designs nur mit vorab festgelegter Überwachungsregel verwenden.
17
Reproduzierbarkeitsvertrag
Python und R sind die ausführbaren Referenzen. SPSS und SAS bleiben Sekundärsyntax, bis sie mit denselben Daten, derselben Spezifikation und denselben Diagnosen geprüft sind.
Die Engine wählt ausschließlich Slice und expliziten Zweig dieser Seite. Hash, Ausgaben und Diagnosen bleiben im atomaren Dossier versiegelt; ein generischer Fallback-Zweig ist unzulässig.
Slice-Fingerabdruck: e2ce0f592a6aa84d9930f38499580ab88972e6eba77945d2b617d51b9f8a8bc1
Verfügbare Ressource · MSC-T01
A/B-Stichprobengröße
CSV · CC0
msc-validation-inputs-v1.csv ↓Python · MIT
msc-validation-reference-v1.py ↓R · MIT
msc-validation-reference-v1.R ↓SPSS / SAS · MIT · nur zur Inspektion
SPSS ↓SAS ↓Formales Modell
p_bar = (baseline_rate + target_rate)/2; z_alpha = Φ⁻¹(1−alpha_two_sided/2); z_power = Φ⁻¹(power); n_raw = [z_alpha×sqrt(2p_bar(1−p_bar)) + z_power×sqrt(baseline_rate(1−baseline_rate)+target_rate(1−target_rate))]^2/(target_rate−baseline_rate)^2; n_planned = ceil(n_raw×design_effect/(1−attrition_rate))Geprüftes Dossier: Aussagen sind mit Quellen auf Passagebene verknüpft, die Python/R-Berechnung ist reproduziert, Grenzen sind explizit und die unabhängige wissenschaftliche Prüfung ist abgeschlossen.
18
Erwartetes Endergebnis
- 01
Wie viele Beobachtungen braucht ein Experiment? —
Randomisierungseinheit je Arm - 02
p0 · p1 · p_bar · alpha · power · z_alpha · z_power · n_raw · n_planned
- 03
p_bar = (baseline_rate + target_rate)/2; z_alpha = Φ⁻¹(1−alpha_two_sided/2); z_power = Φ⁻¹(power); n_raw = [z_alpha×sqrt(2p_bar(1−p_bar)) + z_power×sqrt(baseline_rate(1−baseline_rate)+target_rate(1−target_rate))]^2/(target_rate−baseline_rate)^2; n_planned = ceil(n_raw×design_effect/(1−attrition_rate)) - 04
Zweiseitige Approximation für binäre Ergebnisse · Gleiche Zuteilung · Aufrunden und für Ausfall sowie Clusterung anpassen
- 05
Einen Test für einen vorab definierten Mindesteffekt dimensionieren. / Beobachtete Post-hoc-Power als Evidenz verwenden.
19
Wissenschaftliche Quellen und Evidenzstatus
Geprüftes Dossier: Aussagen sind mit Quellen auf Passagebene verknüpft, die Python/R-Berechnung ist reproduziert, Grenzen sind explizit und die unabhängige wissenschaftliche Prüfung ist abgeschlossen.
MSC-P012-C01— Die Powerplanung betrifft den Unterschied zwischen zwei unabhängigen Anteilen.MSC-P012-C02— Die Planung hängt gemeinsam von Effektgröße, Signifikanzkriterium und Power ab.MSC-P012-C03— Die Bestimmung der Stichprobengröße muss das primäre Ergebnis und alle verwendeten Größen benennen.MSC-P012-C04— Anpassungen für Ausfall und Nichteinhaltung müssen berichtet werden.MSC-P012-C05— Effektgrößen unterstützen die prospektive Studienplanung.
Datensatz · Werkzeug
Methodische Verbindungen

