Research & Evidence

Methode suchen

Titel, Fragen, Gebiete und MSC-Kennungen durchsuchen.

41 Ergebnisse
  1. MSC-P-001Wie wird aus einer Marketingbehauptung eine testbare Frage?Entscheidungswissenschaft↗
  2. MSC-P-002Korrelation oder Kausalität: Welche Aussage trägt eine Analyse wirklich?Marketingmessung↗
  3. MSC-P-003Wie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?Entscheidungswissenschaft↗
  4. MSC-P-004Signifikanz oder Effektgröße: Welches Ergebnis ist zu interpretieren?Entscheidungswissenschaft↗
  5. MSC-P-005Wie misst man ein nicht direkt beobachtbares Marketingkonstrukt?Marktforschung↗
  6. MSC-P-006Wie wird eine Messskala entwickelt und validiert?Marktforschung↗
  7. MSC-P-007Alpha oder Omega: Wie wird die Reliabilität einer Skala beurteilt?Marktforschung↗
  8. MSC-P-009PCA, EFA oder CFA: Welche Methode passt?Marktforschung↗
  9. MSC-P-010Wann sollte ein Marketingexperiment durchgeführt werden?Marketingmessung↗
  10. MSC-P-011Wie plant man einen A/B-Test, der tatsächlich einen Effekt schätzt?Marketingmessung↗
  11. MSC-P-012Wie viele Beobachtungen braucht ein Experiment?Entscheidungswissenschaft↗
  12. MSC-P-013Wie misst man den inkrementellen Kampagneneffekt mit einer Kontrollgruppe?Marketingmessung↗
  13. MSC-P-017Wie erkennt man Selektion, Kontamination und Ausfall in einem Experiment?Marketingmessung↗
  14. MSC-P-018Prädiktive oder kausale Regression: Was soll geschätzt werden?Marketingmodelle↗
  15. MSC-P-019Wie diagnostiziert man eine Marketingregression vor der Interpretation?Marketingmodelle↗
  16. MSC-P-022Wie schätzt man Preiselastizität und ihre Unsicherheit?Preisforschung↗
  17. MSC-P-026Logit vs Probit: Wie wählt man für eine Kaufwahrscheinlichkeit?Kundenforschung↗
  18. MSC-P-029Welche Kunden haben die höchste Abwanderungswahrscheinlichkeit?Kundenforschung↗
  19. MSC-P-027TAM, UTAUT oder UTAUT2: Welcher Rahmen eignet sich zur Untersuchung der Technologieakzeptanz?Marktforschung↗
  20. MSC-H-001Messung und Kausalität: Wie lässt sich ein Marketingeffekt belegen?Marketingmessung↗
  21. MSC-H-002Marketing-Reaktionsmodelle: Form, Verzögerung und SättigungMarketingmodelle↗
  22. MSC-H-003Preisforschung: Preis, Nachfrage und Deckungsbeitrag verbindenPreisforschung↗
  23. MSC-H-004Kunden- und Wahlforschung: Verhalten, Wert und HeterogenitätKundenforschung↗
  24. MSC-H-005Messwissenschaft: valide Indikatoren entwickelnMarktforschung↗
  25. MSC-H-006Statistische Entscheidungsmethoden: wählen, quantifizieren, validierenEntscheidungswissenschaft↗
  26. MSC-P-008Wie validiert man eine Marketing-Messskala?Marktforschung↗
  27. MSC-P-014Wie plant man ein geografisches Marketingexperiment?Marketingmessung↗
  28. MSC-P-015Wie schätzt man einen Effekt mit Difference-in-Differences?Marketingmessung↗
  29. MSC-P-020Wie behandelt man Preisendogenität?Preisforschung↗
  30. MSC-P-021Feste oder zufällige Effekte: Welches Panelmodell passt?Marketingmodelle↗
  31. MSC-P-023Wie schätzt man eine Nachfragefunktion?Preisforschung↗
  32. MSC-P-024Wie simuliert man ein Preis-Mengen-Margen-Szenario?Preisforschung↗
  33. MSC-P-028Wie schätzt man CLV mit BG/NBD und Gamma-Gamma?Kundenforschung↗
  34. MSC-P-030Wie analysiert man Kundenbindung mit Überlebensmodellen?Kundenforschung↗
  35. MSC-P-043Was ist ein Abonnent wert, wenn erst sechs Monate Bindungsdaten vorliegen?Kundenforschung↗
  36. MSC-P-031Wie erstellt man eine nützliche Kundensegmentierung?Kundenforschung↗
  37. MSC-P-032Wie prüft man die Stabilität einer Segmentierung?Kundenforschung↗
  38. MSC-P-033Wie validiert man eine Marketingprognose?Entscheidungswissenschaft↗
  39. MSC-P-034Wie erstellt man eine Monte-Carlo-Simulation für Marketingentscheidungen?Entscheidungswissenschaft↗
  40. MSC-P-035Wie modelliert man Sättigung und Adstock?Marketingmodelle↗
  41. MSC-P-039Welchen statistischen Test sollte man wählen?Entscheidungswissenschaft↗
← Alle Methoden
METHODEN-DOSSIERMSC-P-033Regression und ÖkonometrieGeprüftes wissenschaftliches Dossier

Wie validiert man eine Marketingprognose?

Eine Prognose wird auf nicht angepassten Perioden mit realistischer Prognosebasis, naivem Benchmark und zu Fehlerkosten passender Metrik validiert.

Wissenschaftliche Redaktion: Marketing Science Center

Direkte Antwort

Modelle für einen deklarierten Horizont und Fehlerkosten vergleichen.

Eine Prognose wird auf nicht angepassten Perioden mit realistischer Prognosebasis, naivem Benchmark und zu Fehlerkosten passender Metrik validiert.

Shmueli, 2010Hyndman & Koehler, 2006

01 · PROTOKOLL

Operative Zusammenfassung

Ein wöchentliches Prognosemodell wird an dreizehn aufeinanderfolgenden Ursprüngen neu geschätzt und dann an 52 Wochen beurteilt, die es nie gesehen hat. Sein skalierter absoluter Fehler beträgt 0,420792 gegenüber 1,039025 für eine saisonal naive Prognose: Es schlägt den Vergleichsmaßstab deutlich. Seine 80-%-Intervalle enthalten das Ergebnis in 0,750000 der Fälle, innerhalb der erklärten Toleranz von 0,10, aber auf der engen Seite. Beide Prüfungen bestehen. Verdikt: FORECAST_READABLE_FOR_PLANNING.

02 · PROTOKOLL

Konkrete Marketingsituation

Ein Team muss Bestände und Mediabudgets vier Wochen im Voraus binden. Es hat ein Modell, das den Wochenumsatz prognostiziert und das auf der Historie bemerkenswert gut passt. Die Frage vor dem Einsatz ist einfach: Wann stand dieses Modell je Wochen gegenüber, die es nicht kannte, und was geschah dann? Ohne diese Antwort sagt die beobachtete Anpassungsgüte nichts über den vorgesehenen Einsatz.

03 · PROTOKOLL

Wissenschaftliche Frage

Ist für diese Wochenreihe, dieses erklärte Modell, diese dreizehn erklärten Ursprünge und diesen Vier-Wochen-Horizont der Modellfehler auf Wochen, die nicht zur Schätzung dienten, kleiner als jener einer auf dieselbe Skala gebrachten saisonal naiven Prognose? Und enthalten seine 80-%-Intervalle das Ergebnis so oft, wie sie behaupten? Beide Fragen sind verschieden und erhalten je eine eigene Antwort: Eine treffende Punktprognose kann mit einer falschen Unsicherheit einhergehen.

04 · PROTOKOLL

Warum der einfache Ansatz scheitern kann

Ein Modell an den Wochen zu beurteilen, die seiner Schätzung dienten, schmeichelt immer: Je mehr Parameter, desto besser sieht das Ergebnis aus, ohne dass Prognosefähigkeit gezeigt wäre. Auch die Historie einmal in Schätz- und Testteil zu zerlegen genügt nicht, denn der Wert hängt dann vom Zufall einer einzigen Grenze ab. Und einen Fehler in Euro ohne Vergleichsmaßstab zu berichten lässt niemanden urteilen: 55 € mittlerer Fehler ist je nach Reihe hervorragend oder katastrophal.

05 · PROTOKOLL

Intuition der Methode

Die Methode bildet den realen Einsatz nach. Man versetzt sich auf ein vergangenes Datum, nutzt nur, was an jenem Tag bekannt war, prognostiziert die folgenden vier Wochen, rückt dann vier Wochen vor und beginnt von vorn. Dreizehn Mal. Jeder Fehler wird danach durch eine Referenzgröße geteilt, die allein auf der zu jenem Datum verfügbaren Vergangenheit berechnet wird: der Fehler, den eine saisonal naive Prognose gemacht hätte. Ein Wert unter eins heißt, das Modell war besser als diese einfache Regel. Parallel zählt man, wie oft das angekündigte Intervall das Ergebnis tatsächlich enthielt.

06 · PROTOKOLL

Erforderliche Daten

Vor jeder Lektüre festgeschrieben: die lückenlose Wochennummerierung, der Wochenumsatz, die Modellform (Konstante, lineare Trendkomponente und zwei Jahresharmonische), die saisonale Periode von 52 Wochen, die dreizehn Ursprünge von 104 bis 152 in Schritten von 4, der Horizont von 4 Wochen, die saisonal naive Prognose als Vergleichsmaßstab, die Skalierungsgröße, das nominale Niveau von 0,80, das Quantil 1,281552 und die beiden Schwellen. Die versiegelte Datei enthält 156 Wochen. Der Fall ist synthetisch und wird so ausgewiesen.

07 · PROTOKOLL

Formales Modell und Symbole

An jedem Ursprung schätzt das Modell per kleinster Quadrate eine Konstante, einen linearen Trend und zwei Jahresharmonische — sechs Parameter — allein auf den Wochen vor dem Ursprung. Der skalierte absolute Fehler teilt jeden Out-of-Sample-Fehler durch den Mittelwert der in derselben Fenstergröße beobachteten absoluten 52-Wochen-Differenzen. Das Intervall hat als halbe Breite 1,281552 mal die Residualstandardabweichung der Schätzung, wobei dieses Quantil das 0,90-Quantil der Standardnormalverteilung ist. Der Intervallwert addiert zur Breite eine Strafe proportional zu jeder Überschreitung, geteilt durch das akzeptierte Risiko.

08 · PROTOKOLL

Deklarierte Berechnung

Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende oder für den Validierungsplan zu kurze Datei ablehnen; an jedem Ursprung die Designmatrix allein auf den früheren Wochen bilden; die Normalgleichungen per Gauß-Elimination mit Teilpivotisierung lösen, ein singuläres Fenster ablehnen und die Residualstandardabweichung mit sechs von den Freiheitsgraden abgezogenen Parametern berechnen; die saisonale Skala auf demselben Fenster berechnen und eine Nullskala ablehnen; für jeden der vier Horizonte den absoluten Fehler, den skalierten Fehler, jenen der naiven Prognose, die Intervallabdeckung, die Breite und den Wert festhalten; über die 52 Prognosen und dann je Horizont mitteln; die beiden erklärten Schwellen und danach die Verdiktregel anwenden.

09 · PROTOKOLL

Durchgängiges Zahlenbeispiel

Synthetische Illustration — Lehrwerte, nicht beobachtet

In der versiegelten Datei: 156 Wochen, 13 Ursprünge von Woche 104 bis Woche 152, Horizont 4, also 52 Out-of-Sample-Prognosen. Skalierter absoluter Modellfehler 0,420792 gegenüber 1,039025 für die saisonal naive Prognose; mittlerer absoluter Fehler 54,912955 Geldeinheiten; Genauigkeitsprüfung bestanden. Je Horizont: 0,418133, 0,520418, 0,279945 und 0,464672. Nominales Niveau 0,80, beobachtete Abdeckung 0,750000, mittlere Breite 168,860643 und mittlerer Intervallwert 243,378776; Kalibrierungsprüfung bestanden. Verdikt: FORECAST_READABLE_FOR_PLANNING.

10 · PROTOKOLL

Validitätsannahmen

Die Validierung setzt voraus, dass der Mechanismus vergangener Wochen auch künftige Wochen erzeugt, dass die saisonale Periode wirklich 52 Wochen beträgt und dass historische Werte nicht nachträglich revidiert wurden. Für die Intervalle setzt sie zudem voraus, dass sich die Residuen wie normales Rauschen konstanter Varianz verhalten. Drei Dinge sind hier nicht prüfbar: das Ausbleiben eines künftigen Regimewechsels, die Wirkung eines Kanals oder Preises, der in der Historie nie variierte, und die Datenqualität in dem Moment, in dem die Prognose tatsächlich erstellt wird.

11 · PROTOKOLL

Diagnostik und Unsicherheit

Zwei Vorbehalte gehören vor das Verdikt gelesen. Die beobachtete Abdeckung beträgt 0,750000 bei einem angekündigten Niveau von 0,80: Die Lücke bleibt in der erklärten Toleranz, doch die Intervalle liegen auf der engen Seite — genau das, was man von Intervallen erwartet, die allein auf der Residualstreuung beruhen und weder Parameterunsicherheit noch deren Wachstum mit dem Horizont berücksichtigen. Und die Fehler je Horizont — 0,418133, 0,520418, 0,279945, 0,464672 — steigen nicht gleichmäßig mit dem Horizont: Bei dreizehn Prognosen je Horizont ist dieses Muster Rauschen, und ihnen ist keine Schwelle zugeordnet.

12 · PROTOKOLL

Robustheit und Alternativen

Vor dem Ergebnis erklärte Alternativen: die Normalintervalle durch Intervalle aus den empirischen Quantilen der Out-of-Sample-Fehler ersetzen, je Horizont eigene; dem Vergleichsmaßstab einen einfachen Random Walk hinzufügen, ohne Saisonalität schwerer zu schlagen; den Horizont auf dreizehn Wochen verlängern, um zu sehen, wo der Modellvorteil verschwindet; oder die Übung mit einem einfacheren Modell ohne zweite Harmonische wiederholen. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt verschlechtert.

13 · PROTOKOLL

Interpretation des Ergebnisses

Das Modell prognostiziert besser als eine einfache Regel, und zwar deutlich: Sein Fehler liegt unter einer halben Einheit, während die saisonal naive Prognose eins übersteigt, also außerhalb der Stichprobe schlechter abschneidet als auf ihrer eigenen Vergangenheit. Doch dieser Vergleich ist nur so viel wert wie der Maßstab: Eine saisonal naive Prognose auf einer Reihe mit sichtbarem Trend zu schlagen ist keine anspruchsvolle Prüfung. Das nutzbare Ergebnis ist deshalb bescheiden und präzise: Auf dieser Reihe und diesem Horizont lieferte das Modell brauchbare Prognosen und nur leicht zu enge Intervalle.

14 · PROTOKOLL

Zulässige Schlussfolgerungen

Zulässig: dieses Modell zur Vier-Wochen-Planung auf dieser Reihe zu nutzen; den skalierten Fehler zusammen mit jenem des Vergleichsmaßstabs zu veröffentlichen, nie den einen ohne den anderen; die 80-%-Intervalle anzukündigen und dabei zu vermerken, dass sie praktisch etwas weniger abdecken; dieselbe Validierung jedes Quartal zu wiederholen, um Drift zu beobachten; und dasselbe Protokoll von jedem Prognoselieferanten zu verlangen. Ebenfalls zulässig: zu sagen, dass dieses Ergebnis für diesen Horizont gilt, und die Prüfung bei geändertem Horizont zu wiederholen.

15 · PROTOKOLL

Unzulässige Schlussfolgerungen

Unzulässig: 0,420792 als garantierte Genauigkeit für kommende Wochen darzustellen; die 80-%-Intervalle anzukündigen, ohne zu erwähnen, dass sie 0,750000 abdeckten; zu schließen, ein validiertes Modell bleibe nach einer Preis-, Kanal- oder Wettbewerbsänderung gültig; diesen skalierten Fehler mit dem einer anderen Reihe zu vergleichen, ohne den Maßstab erneut zu prüfen; oder Ursprungszahl und Horizont nach Sicht der Ergebnisse zu wählen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.

16 · PROTOKOLL

Mögliche Marketingentscheidung

Die vernünftige Entscheidung ist, den Vier-Wochen-Plan auf dieses Modell zu stützen, den Sicherheitsbestand aber an der beobachteten statt an der angekündigten Abdeckung zu bemessen, da sich die Intervalle als etwas eng erwiesen. Die Validierung wird danach jedes Quartal mit demselben, unveränderten Protokoll wiederholt, damit eine Verschlechterung als Verschlechterung sichtbar wird und nicht als Regeländerung. Keiner dieser Schritte automatisiert sich ohne jemanden, der die beiden Kennzeichen liest.

17 · PROTOKOLL

Wann die Methode geeignet oder ungeeignet ist

Dieses Protokoll vor jedem Produktivgang einer Prognose und danach in regelmäßigen Abständen einsetzen. Meiden, wenn die Historie zu kurz für mehrere Ursprünge ist, wenn vergangene Werte nach Veröffentlichung revidiert wurden, oder wenn die Reihe gerade einen sichtbaren Bruch erlitten hat: Im letzten Fall misst die Validierung ein Regime, das nicht mehr besteht. Ebenfalls meiden als Antwort auf die Frage nach der Wirkung einer Maßnahme, die ein Experiment und keine Prognose verlangt.

18 · PROTOKOLL

Implementierungen und Endergebnis

Die CC0-CSV enthält die 156 synthetischen Wochen. Python und R sind die Referenzimplementierungen; SPSS führt dieselbe Berechnung in einem Python-Block aus; SAS nutzt dasselbe Design und dieselben Ursprünge, überlässt die Schätzung aber der eigenen Regressionsprozedur und prüft die beiden Kennzeichen statt jeder Dezimale. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die erklärte Modellform, die Ursprünge und den Horizont, den Vergleichsmaßstab, die Skalierungsgröße, das nominale Niveau und das Quantil, die beiden Schwellen, die sieben nummerierten Schritte, den skalierten Fehler von Modell und Maßstab, die Fehler je Horizont, die Abdeckung, die Breite, den Intervallwert, beide Kennzeichen, das Verdikt und die Softwareversionen.

19 · PROTOKOLL

Quellen und Evidenzniveau

Hyndman und Koehler schlagen den skalierten absoluten Fehler als Standardvergleichsmaß vor, erinnern daran, dass ein Wert über eins im Mittel schlechtere Prognosen anzeigt, und zeigen, dass viele gängige Maße nicht allgemein anwendbar sind. Hyndman und Khandakar erinnern daran, dass Out-of-Sample-Fehler oft zu wenige sind, um zu schließen, und dass zwei Modelle dieselben Punktprognosen bei verschiedenen Intervallen liefern können. Makridakis, Spiliotis und Assimakopoulos verweisen auf das häufige Fehlen eines Vergleichsmaßstabs und auf die Lücke zwischen Anpassungsgüte und Out-of-Sample-Genauigkeit. Petropoulos und Mitautoren beschreiben den Übergang von einem festen zu einem gleitenden Ursprung, den Intervallwert als angemessenes Maß und den Umstand, dass veröffentlichte Intervalle zu eng sind. Grundlegende Referenzen: Hyndman und Koehler (2006, International Journal of Forecasting, begutachtet) und Hyndman und Khandakar (2008, Journal of Statistical Software, CC-BY-Open-Access, begutachtet). Neuere Entwicklungen: Makridakis, Spiliotis und Assimakopoulos (2018, PLOS ONE, CC-BY-Open-Access, begutachtet) und Petropoulos et al. (2022, arXiv-Preprint; erschienen im International Journal of Forecasting, begutachtet).

  1. Hyndman & Koehler (2006) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  2. Hyndman & Khandakar (2008) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  3. Makridakis, Spiliotis & Assimakopoulos (2018) Volltext geprüft, mit kurzem im Original verorteten Auszug.
  4. Petropoulos et al. (2022) Volltext geprüft, mit kurzem im Original verorteten Auszug.

Methodische Verbindungen

Übergeordnetes GebietStatistische Entscheidungsmethoden: wählen, quantifizieren, validierenErfordertWie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?Vergleichen mitFeste oder zufällige Effekte: Welches Panelmodell passt?

Als Nächstes

MSC-H-002Marketing-Reaktionsmodelle: Form, Verzögerung und Sättigung→MSC-H-006Statistische Entscheidungsmethoden: wählen, quantifizieren, validieren→MSC-P-003Wie lässt sich die Unsicherheit eines Marketingergebnisses ausdrücken?→MSC-P-021Feste oder zufällige Effekte: Welches Panelmodell passt?→