Wie validiert man eine Marketingprognose?
Eine Prognose wird auf nicht angepassten Perioden mit realistischer Prognosebasis, naivem Benchmark und zu Fehlerkosten passender Metrik validiert.
Wissenschaftliche Redaktion: Marketing Science Center
Direkte Antwort
Modelle für einen deklarierten Horizont und Fehlerkosten vergleichen.
Eine Prognose wird auf nicht angepassten Perioden mit realistischer Prognosebasis, naivem Benchmark und zu Fehlerkosten passender Metrik validiert.
01 · PROTOKOLL
Operative Zusammenfassung
Ein wöchentliches Prognosemodell wird an dreizehn aufeinanderfolgenden Ursprüngen neu geschätzt und dann an 52 Wochen beurteilt, die es nie gesehen hat. Sein skalierter absoluter Fehler beträgt 0,420792 gegenüber 1,039025 für eine saisonal naive Prognose: Es schlägt den Vergleichsmaßstab deutlich. Seine 80-%-Intervalle enthalten das Ergebnis in 0,750000 der Fälle, innerhalb der erklärten Toleranz von 0,10, aber auf der engen Seite. Beide Prüfungen bestehen. Verdikt: FORECAST_READABLE_FOR_PLANNING.
02 · PROTOKOLL
Konkrete Marketingsituation
Ein Team muss Bestände und Mediabudgets vier Wochen im Voraus binden. Es hat ein Modell, das den Wochenumsatz prognostiziert und das auf der Historie bemerkenswert gut passt. Die Frage vor dem Einsatz ist einfach: Wann stand dieses Modell je Wochen gegenüber, die es nicht kannte, und was geschah dann? Ohne diese Antwort sagt die beobachtete Anpassungsgüte nichts über den vorgesehenen Einsatz.
03 · PROTOKOLL
Wissenschaftliche Frage
Ist für diese Wochenreihe, dieses erklärte Modell, diese dreizehn erklärten Ursprünge und diesen Vier-Wochen-Horizont der Modellfehler auf Wochen, die nicht zur Schätzung dienten, kleiner als jener einer auf dieselbe Skala gebrachten saisonal naiven Prognose? Und enthalten seine 80-%-Intervalle das Ergebnis so oft, wie sie behaupten? Beide Fragen sind verschieden und erhalten je eine eigene Antwort: Eine treffende Punktprognose kann mit einer falschen Unsicherheit einhergehen.
04 · PROTOKOLL
Warum der einfache Ansatz scheitern kann
Ein Modell an den Wochen zu beurteilen, die seiner Schätzung dienten, schmeichelt immer: Je mehr Parameter, desto besser sieht das Ergebnis aus, ohne dass Prognosefähigkeit gezeigt wäre. Auch die Historie einmal in Schätz- und Testteil zu zerlegen genügt nicht, denn der Wert hängt dann vom Zufall einer einzigen Grenze ab. Und einen Fehler in Euro ohne Vergleichsmaßstab zu berichten lässt niemanden urteilen: 55 € mittlerer Fehler ist je nach Reihe hervorragend oder katastrophal.
05 · PROTOKOLL
Intuition der Methode
Die Methode bildet den realen Einsatz nach. Man versetzt sich auf ein vergangenes Datum, nutzt nur, was an jenem Tag bekannt war, prognostiziert die folgenden vier Wochen, rückt dann vier Wochen vor und beginnt von vorn. Dreizehn Mal. Jeder Fehler wird danach durch eine Referenzgröße geteilt, die allein auf der zu jenem Datum verfügbaren Vergangenheit berechnet wird: der Fehler, den eine saisonal naive Prognose gemacht hätte. Ein Wert unter eins heißt, das Modell war besser als diese einfache Regel. Parallel zählt man, wie oft das angekündigte Intervall das Ergebnis tatsächlich enthielt.
06 · PROTOKOLL
Erforderliche Daten
Vor jeder Lektüre festgeschrieben: die lückenlose Wochennummerierung, der Wochenumsatz, die Modellform (Konstante, lineare Trendkomponente und zwei Jahresharmonische), die saisonale Periode von 52 Wochen, die dreizehn Ursprünge von 104 bis 152 in Schritten von 4, der Horizont von 4 Wochen, die saisonal naive Prognose als Vergleichsmaßstab, die Skalierungsgröße, das nominale Niveau von 0,80, das Quantil 1,281552 und die beiden Schwellen. Die versiegelte Datei enthält 156 Wochen. Der Fall ist synthetisch und wird so ausgewiesen.
07 · PROTOKOLL
Formales Modell und Symbole
An jedem Ursprung schätzt das Modell per kleinster Quadrate eine Konstante, einen linearen Trend und zwei Jahresharmonische — sechs Parameter — allein auf den Wochen vor dem Ursprung. Der skalierte absolute Fehler teilt jeden Out-of-Sample-Fehler durch den Mittelwert der in derselben Fenstergröße beobachteten absoluten 52-Wochen-Differenzen. Das Intervall hat als halbe Breite 1,281552 mal die Residualstandardabweichung der Schätzung, wobei dieses Quantil das 0,90-Quantil der Standardnormalverteilung ist. Der Intervallwert addiert zur Breite eine Strafe proportional zu jeder Überschreitung, geteilt durch das akzeptierte Risiko.
08 · PROTOKOLL
Deklarierte Berechnung
Die deklarierte Berechnung umfasst sieben Schritte: das Schema prüfen und jede abweichende oder für den Validierungsplan zu kurze Datei ablehnen; an jedem Ursprung die Designmatrix allein auf den früheren Wochen bilden; die Normalgleichungen per Gauß-Elimination mit Teilpivotisierung lösen, ein singuläres Fenster ablehnen und die Residualstandardabweichung mit sechs von den Freiheitsgraden abgezogenen Parametern berechnen; die saisonale Skala auf demselben Fenster berechnen und eine Nullskala ablehnen; für jeden der vier Horizonte den absoluten Fehler, den skalierten Fehler, jenen der naiven Prognose, die Intervallabdeckung, die Breite und den Wert festhalten; über die 52 Prognosen und dann je Horizont mitteln; die beiden erklärten Schwellen und danach die Verdiktregel anwenden.
09 · PROTOKOLL
Durchgängiges Zahlenbeispiel
Synthetische Illustration — Lehrwerte, nicht beobachtet
In der versiegelten Datei: 156 Wochen, 13 Ursprünge von Woche 104 bis Woche 152, Horizont 4, also 52 Out-of-Sample-Prognosen. Skalierter absoluter Modellfehler 0,420792 gegenüber 1,039025 für die saisonal naive Prognose; mittlerer absoluter Fehler 54,912955 Geldeinheiten; Genauigkeitsprüfung bestanden. Je Horizont: 0,418133, 0,520418, 0,279945 und 0,464672. Nominales Niveau 0,80, beobachtete Abdeckung 0,750000, mittlere Breite 168,860643 und mittlerer Intervallwert 243,378776; Kalibrierungsprüfung bestanden. Verdikt: FORECAST_READABLE_FOR_PLANNING.
10 · PROTOKOLL
Validitätsannahmen
Die Validierung setzt voraus, dass der Mechanismus vergangener Wochen auch künftige Wochen erzeugt, dass die saisonale Periode wirklich 52 Wochen beträgt und dass historische Werte nicht nachträglich revidiert wurden. Für die Intervalle setzt sie zudem voraus, dass sich die Residuen wie normales Rauschen konstanter Varianz verhalten. Drei Dinge sind hier nicht prüfbar: das Ausbleiben eines künftigen Regimewechsels, die Wirkung eines Kanals oder Preises, der in der Historie nie variierte, und die Datenqualität in dem Moment, in dem die Prognose tatsächlich erstellt wird.
11 · PROTOKOLL
Diagnostik und Unsicherheit
Zwei Vorbehalte gehören vor das Verdikt gelesen. Die beobachtete Abdeckung beträgt 0,750000 bei einem angekündigten Niveau von 0,80: Die Lücke bleibt in der erklärten Toleranz, doch die Intervalle liegen auf der engen Seite — genau das, was man von Intervallen erwartet, die allein auf der Residualstreuung beruhen und weder Parameterunsicherheit noch deren Wachstum mit dem Horizont berücksichtigen. Und die Fehler je Horizont — 0,418133, 0,520418, 0,279945, 0,464672 — steigen nicht gleichmäßig mit dem Horizont: Bei dreizehn Prognosen je Horizont ist dieses Muster Rauschen, und ihnen ist keine Schwelle zugeordnet.
12 · PROTOKOLL
Robustheit und Alternativen
Vor dem Ergebnis erklärte Alternativen: die Normalintervalle durch Intervalle aus den empirischen Quantilen der Out-of-Sample-Fehler ersetzen, je Horizont eigene; dem Vergleichsmaßstab einen einfachen Random Walk hinzufügen, ohne Saisonalität schwerer zu schlagen; den Horizont auf dreizehn Wochen verlängern, um zu sehen, wo der Modellvorteil verschwindet; oder die Übung mit einem einfacheren Modell ohne zweite Harmonische wiederholen. Jede Variante ist vor der Lektüre anzukündigen und auch dann zu berichten, wenn sie das Verdikt verschlechtert.
13 · PROTOKOLL
Interpretation des Ergebnisses
Das Modell prognostiziert besser als eine einfache Regel, und zwar deutlich: Sein Fehler liegt unter einer halben Einheit, während die saisonal naive Prognose eins übersteigt, also außerhalb der Stichprobe schlechter abschneidet als auf ihrer eigenen Vergangenheit. Doch dieser Vergleich ist nur so viel wert wie der Maßstab: Eine saisonal naive Prognose auf einer Reihe mit sichtbarem Trend zu schlagen ist keine anspruchsvolle Prüfung. Das nutzbare Ergebnis ist deshalb bescheiden und präzise: Auf dieser Reihe und diesem Horizont lieferte das Modell brauchbare Prognosen und nur leicht zu enge Intervalle.
14 · PROTOKOLL
Zulässige Schlussfolgerungen
Zulässig: dieses Modell zur Vier-Wochen-Planung auf dieser Reihe zu nutzen; den skalierten Fehler zusammen mit jenem des Vergleichsmaßstabs zu veröffentlichen, nie den einen ohne den anderen; die 80-%-Intervalle anzukündigen und dabei zu vermerken, dass sie praktisch etwas weniger abdecken; dieselbe Validierung jedes Quartal zu wiederholen, um Drift zu beobachten; und dasselbe Protokoll von jedem Prognoselieferanten zu verlangen. Ebenfalls zulässig: zu sagen, dass dieses Ergebnis für diesen Horizont gilt, und die Prüfung bei geändertem Horizont zu wiederholen.
15 · PROTOKOLL
Unzulässige Schlussfolgerungen
Unzulässig: 0,420792 als garantierte Genauigkeit für kommende Wochen darzustellen; die 80-%-Intervalle anzukündigen, ohne zu erwähnen, dass sie 0,750000 abdeckten; zu schließen, ein validiertes Modell bleibe nach einer Preis-, Kanal- oder Wettbewerbsänderung gültig; diesen skalierten Fehler mit dem einer anderen Reihe zu vergleichen, ohne den Maßstab erneut zu prüfen; oder Ursprungszahl und Horizont nach Sicht der Ergebnisse zu wählen. Ebenfalls unzulässig: diesen synthetischen Fall als beobachtete Messung auszugeben.
16 · PROTOKOLL
Mögliche Marketingentscheidung
Die vernünftige Entscheidung ist, den Vier-Wochen-Plan auf dieses Modell zu stützen, den Sicherheitsbestand aber an der beobachteten statt an der angekündigten Abdeckung zu bemessen, da sich die Intervalle als etwas eng erwiesen. Die Validierung wird danach jedes Quartal mit demselben, unveränderten Protokoll wiederholt, damit eine Verschlechterung als Verschlechterung sichtbar wird und nicht als Regeländerung. Keiner dieser Schritte automatisiert sich ohne jemanden, der die beiden Kennzeichen liest.
17 · PROTOKOLL
Wann die Methode geeignet oder ungeeignet ist
Dieses Protokoll vor jedem Produktivgang einer Prognose und danach in regelmäßigen Abständen einsetzen. Meiden, wenn die Historie zu kurz für mehrere Ursprünge ist, wenn vergangene Werte nach Veröffentlichung revidiert wurden, oder wenn die Reihe gerade einen sichtbaren Bruch erlitten hat: Im letzten Fall misst die Validierung ein Regime, das nicht mehr besteht. Ebenfalls meiden als Antwort auf die Frage nach der Wirkung einer Maßnahme, die ein Experiment und keine Prognose verlangt.
18 · PROTOKOLL
Implementierungen und Endergebnis
Die CC0-CSV enthält die 156 synthetischen Wochen. Python und R sind die Referenzimplementierungen; SPSS führt dieselbe Berechnung in einem Python-Block aus; SAS nutzt dasselbe Design und dieselben Ursprünge, überlässt die Schätzung aber der eigenen Regressionsprozedur und prüft die beiden Kennzeichen statt jeder Dezimale. Das Endergebnis vereint die Daten, das Variablenverzeichnis, die erklärte Modellform, die Ursprünge und den Horizont, den Vergleichsmaßstab, die Skalierungsgröße, das nominale Niveau und das Quantil, die beiden Schwellen, die sieben nummerierten Schritte, den skalierten Fehler von Modell und Maßstab, die Fehler je Horizont, die Abdeckung, die Breite, den Intervallwert, beide Kennzeichen, das Verdikt und die Softwareversionen.
Synthetische Daten · CC0
msc-p033-weekly-series.csv ↓Reproduzierbarkeitsprotokoll
msc-p033-reproducibility-readme.md ↓Python-Referenz · MIT
msc-p033-reference.py ↓R-Referenz · MIT
msc-p033-reference.R ↓SPSS-Implementierung · MIT
msc-p033-secondary.sps ↓SAS-Implementierung · MIT
msc-p033-secondary.sas ↓19 · PROTOKOLL
Quellen und Evidenzniveau
Hyndman und Koehler schlagen den skalierten absoluten Fehler als Standardvergleichsmaß vor, erinnern daran, dass ein Wert über eins im Mittel schlechtere Prognosen anzeigt, und zeigen, dass viele gängige Maße nicht allgemein anwendbar sind. Hyndman und Khandakar erinnern daran, dass Out-of-Sample-Fehler oft zu wenige sind, um zu schließen, und dass zwei Modelle dieselben Punktprognosen bei verschiedenen Intervallen liefern können. Makridakis, Spiliotis und Assimakopoulos verweisen auf das häufige Fehlen eines Vergleichsmaßstabs und auf die Lücke zwischen Anpassungsgüte und Out-of-Sample-Genauigkeit. Petropoulos und Mitautoren beschreiben den Übergang von einem festen zu einem gleitenden Ursprung, den Intervallwert als angemessenes Maß und den Umstand, dass veröffentlichte Intervalle zu eng sind. Grundlegende Referenzen: Hyndman und Koehler (2006, International Journal of Forecasting, begutachtet) und Hyndman und Khandakar (2008, Journal of Statistical Software, CC-BY-Open-Access, begutachtet). Neuere Entwicklungen: Makridakis, Spiliotis und Assimakopoulos (2018, PLOS ONE, CC-BY-Open-Access, begutachtet) und Petropoulos et al. (2022, arXiv-Preprint; erschienen im International Journal of Forecasting, begutachtet).
- Hyndman & Koehler (2006) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Hyndman & Khandakar (2008) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Makridakis, Spiliotis & Assimakopoulos (2018) Volltext geprüft, mit kurzem im Original verorteten Auszug.
- Petropoulos et al. (2022) Volltext geprüft, mit kurzem im Original verorteten Auszug.
Methodische Verbindungen

