Research & Evidence

Rechercher une méthode

Recherchez parmi les titres, les questions, les territoires et les identifiants MSC.

41 résultats
  1. MSC-P-001Comment transformer une affirmation marketing en question testable ?Science de la décision↗
  2. MSC-P-002Corrélation ou causalité : que permet réellement d’affirmer une analyse ?Mesure marketing↗
  3. MSC-P-003Comment exprimer l’incertitude d’un résultat marketing ?Science de la décision↗
  4. MSC-P-004Significativité ou taille d’effet : quel résultat faut-il interpréter ?Science de la décision↗
  5. MSC-P-005Comment mesurer un construit marketing qui n’est pas directement observable ?Études de marché↗
  6. MSC-P-006Comment concevoir puis valider une échelle de mesure ?Études de marché↗
  7. MSC-P-007Alpha ou oméga : comment évaluer la fiabilité d’une échelle ?Études de marché↗
  8. MSC-P-009ACP, AFE ou AFC : quelle méthode choisir ?Études de marché↗
  9. MSC-P-010Quand faut-il mener une expérience marketing ?Mesure marketing↗
  10. MSC-P-011Comment concevoir un A/B test qui estime réellement un effet ?Mesure marketing↗
  11. MSC-P-012De combien d’observations une expérience a-t-elle besoin ?Science de la décision↗
  12. MSC-P-013Comment mesurer l’effet incrémental d’une campagne avec un groupe témoin ?Mesure marketing↗
  13. MSC-P-017Comment détecter sélection, contamination et attrition dans une expérience ?Mesure marketing↗
  14. MSC-P-018Régression prédictive ou causale : qu’essaye-t-on d’estimer ?Modèles marketing↗
  15. MSC-P-019Comment diagnostiquer une régression marketing avant de l’interpréter ?Modèles marketing↗
  16. MSC-P-022Comment estimer une élasticité-prix et son incertitude ?Science des prix↗
  17. MSC-P-026Logit vs Probit : comment choisir pour une probabilité d’achat ?Science client↗
  18. MSC-P-029Quels clients présentent la probabilité de churn la plus élevée ?Science client↗
  19. MSC-P-027TAM, UTAUT ou UTAUT2 : quel cadre pour étudier l’acceptation d’une technologie ?Études de marché↗
  20. MSC-H-001Mesure et causalité : comment établir un effet marketing ?Mesure marketing↗
  21. MSC-H-002Modèles de réponse marketing : forme, délai et saturationModèles marketing↗
  22. MSC-H-003Science des prix : relier prix, demande et contributionScience des prix↗
  23. MSC-H-004Science client et choix : comportement, valeur et hétérogénéitéScience client↗
  24. MSC-H-005Science de la mesure : construire des indicateurs validesÉtudes de marché↗
  25. MSC-H-006Méthodes statistiques de décision : choisir, quantifier, validerScience de la décision↗
  26. MSC-P-008Comment valider une échelle de mesure marketing ?Études de marché↗
  27. MSC-P-014Comment concevoir une expérience géographique marketing ?Mesure marketing↗
  28. MSC-P-015Comment estimer un effet avec une différence-de-différences ?Mesure marketing↗
  29. MSC-P-020Comment traiter l’endogénéité du prix ?Science des prix↗
  30. MSC-P-021Effets fixes ou aléatoires : quel modèle de panel choisir ?Modèles marketing↗
  31. MSC-P-023Comment estimer une fonction de demande ?Science des prix↗
  32. MSC-P-024Comment simuler un scénario prix-volume-marge ?Science des prix↗
  33. MSC-P-028Comment estimer la CLV avec BG/NBD et Gamma-Gamma ?Science client↗
  34. MSC-P-030Comment analyser la rétention avec un modèle de survie ?Science client↗
  35. MSC-P-043Combien vaut un abonné quand on n’a observé que six mois de rétention ?Science client↗
  36. MSC-P-031Comment construire une segmentation client utile ?Science client↗
  37. MSC-P-032Comment tester la stabilité d’une segmentation ?Science client↗
  38. MSC-P-033Comment valider une prévision marketing ?Science de la décision↗
  39. MSC-P-034Comment construire une simulation Monte Carlo pour une décision marketing ?Science de la décision↗
  40. MSC-P-035Comment modéliser saturation et adstock ?Modèles marketing↗
  41. MSC-P-039Quel test statistique choisir ?Science de la décision↗
← Toutes les méthodes
FICHE MÉTHODEMSC-P-033Régression et économétrieDossier scientifique vérifié

Comment valider une prévision marketing ?

Une prévision se valide sur des périodes non utilisées pour l’ajustement, avec une origine temporelle réaliste, un benchmark naïf et une métrique adaptée au coût de l’erreur.

Rédaction scientifique : Marketing Science Center

Réponse directe

Comparer des modèles pour un horizon et un coût d’erreur déclarés.

Une prévision se valide sur des périodes non utilisées pour l’ajustement, avec une origine temporelle réaliste, un benchmark naïf et une métrique adaptée au coût de l’erreur.

Shmueli, 2010Hyndman & Koehler, 2006

01 · PROTOCOLE

Résumé opérationnel

Un modèle de prévision hebdomadaire est réajusté à treize origines successives, puis jugé sur 52 semaines qu’il n’a jamais vues. Son erreur absolue mise à l’échelle vaut 0,420792, contre 1,039025 pour une prévision naïve saisonnière : il bat nettement le point de comparaison. Ses intervalles à 80 % contiennent le résultat dans 0,750000 des cas, à l’intérieur de la tolérance déclarée de 0,10 mais du côté étroit. Les deux contrôles passent. Verdict : FORECAST_READABLE_FOR_PLANNING.

02 · PROTOCOLE

Situation marketing concrète

Une équipe doit engager des stocks et des budgets média quatre semaines à l’avance. Elle dispose d’un modèle qui prévoit le chiffre d’affaires hebdomadaire et qui, sur l’historique, colle remarquablement bien aux données. La question posée avant de s’en servir est simple : quand ce modèle a-t-il déjà été confronté à des semaines qu’il ne connaissait pas, et que s’est-il passé ? Sans cette réponse, la qualité d’ajustement observée ne dit rien de l’usage prévu.

03 · PROTOCOLE

Question scientifique

Pour cette série hebdomadaire, ce modèle déclaré, ces treize origines déclarées et cet horizon de quatre semaines, l’erreur du modèle sur des semaines non utilisées pour l’ajuster est-elle inférieure à celle d’une prévision naïve saisonnière ramenée à la même échelle ? Et ses intervalles à 80 % contiennent-ils le résultat aussi souvent qu’ils le prétendent ? Les deux questions sont distinctes et reçoivent chacune sa réponse : une prévision ponctuelle juste peut s’accompagner d’une incertitude fausse.

04 · PROTOCOLE

Pourquoi l’approche simple peut échouer

Juger un modèle sur les semaines qui ont servi à l’ajuster flatte toujours : plus on ajoute de paramètres, meilleur paraît le résultat, sans qu’aucune capacité de prévision n’ait été démontrée. Découper une seule fois l’historique en apprentissage et test ne suffit pas non plus, car le score obtenu dépend alors du hasard d’une seule frontière. Et rapporter une erreur en euros sans point de comparaison ne permet à personne de juger : 55 € d’erreur moyenne est excellent ou catastrophique selon la série.

05 · PROTOCOLE

Intuition de la méthode

La méthode reproduit l’usage réel. On se replace à une date passée, on n’utilise que ce qui était connu ce jour-là, on prévoit les quatre semaines suivantes, puis on avance de quatre semaines et on recommence. Treize fois. Chaque erreur est ensuite divisée par une quantité de référence calculée sur le seul passé disponible à cette date : l’erreur qu’aurait faite une prévision naïve saisonnière. Une valeur inférieure à un signifie que le modèle a fait mieux que cette règle simple. En parallèle, on compte combien de fois l’intervalle annoncé a effectivement contenu le résultat.

06 · PROTOCOLE

Données nécessaires

Sont figés avant toute lecture : la numérotation des semaines sans trou, le chiffre d’affaires hebdomadaire, la forme du modèle (constante, tendance linéaire et deux harmoniques annuelles), la période saisonnière de 52 semaines, les treize origines de 104 à 152 par pas de 4, l’horizon de 4 semaines, la prévision naïve saisonnière comme point de comparaison, l’échelle de division, le niveau nominal de 0,80, le quantile 1,281552 et les deux seuils. Le fichier scellé contient 156 semaines. Le cas est synthétique et déclaré comme tel.

07 · PROTOCOLE

Modèle formel et symboles

À chaque origine, le modèle ajuste par moindres carrés une constante, une tendance linéaire et deux harmoniques annuelles, soit six paramètres, sur les seules semaines antérieures à l’origine. L’erreur absolue mise à l’échelle divise chaque erreur hors échantillon par la moyenne des écarts absolus à 52 semaines observés dans cette même fenêtre. L’intervalle a pour demi-largeur 1,281552 fois l’écart type résiduel de l’ajustement, ce quantile étant celui de la loi normale centrée réduite à 0,90. Le score d’intervalle ajoute à la largeur une pénalité proportionnelle à tout dépassement, divisée par le risque accepté.

08 · PROTOCOLE

Calcul déclaré

Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ou trop court pour le plan de validation ; à chaque origine, construire la matrice de plan sur les seules semaines antérieures ; résoudre les équations normales par élimination de Gauss avec pivot partiel, refuser une fenêtre singulière et calculer l’écart type résiduel en retranchant les six paramètres des degrés de liberté ; calculer l’échelle saisonnière sur la même fenêtre et refuser une échelle nulle ; pour chacun des quatre horizons, enregistrer l’erreur absolue, l’erreur mise à l’échelle, celle de la prévision naïve, l’appartenance à l’intervalle, la largeur et le score ; moyenner sur les 52 prévisions puis séparément par horizon ; appliquer les deux seuils déclarés, puis la règle de verdict.

09 · PROTOCOLE

Exemple numérique de bout en bout

Illustration synthétique — valeurs pédagogiques, non observées

Sur le fichier scellé : 156 semaines, 13 origines de la semaine 104 à la semaine 152, horizon 4, soit 52 prévisions hors échantillon. Erreur absolue mise à l’échelle du modèle 0,420792, contre 1,039025 pour la prévision naïve saisonnière ; erreur absolue moyenne 54,912955 unités monétaires ; contrôle d’exactitude réussi. Par horizon : 0,418133, 0,520418, 0,279945 et 0,464672. Niveau nominal 0,80, couverture observée 0,750000, largeur moyenne 168,860643 et score d’intervalle moyen 243,378776 ; contrôle de calibration réussi. Verdict : FORECAST_READABLE_FOR_PLANNING.

10 · PROTOCOLE

Hypothèses de validité

La validation suppose que le mécanisme qui a produit les semaines passées est encore celui qui produira les semaines à venir, que la période saisonnière est bien de 52 semaines, et que les valeurs historiques n’ont pas été révisées après coup. Elle suppose aussi, pour les intervalles, que les résidus se comportent comme un bruit normal de variance constante. Trois choses ne sont pas testables ici : l’absence de changement de régime futur, l’effet d’un canal ou d’un prix qui n’a jamais varié dans l’historique, et la qualité des données au moment où la prévision sera réellement produite.

11 · PROTOCOLE

Diagnostics et incertitude

Deux réserves méritent d’être lues avant le verdict. La couverture observée vaut 0,750000 pour un niveau annoncé de 0,80 : l’écart reste dans la tolérance déclarée, mais les intervalles sont du côté étroit, ce qui est exactement ce qu’on attend d’intervalles construits sur la seule dispersion résiduelle, sans tenir compte de l’incertitude sur les paramètres ni de sa croissance avec l’horizon. Et les erreurs par horizon — 0,418133, 0,520418, 0,279945, 0,464672 — n’augmentent pas régulièrement avec l’horizon : avec treize prévisions par horizon, ce profil est du bruit, et aucun seuil ne leur est attaché.

12 · PROTOCOLE

Robustesse et alternatives

Alternatives déclarées avant résultat : remplacer les intervalles normaux par des intervalles construits sur les quantiles empiriques des erreurs hors échantillon, propres à chaque horizon ; ajouter au point de comparaison une marche aléatoire simple, plus dure à battre en l’absence de saisonnalité ; allonger l’horizon jusqu’à treize semaines pour voir où l’avantage du modèle disparaît ; ou refaire l’exercice avec un modèle plus simple, sans harmonique d’ordre deux. Chaque variante doit être annoncée avant lecture et rapportée même si elle dégrade le verdict.

13 · PROTOCOLE

Interprétation du résultat

Le modèle prévoit mieux qu’une règle simple, et de loin : son erreur vaut moins de la moitié de l’unité, alors que la prévision naïve saisonnière dépasse un, c’est-à-dire fait moins bien hors échantillon que sur son propre passé. Mais cette comparaison ne vaut que ce que vaut le point de comparaison : battre une naïve saisonnière sur une série à tendance visible n’est pas une épreuve exigeante. Le résultat exploitable est donc modeste et précis : sur cette série et cet horizon, ce modèle a produit des prévisions utilisables et des intervalles à peine trop étroits.

14 · PROTOCOLE

Conclusions autorisées

Autorisé : utiliser ce modèle pour planifier à quatre semaines sur cette série ; publier l’erreur mise à l’échelle avec celle du point de comparaison, jamais l’une sans l’autre ; annoncer les intervalles à 80 % en signalant qu’ils couvrent en pratique un peu moins ; rejouer cette même validation à chaque trimestre pour surveiller une dérive ; et exiger le même protocole de tout fournisseur de prévision. Autorisé aussi : dire que ce résultat vaut pour cet horizon, et refaire l’examen si l’horizon change.

15 · PROTOCOLE

Conclusions interdites

Interdit : présenter 0,420792 comme une précision garantie pour les semaines à venir ; annoncer les intervalles à 80 % sans mentionner qu’ils ont couvert 0,750000 ; conclure qu’un modèle validé restera valide après un changement de prix, de canal ou de concurrence ; comparer cette erreur mise à l’échelle à celle d’une autre série sans revérifier que le point de comparaison est le même ; ou choisir le nombre d’origines et l’horizon après avoir vu les résultats. Interdit également : présenter ce cas synthétique comme une mesure observée.

16 · PROTOCOLE

Décision marketing possible

La décision raisonnable est d’engager le plan à quatre semaines sur ce modèle, mais de dimensionner le stock de sécurité sur la couverture observée et non sur la couverture annoncée, puisque les intervalles se sont révélés un peu étroits. La validation est ensuite rejouée à chaque trimestre avec le même protocole, sans le modifier, de sorte qu’une dégradation soit visible comme une dégradation et non comme un changement de règle. Aucune de ces étapes ne s’automatise sans quelqu’un pour lire les deux drapeaux.

17 · PROTOCOLE

Quand utiliser ou éviter la méthode

Utiliser ce protocole avant toute mise en production d’une prévision, et à intervalle régulier ensuite. L’éviter quand l’historique est trop court pour dégager plusieurs origines, quand les valeurs passées ont été révisées après publication, ou quand la série vient de subir une rupture visible : dans ce dernier cas, la validation mesure un régime qui n’existe plus. L’éviter aussi comme réponse à la question de l’effet d’une action, qui relève d’une expérience et non d’une prévision.

18 · PROTOCOLE

Implémentations et livrable final

Le CSV CC0 contient les 156 semaines synthétiques. Python et R sont les implémentations de référence ; SPSS reprend le même calcul dans un bloc Python ; SAS emploie le même plan et les mêmes origines mais confie l’ajustement à sa propre procédure de régression, et vérifie les deux drapeaux plutôt que chaque décimale. Le livrable final réunit les données, le dictionnaire des variables, la forme du modèle déclarée, les origines et l’horizon, le point de comparaison, l’échelle de division, le niveau nominal et le quantile, les deux seuils, les sept étapes numérotées, l’erreur mise à l’échelle du modèle et du point de comparaison, les erreurs par horizon, la couverture, la largeur, le score d’intervalle, les deux drapeaux, le verdict et les versions logicielles.

19 · PROTOCOLE

Sources et niveau de preuve

Hyndman et Koehler proposent l’erreur absolue mise à l’échelle comme mesure standard de comparaison, rappellent qu’une valeur supérieure à un signale des prévisions moins bonnes en moyenne, et montrent que beaucoup de mesures courantes ne sont pas applicables en général. Hyndman et Khandakar rappellent que les erreurs hors échantillon sont souvent trop peu nombreuses pour conclure, et que deux modèles peuvent donner les mêmes prévisions ponctuelles avec des intervalles différents. Makridakis, Spiliotis et Assimakopoulos relèvent l’absence fréquente de point de comparaison et l’écart entre qualité d’ajustement et exactitude hors échantillon. Petropoulos et ses coauteurs décrivent le passage d’une origine fixe à une origine glissante, le score d’intervalle comme mesure appropriée, et le fait que les intervalles publiés sont trop étroits. Références fondatrices : Hyndman et Koehler (2006, International Journal of Forecasting, relue) et Hyndman et Khandakar (2008, Journal of Statistical Software, accès ouvert CC BY, relue). Développements récents : Makridakis, Spiliotis et Assimakopoulos (2018, PLOS ONE, accès ouvert CC BY, relue) et Petropoulos et al. (2022, prépublication arXiv ; publiée dans International Journal of Forecasting, relue).

  1. Hyndman & Koehler (2006) Texte intégral vérifié, avec extrait court localisé dans la source.
  2. Hyndman & Khandakar (2008) Texte intégral vérifié, avec extrait court localisé dans la source.
  3. Makridakis, Spiliotis & Assimakopoulos (2018) Texte intégral vérifié, avec extrait court localisé dans la source.
  4. Petropoulos et al. (2022) Texte intégral vérifié, avec extrait court localisé dans la source.

Connexions méthodologiques

Territoire parentMéthodes statistiques de décision : choisir, quantifier, validerPrérequisComment exprimer l’incertitude d’un résultat marketing ?Comparer avecEffets fixes ou aléatoires : quel modèle de panel choisir ?

À lire ensuite

MSC-H-002Modèles de réponse marketing : forme, délai et saturation→MSC-H-006Méthodes statistiques de décision : choisir, quantifier, valider→MSC-P-003Comment exprimer l’incertitude d’un résultat marketing ?→MSC-P-021Effets fixes ou aléatoires : quel modèle de panel choisir ?→