Research & Evidence

Rechercher une méthode

Recherchez parmi les titres, les questions, les territoires et les identifiants MSC.

41 résultats
  1. MSC-P-001Comment transformer une affirmation marketing en question testable ?Science de la décision↗
  2. MSC-P-002Corrélation ou causalité : que permet réellement d’affirmer une analyse ?Mesure marketing↗
  3. MSC-P-003Comment exprimer l’incertitude d’un résultat marketing ?Science de la décision↗
  4. MSC-P-004Significativité ou taille d’effet : quel résultat faut-il interpréter ?Science de la décision↗
  5. MSC-P-005Comment mesurer un construit marketing qui n’est pas directement observable ?Études de marché↗
  6. MSC-P-006Comment concevoir puis valider une échelle de mesure ?Études de marché↗
  7. MSC-P-007Alpha ou oméga : comment évaluer la fiabilité d’une échelle ?Études de marché↗
  8. MSC-P-009ACP, AFE ou AFC : quelle méthode choisir ?Études de marché↗
  9. MSC-P-010Quand faut-il mener une expérience marketing ?Mesure marketing↗
  10. MSC-P-011Comment concevoir un A/B test qui estime réellement un effet ?Mesure marketing↗
  11. MSC-P-012De combien d’observations une expérience a-t-elle besoin ?Science de la décision↗
  12. MSC-P-013Comment mesurer l’effet incrémental d’une campagne avec un groupe témoin ?Mesure marketing↗
  13. MSC-P-017Comment détecter sélection, contamination et attrition dans une expérience ?Mesure marketing↗
  14. MSC-P-018Régression prédictive ou causale : qu’essaye-t-on d’estimer ?Modèles marketing↗
  15. MSC-P-019Comment diagnostiquer une régression marketing avant de l’interpréter ?Modèles marketing↗
  16. MSC-P-022Comment estimer une élasticité-prix et son incertitude ?Science des prix↗
  17. MSC-P-026Logit vs Probit : comment choisir pour une probabilité d’achat ?Science client↗
  18. MSC-P-029Quels clients présentent la probabilité de churn la plus élevée ?Science client↗
  19. MSC-P-027TAM, UTAUT ou UTAUT2 : quel cadre pour étudier l’acceptation d’une technologie ?Études de marché↗
  20. MSC-H-001Mesure et causalité : comment établir un effet marketing ?Mesure marketing↗
  21. MSC-H-002Modèles de réponse marketing : forme, délai et saturationModèles marketing↗
  22. MSC-H-003Science des prix : relier prix, demande et contributionScience des prix↗
  23. MSC-H-004Science client et choix : comportement, valeur et hétérogénéitéScience client↗
  24. MSC-H-005Science de la mesure : construire des indicateurs validesÉtudes de marché↗
  25. MSC-H-006Méthodes statistiques de décision : choisir, quantifier, validerScience de la décision↗
  26. MSC-P-008Comment valider une échelle de mesure marketing ?Études de marché↗
  27. MSC-P-014Comment concevoir une expérience géographique marketing ?Mesure marketing↗
  28. MSC-P-015Comment estimer un effet avec une différence-de-différences ?Mesure marketing↗
  29. MSC-P-020Comment traiter l’endogénéité du prix ?Science des prix↗
  30. MSC-P-021Effets fixes ou aléatoires : quel modèle de panel choisir ?Modèles marketing↗
  31. MSC-P-023Comment estimer une fonction de demande ?Science des prix↗
  32. MSC-P-024Comment simuler un scénario prix-volume-marge ?Science des prix↗
  33. MSC-P-028Comment estimer la CLV avec BG/NBD et Gamma-Gamma ?Science client↗
  34. MSC-P-030Comment analyser la rétention avec un modèle de survie ?Science client↗
  35. MSC-P-043Combien vaut un abonné quand on n’a observé que six mois de rétention ?Science client↗
  36. MSC-P-031Comment construire une segmentation client utile ?Science client↗
  37. MSC-P-032Comment tester la stabilité d’une segmentation ?Science client↗
  38. MSC-P-033Comment valider une prévision marketing ?Science de la décision↗
  39. MSC-P-034Comment construire une simulation Monte Carlo pour une décision marketing ?Science de la décision↗
  40. MSC-P-035Comment modéliser saturation et adstock ?Modèles marketing↗
  41. MSC-P-039Quel test statistique choisir ?Science de la décision↗
← Toutes les méthodes
FICHE MÉTHODEMSC-P-039Fondements de la preuveDossier scientifique vérifié

Quel test statistique choisir ?

Le choix part de la question, de l’estimand, du plan d’échantillonnage, du type de variable et des dépendances. Le nom du test n’est que la dernière étape.

Rédaction scientifique : Marketing Science Center

Réponse directe

Sélectionner une procédure cohérente et rapporter effet, intervalle et hypothèses.

Le choix part de la question, de l’estimand, du plan d’échantillonnage, du type de variable et des dépendances. Le nom du test n’est que la dernière étape.

Welch, 1947ASA, 2016

01 · PROTOCOLE

Résumé opérationnel

Trois procédures sont mises à l’épreuve sur 2000 jeux de données simulés : le test de Welch, le test de rang, et la règle populaire qui teste d’abord la normalité puis choisit. Sous les deux hypothèses nulles déclarées, les trois tiennent leur niveau annoncé de 0,05 — la règle en deux temps rejette 0,060000 et 0,056000 des fois. Verdict : PRETEST_RULE_HOLDS_ITS_LEVEL. Mais le vrai écart est ailleurs : sur données asymétriques, Welch ne détecte que 0,319500 des effets contre 0,422500 pour le test de rang. Le choix se paie en puissance, pas en niveau.

02 · PROTOCOLE

Situation marketing concrète

Une équipe a mesuré le temps passé avant une décision d’achat dans deux groupes de trente personnes. Le tableur propose un test de Student, un collègue conseille un test non paramétrique parce que « les données ne sont pas normales », un autre suggère de tester la normalité d’abord et de laisser le résultat décider. Trois conseils, trois procédures, et aucun moyen évident de trancher à partir de ce seul fichier.

03 · PROTOCOLE

Question scientifique

Pour ces trois procédures déclarées, ce niveau nominal de 0,05, ces deux hypothèses nulles déclarées et ces 2000 réplications, chaque procédure rejette-t-elle aussi souvent qu’elle le prétend ? Et si oui, laquelle détecte le mieux un effet réel ? La question ne porte pas sur le fichier de l’équipe, qui ne peut rien trancher à lui seul, mais sur le comportement des procédures elles-mêmes lorsqu’on connaît la vérité.

04 · PROTOCOLE

Pourquoi l’approche simple peut échouer

Regarder le fichier et comparer les p-valeurs ne tranche rien : sur ce fichier les trois procédures rapportent 0,012060, 0,010993 et 0,010993, et aucune décision ne changerait. C’est le piège habituel — on croit choisir un test en regardant ses données, alors qu’un jeu de données unique ne peut pas dire si une procédure tient ses promesses. Et tester la normalité pour trancher revient à laisser les données choisir leur propre juge, ce qui n’est pas la même chose qu’un test à 5 %.

05 · PROTOCOLE

Intuition de la méthode

La méthode consiste à retourner la question. Au lieu de demander quel test convient à ces données, on fabrique des milliers de jeux de données dont on connaît la vérité, on applique chaque procédure à tous, et on compte. Sous une hypothèse nulle, une procédure honnête à 5 % rejette environ cinq fois sur cent : si elle rejette plus souvent, elle n’est pas un test à 5 %, quel que soit son nom. Sous une hypothèse alternative, on compte à nouveau, et cette fois le nombre s’appelle la puissance. Deux comptages, deux propriétés distinctes.

06 · PROTOCOLE

Données nécessaires

Sont figés avant toute lecture : l’identifiant d’unité ordonné sans trou, le groupe limité à deux valeurs, le résultat mesuré, les trois procédures, le niveau nominal de 0,05, le niveau du test de normalité, les trois scénarios, les 2000 réplications, les 25 unités par groupe, la récurrence qui produit les tirages et la tolérance sur le niveau. Le fichier de travail scellé contient 60 unités. Le cas est synthétique et déclaré comme tel.

07 · PROTOCOLE

Modèle formel et symboles

Le test de Welch compare les moyennes en divisant leur écart par une erreur type qui admet des variances inégales, avec des degrés de liberté de Satterthwaite. Le test de rang remplace chaque valeur par son rang dans l’échantillon réuni, somme les rangs d’un groupe et compare cette somme à ce qu’elle vaudrait sans différence, par approximation normale avec correction de rangs ex æquo et sans correction de continuité. Le test de normalité déclaré est celui de Jarque-Bera : il combine asymétrie et aplatissement en une statistique comparée à une loi du khi-deux à deux degrés de liberté.

08 · PROTOCOLE

Calcul déclaré

Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ; exécuter les trois procédures sur le fichier de travail et enregistrer le choix de la règle en deux temps ; pour chaque scénario, remettre la récurrence à sa graine ; tirer 2000 réplications de deux groupes de 25 par transformation de Box-Muller, en exponentiant pour les scénarios asymétriques et en appliquant le décalage déclaré au second groupe ; appliquer les trois procédures à chaque réplication et noter les rejets ainsi que le test choisi ; diviser par le nombre de réplications ; appliquer la tolérance déclarée aux deux scénarios nuls, puis la règle de verdict à la seule règle en deux temps.

09 · PROTOCOLE

Exemple numérique de bout en bout

Illustration synthétique — valeurs pédagogiques, non observées

Sur le fichier de travail scellé : 30 unités par groupe, Welch donne une statistique de 2,640102 pour 37,036660 degrés de liberté et une queue de 0,012060 ; le test de rang donne 278,000000, une valeur standardisée de −2,542921 et une queue de 0,010993 ; Jarque-Bera donne 54,410246 et 37,041217, si bien que la règle en deux temps choisit le test de rang et rapporte 0,010993. Sur les 2000 réplications : sous l’hypothèse nulle normale, 0,058500 pour Welch, 0,053500 pour le rang, 0,060000 pour la règle, qui a choisi Welch 0,953500 des fois ; sous l’hypothèse nulle asymétrique, 0,049000, 0,053500 et 0,056000, la règle ayant choisi Welch 0,058000 des fois. Les six contrôles réussissent. Sous l’alternative asymétrique, 0,319500, 0,422500 et 0,424500. Verdict : PRETEST_RULE_HOLDS_ITS_LEVEL.

10 · PROTOCOLE

Hypothèses de validité

La simulation suppose que les unités sont indépendantes, que les deux groupes sont échangeables sous l’hypothèse nulle, et que les lois déclarées — normale et lognormale — représentent des situations d’intérêt. Elle suppose aussi que le générateur déclaré produit des tirages assez proches de l’indépendance pour que les comptages soient interprétables. Trois choses ne sont pas testables ici : le comportement des procédures sous variances inégales et effectifs inégaux, celui d’autres tests de normalité, et la question de savoir si la moyenne ou le rang répond à la question que l’équipe se pose réellement.

11 · PROTOCOLE

Diagnostics et incertitude

Le diagnostic tient en deux lectures. Le niveau : les six taux sous hypothèse nulle vont de 0,049000 à 0,060000, tous dans la tolérance de 0,0125 autour de 0,05, dont l’erreur type est d’environ 0,0049 pour 2000 réplications — la tolérance vaut donc environ deux écarts types et demi. La puissance : sous l’alternative asymétrique, l’écart entre Welch et le test de rang, 0,319500 contre 0,422500, est bien plus large que tout ce qui sépare les niveaux. Et la part de choix de Welch par la règle en deux temps, 0,953500 sur données normales contre 0,058000 sur données asymétriques, montre que cette règle n’est pas une troisième procédure mais un aiguillage.

12 · PROTOCOLE

Robustesse et alternatives

Alternatives déclarées avant résultat : refaire la simulation avec des variances inégales et des effectifs inégaux, la configuration où la littérature signale les distorsions les plus fortes ; remplacer Jarque-Bera par Shapiro-Wilk, le test de normalité le plus courant ; augmenter le nombre de réplications pour resserrer les taux ; ou remplacer les deux tests par une comparaison de quantiles, qui répond à une autre question que la moyenne ou le rang. Chaque variante doit être annoncée avant lecture et rapportée même si elle renverse le verdict.

13 · PROTOCOLE

Interprétation du résultat

Le résultat n’est pas la condamnation attendue. Dans les configurations déclarées ici, la règle en deux temps tient son niveau, et l’étude relue scellée à côté de ce dossier a trouvé la même chose tout en rappelant que la procédure reste formellement incorrecte. Les deux énoncés sont vrais ensemble : conditionner le choix du test sur les données casse la logique du test, et dans ces configurations précises les dégâts ne se voient pas sur le niveau global. Ce qui se voit, c’est la puissance perdue quand on applique un test de moyennes à des données asymétriques.

14 · PROTOCOLE

Conclusions autorisées

Autorisé : choisir le test à partir de la question, du plan d’échantillonnage et de l’échelle du résultat, avant de voir les données ; publier la taille de l’effet et son intervalle à côté de la p-valeur ; dire que sur ce fichier les trois procédures s’accordent ; utiliser un test de rang quand la distribution est visiblement asymétrique et que la question porte sur un déplacement général plutôt que sur une moyenne ; et refaire ce type de simulation avant d’adopter une règle automatique.

15 · PROTOCOLE

Conclusions interdites

Interdit : conclure de ce dossier que la règle en deux temps est correcte, alors qu’elle reste formellement fautive et n’a été éprouvée que sur les configurations déclarées ; généraliser ces taux à des variances inégales ou des effectifs inégaux, qui n’ont pas été examinés ; choisir le test après avoir vu quelle procédure donne la p-valeur la plus basse ; présenter une p-valeur seule comme un résultat ; ou lire l’absence de rejet comme une preuve d’absence d’effet. Interdit également : présenter ce cas synthétique comme une mesure observée.

16 · PROTOCOLE

Décision marketing possible

La décision raisonnable est d’écrire le choix du test dans le protocole, avant la collecte, à partir de la question posée et du plan d’échantillonnage — et de s’y tenir. Si la distribution attendue est asymétrique, cela conduit ici au test de rang, qui détecte un tiers d’effets en plus. Si l’équipe tient à une différence de moyennes parce que c’est la moyenne qui a une valeur économique, elle garde Welch et accepte la puissance moindre en toute connaissance de cause. Ce qu’aucune règle automatique ne fera à sa place, c’est décider laquelle des deux questions elle pose.

17 · PROTOCOLE

Quand utiliser ou éviter la méthode

Utiliser cette démarche avant de figer une procédure d’analyse dans un protocole ou dans un outil. L’éviter comme moyen de choisir un test après coup, ce qu’elle interdit précisément. L’éviter aussi quand les unités ne sont pas indépendantes — mesures répétées, grappes, panels — car aucune des trois procédures examinées ici n’en tient compte. Et l’éviter quand la question porte sur un effet causal : le choix du test ne remplace pas un plan qui identifie cet effet.

18 · PROTOCOLE

Implémentations et livrable final

Le CSV CC0 contient les 60 unités synthétiques du fichier de travail. Python et R sont les implémentations de référence ; le bloc SPSS n’est pas une réécriture mais est engendré à partir du calcul de la référence, de sorte que les deux ne peuvent pas diverger ; SAS reproduit la récurrence déclarée et implémente le test de rang dans une étape de données, mais prend ses queues de distribution dans ses propres fonctions. Le livrable final réunit les données, le dictionnaire des variables, les trois procédures déclarées, le niveau nominal, les trois scénarios, la récurrence et sa forme exacte en arithmétique double, la tolérance, les sept étapes numérotées, les résultats sur le fichier de travail, les taux de rejet par scénario, la part de choix de chaque test, les six drapeaux, le verdict et les versions logicielles.

19 · PROTOCOLE

Sources et niveau de preuve

Rochon, Gondan et Kieser décrivent exactement la règle examinée ici — le résultat du test préliminaire détermine la méthode employée ensuite —, constatent que ce test préliminaire altère sérieusement l’erreur conditionnelle, concluent que la procédure en deux temps peut être jugée incorrecte d’un point de vue formel, et observent néanmoins qu’elle a semblé maintenir le niveau nominal de façon satisfaisante. Greenland et ses coauteurs rappellent que toute méthode d’inférence repose sur un réseau complexe d’hypothèses, et qu’une très petite p-valeur ne dit pas laquelle est fausse. Lakens rappelle que la taille d’effet est le résultat le plus important d’une étude empirique. Rousselet, Pernet et Wilcox rappellent que résumer une distribution par sa moyenne est un choix, pas une évidence. Références fondatrices : Rochon, Gondan et Kieser (2012, BMC Medical Research Methodology, accès ouvert CC BY, relue) et Greenland et al. (2016, European Journal of Epidemiology, accès ouvert, relue). Développements récents : Lakens (2013, Frontiers in Psychology, accès ouvert CC BY, relue) et Rousselet, Pernet et Wilcox (2017, manuscrit accepté déposé à l’université d’Édimbourg ; publié dans European Journal of Neuroscience, relue).

  1. Rochon, Gondan & Kieser (2012) Texte intégral vérifié, avec extrait court localisé dans la source.
  2. Greenland et al. (2016) Texte intégral vérifié, avec extrait court localisé dans la source.
  3. Lakens (2013) Texte intégral vérifié, avec extrait court localisé dans la source.
  4. Rousselet, Pernet & Wilcox (2017) Texte intégral vérifié, avec extrait court localisé dans la source.

Connexions méthodologiques

Territoire parentMéthodes statistiques de décision : choisir, quantifier, validerPrérequisSignificativité ou taille d’effet : quel résultat faut-il interpréter ?Comparer avecDe combien d’observations une expérience a-t-elle besoin ?

À lire ensuite

MSC-H-006Méthodes statistiques de décision : choisir, quantifier, valider→MSC-P-003Comment exprimer l’incertitude d’un résultat marketing ?→MSC-P-004Significativité ou taille d’effet : quel résultat faut-il interpréter ?→MSC-P-012De combien d’observations une expérience a-t-elle besoin ?→