Quel test statistique choisir ?
Le choix part de la question, de l’estimand, du plan d’échantillonnage, du type de variable et des dépendances. Le nom du test n’est que la dernière étape.
Rédaction scientifique : Marketing Science Center
Réponse directe
Sélectionner une procédure cohérente et rapporter effet, intervalle et hypothèses.
Le choix part de la question, de l’estimand, du plan d’échantillonnage, du type de variable et des dépendances. Le nom du test n’est que la dernière étape.
01 · PROTOCOLE
Résumé opérationnel
Trois procédures sont mises à l’épreuve sur 2000 jeux de données simulés : le test de Welch, le test de rang, et la règle populaire qui teste d’abord la normalité puis choisit. Sous les deux hypothèses nulles déclarées, les trois tiennent leur niveau annoncé de 0,05 — la règle en deux temps rejette 0,060000 et 0,056000 des fois. Verdict : PRETEST_RULE_HOLDS_ITS_LEVEL. Mais le vrai écart est ailleurs : sur données asymétriques, Welch ne détecte que 0,319500 des effets contre 0,422500 pour le test de rang. Le choix se paie en puissance, pas en niveau.
02 · PROTOCOLE
Situation marketing concrète
Une équipe a mesuré le temps passé avant une décision d’achat dans deux groupes de trente personnes. Le tableur propose un test de Student, un collègue conseille un test non paramétrique parce que « les données ne sont pas normales », un autre suggère de tester la normalité d’abord et de laisser le résultat décider. Trois conseils, trois procédures, et aucun moyen évident de trancher à partir de ce seul fichier.
03 · PROTOCOLE
Question scientifique
Pour ces trois procédures déclarées, ce niveau nominal de 0,05, ces deux hypothèses nulles déclarées et ces 2000 réplications, chaque procédure rejette-t-elle aussi souvent qu’elle le prétend ? Et si oui, laquelle détecte le mieux un effet réel ? La question ne porte pas sur le fichier de l’équipe, qui ne peut rien trancher à lui seul, mais sur le comportement des procédures elles-mêmes lorsqu’on connaît la vérité.
04 · PROTOCOLE
Pourquoi l’approche simple peut échouer
Regarder le fichier et comparer les p-valeurs ne tranche rien : sur ce fichier les trois procédures rapportent 0,012060, 0,010993 et 0,010993, et aucune décision ne changerait. C’est le piège habituel — on croit choisir un test en regardant ses données, alors qu’un jeu de données unique ne peut pas dire si une procédure tient ses promesses. Et tester la normalité pour trancher revient à laisser les données choisir leur propre juge, ce qui n’est pas la même chose qu’un test à 5 %.
05 · PROTOCOLE
Intuition de la méthode
La méthode consiste à retourner la question. Au lieu de demander quel test convient à ces données, on fabrique des milliers de jeux de données dont on connaît la vérité, on applique chaque procédure à tous, et on compte. Sous une hypothèse nulle, une procédure honnête à 5 % rejette environ cinq fois sur cent : si elle rejette plus souvent, elle n’est pas un test à 5 %, quel que soit son nom. Sous une hypothèse alternative, on compte à nouveau, et cette fois le nombre s’appelle la puissance. Deux comptages, deux propriétés distinctes.
06 · PROTOCOLE
Données nécessaires
Sont figés avant toute lecture : l’identifiant d’unité ordonné sans trou, le groupe limité à deux valeurs, le résultat mesuré, les trois procédures, le niveau nominal de 0,05, le niveau du test de normalité, les trois scénarios, les 2000 réplications, les 25 unités par groupe, la récurrence qui produit les tirages et la tolérance sur le niveau. Le fichier de travail scellé contient 60 unités. Le cas est synthétique et déclaré comme tel.
07 · PROTOCOLE
Modèle formel et symboles
Le test de Welch compare les moyennes en divisant leur écart par une erreur type qui admet des variances inégales, avec des degrés de liberté de Satterthwaite. Le test de rang remplace chaque valeur par son rang dans l’échantillon réuni, somme les rangs d’un groupe et compare cette somme à ce qu’elle vaudrait sans différence, par approximation normale avec correction de rangs ex æquo et sans correction de continuité. Le test de normalité déclaré est celui de Jarque-Bera : il combine asymétrie et aplatissement en une statistique comparée à une loi du khi-deux à deux degrés de liberté.
08 · PROTOCOLE
Calcul déclaré
Le calcul déclaré enchaîne sept étapes : valider le schéma et refuser tout fichier non conforme ; exécuter les trois procédures sur le fichier de travail et enregistrer le choix de la règle en deux temps ; pour chaque scénario, remettre la récurrence à sa graine ; tirer 2000 réplications de deux groupes de 25 par transformation de Box-Muller, en exponentiant pour les scénarios asymétriques et en appliquant le décalage déclaré au second groupe ; appliquer les trois procédures à chaque réplication et noter les rejets ainsi que le test choisi ; diviser par le nombre de réplications ; appliquer la tolérance déclarée aux deux scénarios nuls, puis la règle de verdict à la seule règle en deux temps.
09 · PROTOCOLE
Exemple numérique de bout en bout
Illustration synthétique — valeurs pédagogiques, non observées
Sur le fichier de travail scellé : 30 unités par groupe, Welch donne une statistique de 2,640102 pour 37,036660 degrés de liberté et une queue de 0,012060 ; le test de rang donne 278,000000, une valeur standardisée de −2,542921 et une queue de 0,010993 ; Jarque-Bera donne 54,410246 et 37,041217, si bien que la règle en deux temps choisit le test de rang et rapporte 0,010993. Sur les 2000 réplications : sous l’hypothèse nulle normale, 0,058500 pour Welch, 0,053500 pour le rang, 0,060000 pour la règle, qui a choisi Welch 0,953500 des fois ; sous l’hypothèse nulle asymétrique, 0,049000, 0,053500 et 0,056000, la règle ayant choisi Welch 0,058000 des fois. Les six contrôles réussissent. Sous l’alternative asymétrique, 0,319500, 0,422500 et 0,424500. Verdict : PRETEST_RULE_HOLDS_ITS_LEVEL.
10 · PROTOCOLE
Hypothèses de validité
La simulation suppose que les unités sont indépendantes, que les deux groupes sont échangeables sous l’hypothèse nulle, et que les lois déclarées — normale et lognormale — représentent des situations d’intérêt. Elle suppose aussi que le générateur déclaré produit des tirages assez proches de l’indépendance pour que les comptages soient interprétables. Trois choses ne sont pas testables ici : le comportement des procédures sous variances inégales et effectifs inégaux, celui d’autres tests de normalité, et la question de savoir si la moyenne ou le rang répond à la question que l’équipe se pose réellement.
11 · PROTOCOLE
Diagnostics et incertitude
Le diagnostic tient en deux lectures. Le niveau : les six taux sous hypothèse nulle vont de 0,049000 à 0,060000, tous dans la tolérance de 0,0125 autour de 0,05, dont l’erreur type est d’environ 0,0049 pour 2000 réplications — la tolérance vaut donc environ deux écarts types et demi. La puissance : sous l’alternative asymétrique, l’écart entre Welch et le test de rang, 0,319500 contre 0,422500, est bien plus large que tout ce qui sépare les niveaux. Et la part de choix de Welch par la règle en deux temps, 0,953500 sur données normales contre 0,058000 sur données asymétriques, montre que cette règle n’est pas une troisième procédure mais un aiguillage.
12 · PROTOCOLE
Robustesse et alternatives
Alternatives déclarées avant résultat : refaire la simulation avec des variances inégales et des effectifs inégaux, la configuration où la littérature signale les distorsions les plus fortes ; remplacer Jarque-Bera par Shapiro-Wilk, le test de normalité le plus courant ; augmenter le nombre de réplications pour resserrer les taux ; ou remplacer les deux tests par une comparaison de quantiles, qui répond à une autre question que la moyenne ou le rang. Chaque variante doit être annoncée avant lecture et rapportée même si elle renverse le verdict.
13 · PROTOCOLE
Interprétation du résultat
Le résultat n’est pas la condamnation attendue. Dans les configurations déclarées ici, la règle en deux temps tient son niveau, et l’étude relue scellée à côté de ce dossier a trouvé la même chose tout en rappelant que la procédure reste formellement incorrecte. Les deux énoncés sont vrais ensemble : conditionner le choix du test sur les données casse la logique du test, et dans ces configurations précises les dégâts ne se voient pas sur le niveau global. Ce qui se voit, c’est la puissance perdue quand on applique un test de moyennes à des données asymétriques.
14 · PROTOCOLE
Conclusions autorisées
Autorisé : choisir le test à partir de la question, du plan d’échantillonnage et de l’échelle du résultat, avant de voir les données ; publier la taille de l’effet et son intervalle à côté de la p-valeur ; dire que sur ce fichier les trois procédures s’accordent ; utiliser un test de rang quand la distribution est visiblement asymétrique et que la question porte sur un déplacement général plutôt que sur une moyenne ; et refaire ce type de simulation avant d’adopter une règle automatique.
15 · PROTOCOLE
Conclusions interdites
Interdit : conclure de ce dossier que la règle en deux temps est correcte, alors qu’elle reste formellement fautive et n’a été éprouvée que sur les configurations déclarées ; généraliser ces taux à des variances inégales ou des effectifs inégaux, qui n’ont pas été examinés ; choisir le test après avoir vu quelle procédure donne la p-valeur la plus basse ; présenter une p-valeur seule comme un résultat ; ou lire l’absence de rejet comme une preuve d’absence d’effet. Interdit également : présenter ce cas synthétique comme une mesure observée.
16 · PROTOCOLE
Décision marketing possible
La décision raisonnable est d’écrire le choix du test dans le protocole, avant la collecte, à partir de la question posée et du plan d’échantillonnage — et de s’y tenir. Si la distribution attendue est asymétrique, cela conduit ici au test de rang, qui détecte un tiers d’effets en plus. Si l’équipe tient à une différence de moyennes parce que c’est la moyenne qui a une valeur économique, elle garde Welch et accepte la puissance moindre en toute connaissance de cause. Ce qu’aucune règle automatique ne fera à sa place, c’est décider laquelle des deux questions elle pose.
17 · PROTOCOLE
Quand utiliser ou éviter la méthode
Utiliser cette démarche avant de figer une procédure d’analyse dans un protocole ou dans un outil. L’éviter comme moyen de choisir un test après coup, ce qu’elle interdit précisément. L’éviter aussi quand les unités ne sont pas indépendantes — mesures répétées, grappes, panels — car aucune des trois procédures examinées ici n’en tient compte. Et l’éviter quand la question porte sur un effet causal : le choix du test ne remplace pas un plan qui identifie cet effet.
18 · PROTOCOLE
Implémentations et livrable final
Le CSV CC0 contient les 60 unités synthétiques du fichier de travail. Python et R sont les implémentations de référence ; le bloc SPSS n’est pas une réécriture mais est engendré à partir du calcul de la référence, de sorte que les deux ne peuvent pas diverger ; SAS reproduit la récurrence déclarée et implémente le test de rang dans une étape de données, mais prend ses queues de distribution dans ses propres fonctions. Le livrable final réunit les données, le dictionnaire des variables, les trois procédures déclarées, le niveau nominal, les trois scénarios, la récurrence et sa forme exacte en arithmétique double, la tolérance, les sept étapes numérotées, les résultats sur le fichier de travail, les taux de rejet par scénario, la part de choix de chaque test, les six drapeaux, le verdict et les versions logicielles.
Données synthétiques · CC0
msc-p039-two-group-outcome.csv ↓Protocole reproductible
msc-p039-reproducibility-readme.md ↓Référence Python · MIT
msc-p039-reference.py ↓Référence R · MIT
msc-p039-reference.R ↓Implémentation SPSS · MIT
msc-p039-secondary.sps ↓Implémentation SAS · MIT
msc-p039-secondary.sas ↓19 · PROTOCOLE
Sources et niveau de preuve
Rochon, Gondan et Kieser décrivent exactement la règle examinée ici — le résultat du test préliminaire détermine la méthode employée ensuite —, constatent que ce test préliminaire altère sérieusement l’erreur conditionnelle, concluent que la procédure en deux temps peut être jugée incorrecte d’un point de vue formel, et observent néanmoins qu’elle a semblé maintenir le niveau nominal de façon satisfaisante. Greenland et ses coauteurs rappellent que toute méthode d’inférence repose sur un réseau complexe d’hypothèses, et qu’une très petite p-valeur ne dit pas laquelle est fausse. Lakens rappelle que la taille d’effet est le résultat le plus important d’une étude empirique. Rousselet, Pernet et Wilcox rappellent que résumer une distribution par sa moyenne est un choix, pas une évidence. Références fondatrices : Rochon, Gondan et Kieser (2012, BMC Medical Research Methodology, accès ouvert CC BY, relue) et Greenland et al. (2016, European Journal of Epidemiology, accès ouvert, relue). Développements récents : Lakens (2013, Frontiers in Psychology, accès ouvert CC BY, relue) et Rousselet, Pernet et Wilcox (2017, manuscrit accepté déposé à l’université d’Édimbourg ; publié dans European Journal of Neuroscience, relue).
- Rochon, Gondan & Kieser (2012) Texte intégral vérifié, avec extrait court localisé dans la source.
- Greenland et al. (2016) Texte intégral vérifié, avec extrait court localisé dans la source.
- Lakens (2013) Texte intégral vérifié, avec extrait court localisé dans la source.
- Rousselet, Pernet & Wilcox (2017) Texte intégral vérifié, avec extrait court localisé dans la source.
Connexions méthodologiques

