Quale test statistico scegliere?
La scelta parte da domanda, estimando, disegno campionario, tipo di variabile e dipendenze. Il nome del test è solo l’ultimo passo.
Redazione scientifica: Marketing Science Center
Risposta diretta
Selezionare una procedura coerente e riportare effetto, intervallo e ipotesi.
La scelta parte da domanda, estimando, disegno campionario, tipo di variabile e dipendenze. Il nome del test è solo l’ultimo passo.
01 · PROTOCOLLO
Sintesi operativa
Tre procedure sono messe alla prova su 2000 insiemi di dati simulati: il test di Welch, il test dei ranghi e la regola popolare che verifica prima la normalità e poi sceglie. Sotto le due ipotesi nulle dichiarate, tutte e tre tengono il livello annunciato di 0,05 — la regola in due tempi rifiuta lo 0,060000 e lo 0,056000 delle volte. Verdetto: PRETEST_RULE_HOLDS_ITS_LEVEL. Ma lo scarto vero è altrove: su dati asimmetrici, Welch rileva solo lo 0,319500 degli effetti contro lo 0,422500 del test dei ranghi. La scelta si paga in potenza, non in livello.
02 · PROTOCOLLO
Situazione marketing concreta
Un team ha misurato il tempo trascorso prima di una decisione d’acquisto in due gruppi di trenta persone. Il foglio di calcolo propone un test di Student, un collega consiglia un test non parametrico perché «i dati non sono normali», un altro suggerisce di verificare prima la normalità e lasciare decidere il risultato. Tre consigli, tre procedure, e nessun modo evidente di dirimere a partire da questo solo file.
03 · PROTOCOLLO
Domanda scientifica
Per queste tre procedure dichiarate, questo livello nominale di 0,05, queste due ipotesi nulle dichiarate e queste 2000 repliche, ciascuna procedura rifiuta tanto spesso quanto pretende? E in tal caso, quale rileva meglio un effetto reale? La domanda non riguarda il file del team, che da solo non può dirimere nulla, ma il comportamento delle procedure stesse quando la verità è nota.
04 · PROTOCOLLO
Perché l’approccio semplice può fallire
Guardare il file e confrontare i valori p non dirime nulla: su questo file le tre procedure riportano 0,012060, 0,010993 e 0,010993, e nessuna decisione cambierebbe. È la trappola abituale — si crede di scegliere un test guardando i propri dati, mentre un singolo insieme di dati non può dire se una procedura mantiene le promesse. E verificare la normalità per decidere equivale a lasciare che i dati scelgano il proprio giudice, il che non è la stessa cosa di un test al 5%.
05 · PROTOCOLLO
Intuizione del metodo
Il metodo consiste nel rovesciare la domanda. Invece di chiedersi quale test convenga a questi dati, si fabbricano migliaia di insiemi di dati di cui si conosce la verità, si applica ogni procedura a tutti e si conta. Sotto un’ipotesi nulla, una procedura onesta al 5% rifiuta circa cinque volte su cento: se rifiuta più spesso, non è un test al 5%, qualunque sia il suo nome. Sotto un’ipotesi alternativa si conta di nuovo, e stavolta il numero si chiama potenza. Due conteggi, due proprietà distinte.
06 · PROTOCOLLO
Dati necessari
Sono fissati prima di ogni lettura: l’identificativo di unità ordinato senza lacune, il gruppo limitato a due valori, il risultato misurato, le tre procedure, il livello nominale di 0,05, il livello del test di normalità, i tre scenari, le 2000 repliche, le 25 unità per gruppo, la ricorrenza che produce le estrazioni e la tolleranza sul livello. Il file di lavoro sigillato contiene 60 unità. Il caso è sintetico e dichiarato tale.
07 · PROTOCOLLO
Modello formale e simboli
Il test di Welch confronta le medie dividendo il loro scarto per un errore standard che ammette varianze disuguali, con gradi di libertà di Satterthwaite. Il test dei ranghi sostituisce ogni valore con il suo rango nel campione riunito, somma i ranghi di un gruppo e confronta quella somma con quanto varrebbe senza differenza, per approssimazione normale con correzione per ex aequo e senza correzione di continuità. Il test di normalità dichiarato è quello di Jarque-Bera: combina asimmetria e curtosi in una statistica confrontata con una legge chi quadrato a due gradi di libertà.
08 · PROTOCOLLO
Calcolo dichiarato
Il calcolo dichiarato segue sette tappe: validare lo schema e rifiutare ogni file non conforme; eseguire le tre procedure sul file di lavoro e registrare la scelta della regola in due tempi; per ogni scenario, riportare la ricorrenza al suo seme; estrarre 2000 repliche di due gruppi di 25 per trasformazione di Box-Muller, esponenziando per gli scenari asimmetrici e applicando lo scarto dichiarato al secondo gruppo; applicare le tre procedure a ogni replica e annotare i rifiuti e il test scelto; dividere per il numero di repliche; applicare la tolleranza dichiarata ai due scenari nulli, poi la regola di verdetto alla sola regola in due tempi.
09 · PROTOCOLLO
Esempio numerico completo
Illustrazione sintetica — valori didattici, non osservati
Sul file di lavoro sigillato: 30 unità per gruppo, Welch dà una statistica di 2,640102 su 37,036660 gradi di libertà e una coda di 0,012060; il test dei ranghi dà 278,000000, un valore standardizzato di −2,542921 e una coda di 0,010993; Jarque-Bera dà 54,410246 e 37,041217, cosicché la regola in due tempi sceglie il test dei ranghi e riporta 0,010993. Sulle 2000 repliche: sotto l’ipotesi nulla normale, 0,058500 per Welch, 0,053500 per i ranghi, 0,060000 per la regola, che ha scelto Welch nello 0,953500 dei casi; sotto l’ipotesi nulla asimmetrica, 0,049000, 0,053500 e 0,056000, con Welch scelto nello 0,058000 dei casi. I sei controlli passano. Sotto l’alternativa asimmetrica, 0,319500, 0,422500 e 0,424500. Verdetto: PRETEST_RULE_HOLDS_ITS_LEVEL.
10 · PROTOCOLLO
Ipotesi di validità
La simulazione presuppone che le unità siano indipendenti, che i due gruppi siano scambiabili sotto l’ipotesi nulla e che le leggi dichiarate — normale e lognormale — rappresentino situazioni d’interesse. Presuppone inoltre che il generatore dichiarato produca estrazioni abbastanza vicine all’indipendenza perché i conteggi siano interpretabili. Tre cose non sono verificabili qui: il comportamento delle procedure con varianze disuguali ed effettivi disuguali, quello di altri test di normalità, e se la media o il rango risponda alla domanda che il team si pone davvero.
11 · PROTOCOLLO
Diagnostica e incertezza
La diagnosi sta in due letture. Il livello: i sei tassi sotto ipotesi nulla vanno da 0,049000 a 0,060000, tutti entro la tolleranza di 0,0125 attorno a 0,05, il cui errore standard è circa 0,0049 per 2000 repliche — la tolleranza vale dunque circa due deviazioni standard e mezza. La potenza: sotto l’alternativa asimmetrica, lo scarto fra Welch e il test dei ranghi, 0,319500 contro 0,422500, è molto più ampio di tutto ciò che separa i livelli. E la quota di scelte di Welch da parte della regola in due tempi, 0,953500 su dati normali contro 0,058000 su dati asimmetrici, mostra che quella regola non è una terza procedura ma uno scambio.
12 · PROTOCOLLO
Robustezza e alternative
Alternative dichiarate prima del risultato: rifare la simulazione con varianze disuguali ed effettivi disuguali, la configurazione in cui la letteratura segnala le distorsioni maggiori; sostituire Jarque-Bera con Shapiro-Wilk, il test di normalità più diffuso; aumentare il numero di repliche per stringere i tassi; oppure sostituire i due test con un confronto di quantili, che risponde a una domanda diversa dalla media o dal rango. Ogni variante va annunciata prima della lettura e riportata anche se ribalta il verdetto.
13 · PROTOCOLLO
Interpretazione del risultato
Il risultato non è la condanna attesa. Nelle configurazioni qui dichiarate, la regola in due tempi tiene il proprio livello, e lo studio con revisione paritaria sigillato accanto a questo dossier ha trovato lo stesso, pur ricordando che la procedura resta formalmente scorretta. I due enunciati sono veri insieme: condizionare la scelta del test sui dati rompe la logica del test, e in queste precise configurazioni i danni non si vedono sul livello complessivo. Ciò che si vede è la potenza persa applicando un test di medie a dati asimmetrici.
14 · PROTOCOLLO
Conclusioni consentite
Consentito: scegliere il test a partire dalla domanda, dal disegno campionario e dalla scala del risultato, prima di vedere i dati; pubblicare la dimensione dell’effetto e il suo intervallo accanto al valore p; dire che su questo file le tre procedure concordano; usare un test dei ranghi quando la distribuzione è visibilmente asimmetrica e la domanda riguarda uno spostamento generale anziché una media; e rifare questo tipo di simulazione prima di adottare una regola automatica.
15 · PROTOCOLLO
Conclusioni vietate
Vietato: concludere da questo dossier che la regola in due tempi sia corretta, mentre resta formalmente errata ed è stata provata solo sulle configurazioni dichiarate; generalizzare questi tassi a varianze disuguali o effettivi disuguali, non esaminati; scegliere il test dopo aver visto quale procedura dà il valore p più basso; presentare un valore p da solo come risultato; o leggere il mancato rifiuto come prova di assenza di effetto. Vietato anche: presentare questo caso sintetico come una misura osservata.
16 · PROTOCOLLO
Possibile decisione marketing
La decisione ragionevole è scrivere la scelta del test nel protocollo, prima della raccolta, a partire dalla domanda posta e dal disegno campionario — e attenervisi. Se la distribuzione attesa è asimmetrica, ciò porta qui al test dei ranghi, che rileva un terzo di effetti in più. Se il team tiene a una differenza di medie perché è la media ad avere valore economico, mantiene Welch e accetta consapevolmente la minore potenza. Ciò che nessuna regola automatica farà al suo posto è decidere quale delle due domande sta ponendo.
17 · PROTOCOLLO
Quando usare o evitare il metodo
Usare questo approccio prima di fissare una procedura d’analisi in un protocollo o in uno strumento. Evitarlo come mezzo per scegliere un test a posteriori, ciò che esso proprio vieta. Evitarlo anche quando le unità non sono indipendenti — misure ripetute, grappoli, panel — poiché nessuna delle tre procedure qui esaminate ne tiene conto. Ed evitarlo quando la domanda riguarda un effetto causale: la scelta del test non sostituisce un disegno che identifichi quell’effetto.
18 · PROTOCOLLO
Implementazioni e risultato finale
Il CSV CC0 contiene le 60 unità sintetiche del file di lavoro. Python e R sono le implementazioni di riferimento; il blocco SPSS non è una riscrittura ma è generato dal calcolo della referenza, cosicché i due non possono divergere; SAS riproduce la ricorrenza dichiarata e implementa il test dei ranghi in una tappa di dati, ma prende le code di distribuzione dalle proprie funzioni. Il risultato finale raccoglie i dati, il dizionario delle variabili, le tre procedure dichiarate, il livello nominale, i tre scenari, la ricorrenza e la sua forma esatta in aritmetica doppia, la tolleranza, le sette tappe numerate, i risultati sul file di lavoro, i tassi di rifiuto per scenario, la quota di scelta di ciascun test, i sei flag, il verdetto e le versioni software.
Dati sintetici · CC0
msc-p039-two-group-outcome.csv ↓Protocollo riproducibile
msc-p039-reproducibility-readme.md ↓Riferimento Python · MIT
msc-p039-reference.py ↓Riferimento R · MIT
msc-p039-reference.R ↓Implementazione SPSS · MIT
msc-p039-secondary.sps ↓Implementazione SAS · MIT
msc-p039-secondary.sas ↓19 · PROTOCOLLO
Fonti e livello di prova
Rochon, Gondan e Kieser descrivono esattamente la regola qui esaminata — l’esito del test preliminare determina il metodo usato poi —, constatano che quel test preliminare altera seriamente l’errore condizionale, concludono che la procedura in due tempi può essere giudicata scorretta da un punto di vista formale, e osservano nondimeno che è sembrata mantenere il livello nominale in modo soddisfacente. Greenland e coautori ricordano che ogni metodo d’inferenza poggia su una rete complessa di ipotesi, e che un valore p molto piccolo non dice quale sia falsa. Lakens ricorda che la dimensione dell’effetto è il risultato più importante di uno studio empirico. Rousselet, Pernet e Wilcox ricordano che riassumere una distribuzione con la sua media è una scelta, non un’evidenza. Riferimenti fondativi: Rochon, Gondan e Kieser (2012, BMC Medical Research Methodology, accesso aperto CC BY, con revisione) e Greenland et al. (2016, European Journal of Epidemiology, accesso aperto, con revisione). Sviluppi recenti: Lakens (2013, Frontiers in Psychology, accesso aperto CC BY, con revisione) e Rousselet, Pernet e Wilcox (2017, manoscritto accettato depositato all’università di Edimburgo; pubblicato in European Journal of Neuroscience, con revisione).
- Rochon, Gondan & Kieser (2012) Testo integrale verificato, con estratto breve localizzato nella fonte.
- Greenland et al. (2016) Testo integrale verificato, con estratto breve localizzato nella fonte.
- Lakens (2013) Testo integrale verificato, con estratto breve localizzato nella fonte.
- Rousselet, Pernet & Wilcox (2017) Testo integrale verificato, con estratto breve localizzato nella fonte.
Connessioni metodologiche

