¿Qué prueba estadística elegir?
La elección parte de la pregunta, estimando, diseño muestral, tipo de variable y dependencias. El nombre de la prueba es solo el último paso.
Redacción científica: Marketing Science Center
Respuesta directa
Seleccionar un procedimiento coherente e informar efecto, intervalo y supuestos.
La elección parte de la pregunta, estimando, diseño muestral, tipo de variable y dependencias. El nombre de la prueba es solo el último paso.
01 · PROTOCOLO
Resumen operativo
Tres procedimientos se someten a prueba sobre 2000 conjuntos de datos simulados: la prueba de Welch, la prueba de rangos y la regla popular que contrasta primero la normalidad y luego elige. Bajo las dos hipótesis nulas declaradas, las tres mantienen su nivel anunciado de 0,05 — la regla en dos etapas rechaza el 0,060000 y el 0,056000 de las veces. Veredicto: PRETEST_RULE_HOLDS_ITS_LEVEL. Pero la brecha real está en otra parte: con datos asimétricos, Welch detecta solo el 0,319500 de los efectos frente al 0,422500 de la prueba de rangos. La elección se paga en potencia, no en nivel.
02 · PROTOCOLO
Situación de marketing concreta
Un equipo ha medido el tiempo transcurrido antes de una decisión de compra en dos grupos de treinta personas. La hoja de cálculo propone una prueba de Student, un colega aconseja una prueba no paramétrica porque «los datos no son normales», otro sugiere contrastar primero la normalidad y dejar que el resultado decida. Tres consejos, tres procedimientos, y ninguna forma evidente de dirimir a partir de este único archivo.
03 · PROTOCOLO
Pregunta científica
Para estos tres procedimientos declarados, este nivel nominal de 0,05, estas dos hipótesis nulas declaradas y estas 2000 réplicas, ¿rechaza cada procedimiento tan a menudo como pretende? Y si es así, ¿cuál detecta mejor un efecto real? La pregunta no trata del archivo del equipo, que por sí solo no puede dirimir nada, sino del comportamiento de los procedimientos cuando se conoce la verdad.
04 · PROTOCOLO
Por qué puede fallar el enfoque simple
Mirar el archivo y comparar los valores p no dirime nada: en este archivo los tres procedimientos informan 0,012060, 0,010993 y 0,010993, y ninguna decisión cambiaría. Es la trampa habitual — uno cree elegir una prueba mirando sus datos, cuando un único conjunto de datos no puede decir si un procedimiento cumple lo que promete. Y contrastar la normalidad para decidir equivale a dejar que los datos elijan a su propio juez, lo que no es lo mismo que una prueba al 5 %.
05 · PROTOCOLO
Intuición del método
El método consiste en dar la vuelta a la pregunta. En lugar de preguntar qué prueba conviene a estos datos, se fabrican miles de conjuntos de datos cuya verdad se conoce, se aplica cada procedimiento a todos y se cuenta. Bajo una hipótesis nula, un procedimiento honesto al 5 % rechaza unas cinco veces de cada cien: si rechaza más a menudo, no es una prueba al 5 %, se llame como se llame. Bajo una hipótesis alternativa se cuenta otra vez, y esta vez el número se llama potencia. Dos recuentos, dos propiedades distintas.
06 · PROTOCOLO
Datos necesarios
Se fijan antes de cualquier lectura: el identificador de unidad ordenado sin huecos, el grupo limitado a dos valores, el resultado medido, los tres procedimientos, el nivel nominal de 0,05, el nivel de la prueba de normalidad, los tres escenarios, las 2000 réplicas, las 25 unidades por grupo, la recurrencia que produce los sorteos y la tolerancia sobre el nivel. El archivo de trabajo sellado contiene 60 unidades. El caso es sintético y así se declara.
07 · PROTOCOLO
Modelo formal y símbolos
La prueba de Welch compara las medias dividiendo su diferencia por un error típico que admite varianzas desiguales, con grados de libertad de Satterthwaite. La prueba de rangos sustituye cada valor por su rango en la muestra reunida, suma los rangos de un grupo y compara esa suma con lo que valdría sin diferencia, mediante aproximación normal con corrección por empates y sin corrección de continuidad. La prueba de normalidad declarada es la de Jarque-Bera: combina asimetría y curtosis en un estadístico comparado con una ley ji-cuadrado con dos grados de libertad.
08 · PROTOCOLO
Cálculo declarado
El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme; ejecutar los tres procedimientos sobre el archivo de trabajo y registrar la elección de la regla en dos etapas; para cada escenario, devolver la recurrencia a su semilla; extraer 2000 réplicas de dos grupos de 25 por transformación de Box-Muller, exponenciando para los escenarios asimétricos y aplicando el desplazamiento declarado al segundo grupo; aplicar los tres procedimientos a cada réplica y anotar los rechazos y la prueba elegida; dividir por el número de réplicas; aplicar la tolerancia declarada a los dos escenarios nulos y luego la regla del veredicto solo a la regla en dos etapas.
09 · PROTOCOLO
Ejemplo numérico completo
Ilustración sintética — valores didácticos, no observados
En el archivo de trabajo sellado: 30 unidades por grupo, Welch da un estadístico de 2,640102 con 37,036660 grados de libertad y una cola de 0,012060; la prueba de rangos da 278,000000, un valor estandarizado de −2,542921 y una cola de 0,010993; Jarque-Bera da 54,410246 y 37,041217, de modo que la regla en dos etapas elige la prueba de rangos e informa 0,010993. Sobre las 2000 réplicas: bajo la nula normal, 0,058500 para Welch, 0,053500 para rangos, 0,060000 para la regla, que eligió Welch el 0,953500 de las veces; bajo la nula asimétrica, 0,049000, 0,053500 y 0,056000, habiendo elegido Welch el 0,058000 de las veces. Los seis controles pasan. Bajo la alternativa asimétrica, 0,319500, 0,422500 y 0,424500. Veredicto: PRETEST_RULE_HOLDS_ITS_LEVEL.
10 · PROTOCOLO
Supuestos de validez
La simulación supone que las unidades son independientes, que los dos grupos son intercambiables bajo la nula y que las leyes declaradas — normal y lognormal — representan situaciones de interés. Supone además que el generador declarado produce sorteos lo bastante próximos a la independencia para que los recuentos sean interpretables. Tres cosas no son comprobables aquí: el comportamiento de los procedimientos con varianzas desiguales y tamaños desiguales, el de otras pruebas de normalidad, y si la media o el rango responde a la pregunta que el equipo se plantea realmente.
11 · PROTOCOLO
Diagnósticos e incertidumbre
El diagnóstico cabe en dos lecturas. El nivel: las seis tasas bajo la nula van de 0,049000 a 0,060000, todas dentro de la tolerancia de 0,0125 en torno a 0,05, cuyo error típico es de unos 0,0049 para 2000 réplicas — la tolerancia vale por tanto unos dos errores típicos y medio. La potencia: bajo la alternativa asimétrica, la brecha entre Welch y la prueba de rangos, 0,319500 frente a 0,422500, es mucho más ancha que todo lo que separa los niveles. Y la proporción de elecciones de Welch por la regla en dos etapas, 0,953500 con datos normales frente a 0,058000 con datos asimétricos, muestra que esa regla no es un tercer procedimiento sino un desvío.
12 · PROTOCOLO
Robustez y alternativas
Alternativas declaradas antes del resultado: rehacer la simulación con varianzas desiguales y tamaños desiguales, la configuración donde la literatura señala las mayores distorsiones; sustituir Jarque-Bera por Shapiro-Wilk, la prueba de normalidad más común; aumentar el número de réplicas para estrechar las tasas; o sustituir las dos pruebas por una comparación de cuantiles, que responde a una pregunta distinta de la media o el rango. Cada variante debe anunciarse antes de leer y reportarse aunque invierta el veredicto.
13 · PROTOCOLO
Interpretación del resultado
El resultado no es la condena esperada. En las configuraciones aquí declaradas, la regla en dos etapas mantiene su nivel, y el estudio revisado por pares sellado junto a este dosier halló lo mismo, recordando a la vez que el procedimiento sigue siendo formalmente incorrecto. Ambos enunciados son ciertos a la vez: condicionar la elección de la prueba a los datos rompe la lógica de la prueba, y en estas configuraciones precisas el daño no se ve en el nivel global. Lo que sí se ve es la potencia perdida al aplicar una prueba de medias a datos asimétricos.
14 · PROTOCOLO
Conclusiones permitidas
Permitido: elegir la prueba a partir de la pregunta, el diseño muestral y la escala del resultado, antes de ver los datos; publicar el tamaño del efecto y su intervalo junto al valor p; decir que en este archivo los tres procedimientos coinciden; usar una prueba de rangos cuando la distribución es visiblemente asimétrica y la pregunta trata de un desplazamiento general más que de una media; y rehacer este tipo de simulación antes de adoptar una regla automática.
15 · PROTOCOLO
Conclusiones prohibidas
Prohibido: concluir de este dosier que la regla en dos etapas es correcta, cuando sigue siendo formalmente errónea y solo se probó en las configuraciones declaradas; generalizar estas tasas a varianzas desiguales o tamaños desiguales, que no se examinaron; elegir la prueba tras ver qué procedimiento da el valor p más bajo; presentar un valor p solo como resultado; o leer la ausencia de rechazo como prueba de ausencia de efecto. También prohibido: presentar este caso sintético como una medición observada.
16 · PROTOCOLO
Posible decisión de marketing
La decisión razonable es escribir la elección de la prueba en el protocolo, antes de la recogida, a partir de la pregunta planteada y del diseño muestral — y atenerse a ella. Si la distribución esperada es asimétrica, eso lleva aquí a la prueba de rangos, que detecta un tercio más de efectos. Si el equipo insiste en una diferencia de medias porque es la media la que tiene valor económico, mantiene Welch y acepta la menor potencia con conocimiento de causa. Lo que ninguna regla automática hará en su lugar es decidir cuál de las dos preguntas está planteando.
17 · PROTOCOLO
Cuándo usar o evitar el método
Usar este enfoque antes de fijar un procedimiento de análisis en un protocolo o en una herramienta. Evitarlo como medio para elegir una prueba a posteriori, que es precisamente lo que prohíbe. Evitarlo también cuando las unidades no son independientes — medidas repetidas, conglomerados, paneles — pues ninguno de los tres procedimientos examinados aquí lo tiene en cuenta. Y evitarlo cuando la pregunta trata de un efecto causal: la elección de la prueba no sustituye un diseño que identifique ese efecto.
18 · PROTOCOLO
Implementaciones y entregable final
El CSV CC0 contiene las 60 unidades sintéticas del archivo de trabajo. Python y R son las implementaciones de referencia; el bloque SPSS no es una reescritura sino que se genera a partir del cálculo de la referencia, de modo que ambos no pueden divergir; SAS reproduce la recurrencia declarada e implementa la prueba de rangos en un paso de datos, pero toma sus colas de distribución de sus propias funciones. El entregable final reúne los datos, el diccionario de variables, los tres procedimientos declarados, el nivel nominal, los tres escenarios, la recurrencia y su forma exacta en aritmética doble, la tolerancia, los siete pasos numerados, los resultados sobre el archivo de trabajo, las tasas de rechazo por escenario, la proporción de elección de cada prueba, las seis banderas, el veredicto y las versiones de software.
Datos sintéticos · CC0
msc-p039-two-group-outcome.csv ↓Protocolo reproducible
msc-p039-reproducibility-readme.md ↓Referencia Python · MIT
msc-p039-reference.py ↓Referencia R · MIT
msc-p039-reference.R ↓Implementación SPSS · MIT
msc-p039-secondary.sps ↓Implementación SAS · MIT
msc-p039-secondary.sas ↓19 · PROTOCOLO
Fuentes y nivel de evidencia
Rochon, Gondan y Kieser describen exactamente la regla aquí examinada — el resultado de la prueba preliminar determina el método usado después —, constatan que esa prueba preliminar altera seriamente el error condicional, concluyen que el procedimiento en dos etapas puede juzgarse incorrecto desde un punto de vista formal, y observan no obstante que pareció mantener el nivel nominal de forma satisfactoria. Greenland y coautores recuerdan que todo método de inferencia descansa en una red compleja de supuestos, y que un valor p muy pequeño no dice cuál es falso. Lakens recuerda que el tamaño del efecto es el resultado más importante de un estudio empírico. Rousselet, Pernet y Wilcox recuerdan que resumir una distribución por su media es una elección, no una evidencia. Referencias fundacionales: Rochon, Gondan y Kieser (2012, BMC Medical Research Methodology, acceso abierto CC BY, con revisión) y Greenland et al. (2016, European Journal of Epidemiology, acceso abierto, con revisión). Desarrollos recientes: Lakens (2013, Frontiers in Psychology, acceso abierto CC BY, con revisión) y Rousselet, Pernet y Wilcox (2017, manuscrito aceptado depositado en la universidad de Edimburgo; publicado en European Journal of Neuroscience, con revisión).
- Rochon, Gondan & Kieser (2012) Texto completo verificado, con extracto breve localizado en la fuente.
- Greenland et al. (2016) Texto completo verificado, con extracto breve localizado en la fuente.
- Lakens (2013) Texto completo verificado, con extracto breve localizado en la fuente.
- Rousselet, Pernet & Wilcox (2017) Texto completo verificado, con extracto breve localizado en la fuente.
Conexiones metodológicas

