Efectos fijos o aleatorios: ¿qué modelo de panel elegir?
Efectos fijos, aleatorios estándar y CRE/Mundlak no responden la misma pregunta. La elección depende del estimando within o between, la ortogonalidad y la estructura de errores, no de un test automático.
Respuesta directa
Separar la asociación intraentidad de la asociación entre entidades y elegir una especificación alineada con la decisión.
Efectos fijos, aleatorios estándar y CRE/Mundlak no responden la misma pregunta. La elección depende del estimando within o between, la ortogonalidad y la estructura de errores, no de un test automático.
01
La respuesta en 30 segundos
1
Los efectos fijos estiman una asociación intraunidad a partir de cambios dentro de cada entidad.
2
Los efectos aleatorios estándar combinan variación intra y entre unidades bajo una ortogonalidad más fuerte.
3
El modelo CRE/Mundlak separa ambos contrastes. Suele informar más que una elección automática basada en Hausman.
02
Tres niveles de lectura
- 1
Responsable: pregunte si la decisión trata un cambio en la misma tienda o diferencias persistentes entre tiendas.
- 2
Profesional: verifique identificador, tiempo, variación within, faltantes y nivel de agrupación de los errores estándar.
- 3
Analista: fije el estimando, declare los supuestos FE, RE y CRE y compare coeficientes, incertidumbre y residuos.
03
Situación de marketing concreta
Una red sigue 12 tiendas durante 8 semanas. Para cada tienda-semana observa la proporción expuesta a display y los pedidos por 1.000 visitas. Algunas tiendas tienen persistentemente más display y menos pedidos. La pregunta operativa trata lo que acompaña un aumento de display dentro de la misma tienda.
04
Pregunta científica y estimando
Unidad: tienda × semana. Estimando principal: coeficiente within βW, cambio medio de pedidos por 1.000 visitas asociado con +1 punto de display dentro de la misma tienda. Estimando secundario: coeficiente between βB entre medias de tiendas. Son asociaciones de panel, no efectos causales identificados.
βW = Cov(xit − x̄i, yit − ȳi) / Var(xit − x̄i)05
Por qué el modelo simple puede engañar
- Una regresión agrupada puede confundir cambios dentro de una tienda con diferencias estructurales entre tiendas.
- El RE estándar se vuelve una mezcla difícil de interpretar cuando difieren las asociaciones within y between.
- Los errores estándar agrupados tratan la dependencia residual, no el sesgo de identificación.
06
Intuición: separar within y between
Descomponer xit en la media de tienda x̄i y la desviación xit − x̄i hace visibles ambas preguntas. Within compara una tienda consigo misma. Between compara tiendas persistentemente distintas. RE estándar impone igualdad; CRE/Mundlak las estima por separado.
xit = (xit − x̄i) + x̄i07
Datos necesarios
- Una fila por entidad y periodo, con identificador estable, fecha o periodo, resultado y predictores variables.
- Suficiente variación intraentidad y suficientes entidades para una incertidumbre agrupada defendible.
- Cronología, abandono, cambios de definición y valores faltantes documentados antes de estimar.
08
Tres modelos, tres supuestos
Efectos fijos
yit − ȳi = βW(xit − x̄i) + (εit − ε̄i)El ejemplo es FE unidireccional de tienda. Absorbe heterogeneidad estable de tienda, no shocks comunes de semana.
RE estándar
yit = α + βRE xit + ui + εitSupone E[ui|Xi]=0 y un coeficiente común within y between.
CRE / Mundlak
yit = α + βW(xit−x̄i) + βB x̄i + ai + εitSepara ambos contrastes y permite una prueba de Wald de βB−βW=0 con covarianza declarada. El ejemplo no ejecuta esa prueba.
i indexa tienda, t semana, y pedidos por 1.000 visitas, x cuota de display, x̄i y ȳi medias de tienda, α intercepto, ui o ai heterogeneidad estable, εit shock idiosincrático, βW contraste within y βB contraste between. FE bidireccional añade λt, efecto semanal; βW usa variación neta de shocks semanales comunes.
Two-way FE: yit = αi + λt + βW xit + εit09
Cálculo declarado, paso a paso
- 01
Calcular x̄i y ȳi por tienda y luego las desviaciones within.
- 02
Estimar βW con variables centradas y agrupar la incertidumbre por tienda.
- 03
Estimar βB sobre medias de tiendas y RE estándar mediante cuasicentrado GLS.
- 04
Estimar CRE con desviación within y media; comparar βW, βB, βRE e incertidumbre.
10
Ejemplo numérico completo
MSC-P-021-PANEL
Dataset sintético creado para el aprendizaje. No describe ninguna red real de tiendas.
| Especificación | Coeficiente | Lectura |
|---|---|---|
| Agrupada | −1,140 | Mezcla within/between |
| Efectos fijos | −0,600 | Asociación within |
| Entre unidades | −1,200 | Asociación entre medias |
| RE estándar | −0,689 | Estimador de momentos Python declarado |
| CRE / Mundlak | βW=−0,600; βB=−1,200 | Contrastes separados |
βW
−0,600
EE agrupado
0,023
Intervalo t del 95%, gl=11
[−0,651; −0,549]
Convención didáctica declarada: sandwich por tienda, corrección finita G/(G−1), valor crítico t(11)=2,200985. Con solo 12 grupos, el intervalo ilustra el cálculo declarado pero no garantiza inferencia fiable en muestras pequeñas. No cubre sesgo de identificación.
11
Supuestos de validez
- FE: exogeneidad estricta del error idiosincrático condicionada al historial de predictores, más variación within suficiente.
- RE estándar: la misma condición, más ortogonalidad entre el efecto estable de entidad y los predictores.
- CRE/Mundlak: la media de entidad representa adecuadamente la correlación entre heterogeneidad estable y predictores según la especificación declarada.
- Ninguno elimina automáticamente confusión variable en el tiempo, causalidad inversa, error de medición o anticipación.
Preguntas operativas: ¿display responde a shocks de pedidos pasados, actuales o anticipados? ¿Cambian a la vez precio, stock o tráfico? ¿Se excluyen tiendas sin variación? ¿La media de tienda representa suficientemente la correlación estable?
12
Diagnósticos e incertidumbre
01
Estructura observada: 96/96 filas completas, 12 tiendas × 8 semanas, panel equilibrado y ninguna tienda sin variación. Las desviaciones display within van de −3,5 a +3,5 puntos (DE poblacional 2,291). El coeficiente FE se identifica así con variación intratienda presente en todas las tiendas.
02
Incertidumbre: solo 12 grupos. El EE sandwich por tienda es 0,022972 con corrección G/(G−1); el intervalo t(11) es [−0,650562; −0,549438]. Ilustra esta convención pedagógica sin garantizar inferencia fiable con pocos grupos. El modelo con solo efectos de tienda no absorbe shocks semanales comunes.
03
Especificación: βB−βW=−0,600, por lo que la relación entre tiendas es dos veces más negativa que la relación within. CRE muestra la brecha, pero aquí no se ejecuta ninguna prueba de Wald. βRE=−0,689372 está más cerca de βW aunque sigue siendo una mezcla. Añadir efectos de semana es la sensibilidad mínima a shocks comunes; pendientes aleatorias y residuos deben examinarse con datos reales.
13
Interpretar los resultados
- βW=−0,600: en el dataset sintético, +1 punto de display dentro de la misma tienda se asocia con 0,6 pedidos menos por 1.000 visitas.
- βB=−1,200 responde otra pregunta: comparar tiendas con cuotas medias de display persistentemente distintas.
- βRE=−0,689 no es βW ni βB; combina ambos según la estructura de varianza estimada.
14
Conclusiones permitidas y prohibidas
Permitido
- Describir por separado asociaciones within y between.
- Mostrar qué supuesto añade RE estándar.
- Elegir una especificación alineada con la pregunta y documentar incertidumbre.
Prohibido
- Convertir Hausman en una regla automática FE o RE.
- Presentar βW como causal sin diseño ni supuestos de identificación adicionales.
- Creer que los efectos fijos eliminan toda endogeneidad.
15
Decisión de marketing posible
Para una decisión operativa dentro de tienda, priorice βW y su incertidumbre. Si también importan diferencias estructurales entre tiendas, informe βB o un CRE completo. Para interpretación causal, añada un diseño de identificación; el panel solo no basta.
16
Cuándo usar y cuándo no usar
01
FE: pregunta within, heterogeneidad estable posiblemente correlacionada, variables constantes no centrales.
02
RE estándar: solo si agrupar within/between y ortogonalidad es defendible.
03
CRE/Mundlak: cuando importan ambos niveles o debe examinarse explícitamente su igualdad.
17
Implementaciones reproducibles
Python 3.13 (biblioteca estándar) y R 4.5 (base R) son las dos implementaciones de referencia: mismo CSV, mismas fórmulas declaradas y mismos resultados esperados. SPSS 31 y SAS 9.4 son sintaxis nativas secundarias: muestran FE, RE y CRE, pero sus estimadores RE, componentes de varianza, covarianzas y grados de libertad no están certificados como equivalentes. βRE=−0,689372 pertenece al método de momentos de referencia.
Descargar el script Python de referenciaPython 3.13 · referencia
# Python 3.13, standard library only
python msc-p021-reference.py --csv msc-p021-panel.csv
# Expected: FE=-0.600000; RE=-0.689372; between=-1.200000R 4.5 · referencia
# R 4.5, base R only: exact companion to the Python reference
d <- read.csv("msc-p021-panel.csv")
G <- length(unique(d$store_id)); Tn <- 8
d$xbar <- ave(d$display_share_pct, d$store_id)
d$ybar <- ave(d$orders_per_1000, d$store_id)
d$xwithin <- d$display_share_pct - d$xbar
d$ywithin <- d$orders_per_1000 - d$ybar
pooled <- coef(lm(orders_per_1000 ~ display_share_pct, d))[2]
within <- sum(d$xwithin*d$ywithin)/sum(d$xwithin^2)
between_fit <- lm(ybar ~ xbar, unique(d[c("store_id","xbar","ybar")]))
between <- coef(between_fit)[2]
e <- d$ywithin - within*d$xwithin
sigma_e2 <- sum(e^2)/(G*(Tn-1)-1)
sigma_u2 <- max(0, sum(resid(between_fit)^2)/(G-2)-sigma_e2/Tn)
theta <- 1-sqrt(sigma_e2/(sigma_e2+Tn*sigma_u2))
re <- coef(lm(I(orders_per_1000-theta*ybar) ~ I(display_share_pct-theta*xbar), d))[2]
scores <- tapply(d$xwithin*e, d$store_id, sum)
cluster_se <- sqrt((G/(G-1))*sum(scores^2)/sum(d$xwithin^2)^2)
ci <- within + c(-1,1)*qt(.975, df=G-1)*cluster_se
c(pooled=pooled, within=within, between=between, re=re,
contextual=between-within, cluster_se=cluster_se, ci_low=ci[1], ci_high=ci[2])IBM SPSS Statistics 31 · secundaria
* IBM SPSS Statistics 31 — secondary native syntax, not numerically certified.
GET DATA /TYPE=TXT /FILE='msc-p021-panel.csv'
/DELCASE=LINE /DELIMITERS=',' /FIRSTCASE=2
/VARIABLES=store_id A3 week F2 display_share_pct F8.1 orders_per_1000 F8.1.
AGGREGATE OUTFILE=* MODE=ADDVARIABLES /BREAK=store_id
/xbar=MEAN(display_share_pct).
COMPUTE xwithin=display_share_pct-xbar.
UNIANOVA orders_per_1000 BY store_id WITH display_share_pct
/METHOD=SSTYPE(3) /DESIGN=store_id display_share_pct.
MIXED orders_per_1000 WITH display_share_pct
/FIXED=INTERCEPT display_share_pct | SSTYPE(3)
/RANDOM=INTERCEPT | SUBJECT(store_id) COVTYPE(VC) /METHOD=REML.
MIXED orders_per_1000 WITH xwithin xbar
/FIXED=INTERCEPT xwithin xbar /RANDOM=INTERCEPT | SUBJECT(store_id) COVTYPE(VC).SAS 9.4 · secundaria
/* SAS 9.4 — secondary native syntax, not numerically certified. */
proc import datafile="msc-p021-panel.csv" out=panel dbms=csv replace; guessingrows=max; run;
proc sql; create table cre as select *, mean(display_share_pct) as xbar
from panel group by store_id; quit;
data cre; set cre; xwithin=display_share_pct-xbar; run;
proc panel data=panel; id store_id week;
model orders_per_1000=display_share_pct / fixone;
model orders_per_1000=display_share_pct / ranone; run;
proc mixed data=cre method=reml;
class store_id; model orders_per_1000=xwithin xbar / solution;
random intercept / subject=store_id; run;Los cuatro bloques usan el mismo CSV y los mismos estimandos, no necesariamente el mismo algoritmo nativo. Ningún software valida exogeneidad, ausencia de confusión temporal ni alcance causal.
18
Entregable final esperado
- 01
Tabla de unidades, periodos, faltantes y variación within.
- 02
Resultados FE, RE estándar y CRE con estimandos, covarianza, intervalos y diagnósticos.
- 03
Conclusión escrita: qué es within, between, comprobable, no comprobable, permitido y prohibido.
19
Fuentes científicas y nivel de evidencia
- Hausman (1978)Artículo fundacional, prueba de especificación
Formaliza la comparación entre un estimador eficiente bajo la nula y otro consistente bajo una alternativa más amplia. No ofrece una regla operativa automática.
- Bell, Fairbrother & Jones (2019)Revisión metodológica y simulaciones
Distingue within y between, explica la mezcla de RE estándar, pendientes aleatorias y por qué Hausman no debe decidir solo.
- Wooldridge (2019)Teoría CRE para paneles equilibrados y desequilibrados
Establece la equivalencia del coeficiente within al añadir medias temporales y explicita las condiciones de exogeneidad.
Los tres textos completos fueron verificados y vinculados a afirmaciones precisas. Dataset, código y resultados son creaciones sintéticas MSC, sin validación empírica externa.
Conexiones metodológicas
