Logit vs Probit: ¿cómo elegir para una probabilidad de compra?
Compare ambos enlaces con los mismos datos: probabilidades, efectos marginales, calibración, Brier, log-loss, AUC y colas. Los coeficientes brutos están en escalas distintas.
Respuesta directa
Elegir un enlace usando probabilidades, diagnósticos holdout, necesidades de interpretación y umbrales.
Compare ambos enlaces con los mismos datos: probabilidades, efectos marginales, calibración, Brier, log-loss, AUC y colas. Los coeficientes brutos están en escalas distintas.
01
La respuesta en 30 segundos
1
Logit y Probit modelizan una probabilidad binaria a partir del mismo predictor lineal. El primero usa la función logística y el segundo la normal acumulada.
2
Sus coeficientes brutos no son directamente comparables porque cambia la escala latente. Compare probabilidades predichas, efectos marginales y rendimiento en las mismas observaciones.
3
En el ejemplo sintético, ambos enlaces producen casi el mismo efecto marginal medio y puntuaciones holdout muy próximas. Esto no demuestra intercambiabilidad universal.
Amemiya (1975), Qualitative Response Models Gündüz & Fokoué (2015)
02
Tres niveles de lectura
- 1
Responsable: pregunte si el enlace cambia una probabilidad, un segmento o una decisión en un umbral relevante.
- 2
Profesional: mantenga iguales datos, variables, separación entrenamiento-prueba y métricas para ambos modelos.
- 3
Analista: distinga escala del coeficiente, efecto marginal sobre la probabilidad, calibración, discriminación y puntuación propia.
03
Situación de marketing concreta
Un equipo CRM quiere estimar la probabilidad de compra a 30 días según interacción previa, descuento mostrado y dispositivo móvil. Duda entre Logit y Probit. La pregunta útil no es «¿qué coeficiente es mayor?», sino «¿probabilidades, efectos marginales y diagnósticos fuera de muestra conducen a decisiones distintas?»
04
Pregunta científica y estimando
Población objetivo: clientes elegibles representados por 1.200 observaciones sintéticas. Unidad: un cliente. Resultado Y: compra en 30 días. Comparación predictiva, no causal. Estimandos: P(Y=1|X) y efecto marginal medio de la interacción, promediado sobre los 400 perfiles del holdout. Las primeras 800 filas se usan para estimar.
P(Y=1|X=x) · AME engagement on holdout X05
Por qué falla una comparación superficial
- Comparar 0,991 con el coeficiente Probit 0,596 confunde efecto y normalización de la escala latente.
- Elegir solo por el AIC de entrenamiento ignora calibración y generalización fuera de muestra.
- Comparar solo el AUC ignora la calibración, porque el AUC refleja el orden, no el nivel exacto de las probabilidades.
06
Qué cambia realmente entre Logit y Probit
| Dimensión | Logit | Probit | Comparación útil |
|---|---|---|---|
| Link | log[p/(1−p)] | Φ⁻¹(p) | Probabilidad predicha |
| β | Escala log-odds | Escala normal latente | No comparar magnitudes brutas |
| AME | Cambio medio de probabilidad sobre X | Comparable en la escala de probabilidad | |
07
Datos necesarios
- purchase vale 1 para una compra en 30 días y 0 en caso contrario. Una fila representa un cliente.
- prior_engagement_z se extrae de N(0,1) y se conserva sin reestandarizar tras el muestreo. Una unidad pertenece a esta escala generadora.
- discount_pct toma 0, 5, 10, 15 o 20%. El modelo usa discount10 = discount_pct / 10, por lo que una unidad equivale a 10 puntos de descuento.
- mobile vale 1 para un dispositivo móvil y 0 en caso contrario. split es train para 800 filas y holdout para 400.
08
Modelo formal y símbolos
AMEₖ = n⁻¹ Σᵢ f(ηᵢ)βₖ, f = Λ(ηᵢ)[1−Λ(ηᵢ)] or φ(ηᵢ)Predictor común
ηᵢ = β₀ + β₁ engagementᵢ + β₂ discount10ᵢ + β₃ mobileᵢi indexa un cliente; n=400 perfiles holdout fijos. β se estima por máxima verosimilitud en 800 filas de entrenamiento.
Logit
pᵢ = Λ(ηᵢ) = 1 / (1 + exp(−ηᵢ))Λ es la CDF logística y f su densidad. Un coeficiente desplaza los log-odds, no la probabilidad en una constante.
Probit
pᵢ = Φ(ηᵢ)Φ es la CDF normal estándar y φ su densidad. El coeficiente vive en otra escala latente.
Para la interacción, el AME es la derivada local media de la probabilidad por unidad de la escala generadora, en puntos porcentuales. No es el cambio finito de X a X+1.
Nelder & Wedderburn (1972) Hill, Griffiths & Lim (2018), chapter 16
09
Cálculo declarado, paso a paso
- 01
Fijar la muestra: 800 filas de entrenamiento y 400 holdout.
- 02
Ajustar ambos enlaces con el mismo resultado, predictores e intercepto.
- 03
Calcular probabilidades holdout y luego Brier, log-loss, AUC y calibración global.
- 04
Calcular el AME de interacción sobre los 400 perfiles fijos y su IC delta del 95% con la covarianza de Fisher estimada en entrenamiento.
- 05
Examinar dos perfiles de cola y verificar si un umbral de negocio cambia de lado.
Nelder & Wedderburn (1972) Hill, Griffiths & Lim (2018), chapter 16 Dimitriadis et al. (2023)
10
Ejemplo numérico completo
Dataset sintético creado para el aprendizaje. No describe ninguna campaña real.
Semilla 20260819. El resultado se genera mediante un proceso logístico didáctico, sin conclusión universal ni afirmación real.
| Métrica | Logit | Probit |
|---|---|---|
| β engagement | 0.991442 | 0.596133 |
| AME engagement | 19.8738 pp | 19.8780 pp |
| 95% CI AME | [17.1598; 22.5878] pp | [17.1767; 22.5794] pp |
| Brier | 0.175319 | 0.175367 |
| Log-loss | 0.527456 | 0.527414 |
| AUC | 0.809401 | 0.809743 |
| Calibration p̄−ȳ | +0.006011 | +0.006850 |
| p(engagement=−2) | 0.084485 | 0.076382 |
| p(engagement=+2) | 0.829609 | 0.830134 |
Los perfiles de cola fijan discount_pct=10, discount10=1 y mobile=1; solo cambia la interacción entre los valores −2 y +2 de la escala generadora.
Descargar el CSV sintéticoLectura: las diferencias son mínimas en este holdout; el perfil en −2 difiere 0,81 puntos. La incertidumbre se informa para el AME, no para cada diferencia.
El intervalo del AME condiciona en los 400 perfiles holdout observados y usa la covarianza de Fisher estimada sobre 800 filas. No cuantifica la incertidumbre de la distribución de perfiles ni de las diferencias entre métricas.
11
Supuestos de validez
- Especificación: el mismo predictor lineal contiene variables y transformaciones pertinentes para cada enlace.
- Independencia para la inferencia mostrada: sin agrupación residual por hogar, tienda o campaña. En caso contrario, adaptar la incertidumbre.
- Solapamiento: sin separación perfecta ni perfiles fuera del soporte de entrenamiento.
- La forma real del enlace y la transportabilidad a otro periodo no se demuestran solo con el ajuste.
12
Diagnósticos e incertidumbre
Estimación
Ambos convergen en 6 y 8 iteraciones. El script estándar no calcula separación ni influencia; estos diagnósticos siguen siendo necesarios antes del uso operativo.
Calidad probabilística
Brier y log-loss resumen precisión; la calibración global muestra sobrepredicción de 0,60 y 0,69 puntos.
Discriminación e incertidumbre
El AUC ronda 0,81 pero no evalúa calibración. Los IC delta de AME casi coinciden; no es una prueba de equivalencia.
13
Interpretar los resultados
- La razón 0,991/0,596 refleja sobre todo escala, no un efecto casi doble.
- Los AME de 19,87 y 19,88 puntos son numéricamente muy próximos en la escala de probabilidad de este soporte.
- Ningún modelo domina todas las métricas: Logit tiene Brier algo menor, Probit log-loss y AUC algo mejores.
14
Conclusiones permitidas y prohibidas
Permitido
- Afirmar que en este holdout sintético las probabilidades y efectos marginales Logit y Probit son muy próximos.
- Preferir provisionalmente Logit para interpretar odds ratios, o conservar Probit si se justifica una representación normal latente.
Prohibido
- Deducir que un coeficiente mayor implica un efecto de marketing más fuerte entre enlaces.
- Presentar la asociación predictiva de la interacción como efecto causal de una intervención.
- Generalizar la pequeña diferencia de este ejemplo a cualquier muestra, especificación, clase rara o cola.
15
Decisión de marketing posible
Para este expediente, la responsable puede conservar Logit como modelo de trabajo porque las estimaciones puntuales son muy próximas en este holdout y los odds ratios facilitan la comunicación. No es una prueba de equivalencia. La comparación de probabilidades y una regla de reevaluación siguen siendo necesarias si cambian población, rareza o umbrales.
16
Cuándo usar y cuándo no usar
Usar
Usar Logit o Probit para un resultado binario cuando la probabilidad condicional y sus diagnósticos son el objetivo.
No usar solo
No usarlos solos para identificar un efecto causal, manejar dependencia longitudinal o modelizar tiempo hasta evento.
Alternativas
Alternativas: complementary log-log para asimetría justificada, modelos mixtos o GEE para dependencia, supervivencia para tiempos y métodos causales para intervenciones.
17
Implementaciones reproducibles
Python 3.13.7 · standard library · referencia
python msc-p026-reference.py --csv msc-p026-logit-probit.csv
# rows=1200 train=800 holdout=400
# Fits Logit and Probit by Fisher scoring.
# Reports AME delta-method CI, Brier, log-loss, AUC, calibration and declared tail profiles.R 4.5.1 · stats/utils · referencia
# R 4.5.1, base stats/utils only
d <- read.csv("msc-p026-logit-probit.csv")
train <- subset(d, split == "train")
holdout <- subset(d, split == "holdout")
formula <- purchase ~ prior_engagement_z + I(discount_pct/10) + mobile
auc <- function(y, p) mean(outer(p[y==1], p[y==0], ">") + .5*outer(p[y==1], p[y==0], "=="))
for (link in c("logit", "probit")) {
fit <- glm(formula, data=train, family=binomial(link=link))
eta <- predict(fit, newdata=holdout, type="link")
p <- predict(fit, newdata=holdout, type="response")
dmu <- if (link == "logit") p*(1-p) else dnorm(eta)
ame <- mean(dmu*coef(fit)["prior_engagement_z"])
ame_fun <- function(b) {
e <- model.matrix(formula, holdout) %*% b
mean((if (link=="logit") plogis(e)*(1-plogis(e)) else dnorm(e))*b[2])
}
eps <- 1e-5; b <- coef(fit)
grad <- sapply(seq_along(b), function(j) {u<-v<-b;u[j]<-u[j]+eps;v[j]<-v[j]-eps;(ame_fun(u)-ame_fun(v))/(2*eps)})
se <- sqrt(drop(t(grad) %*% vcov(fit) %*% grad))
print(c(link=link, AME=ame, low=ame-1.959964*se, high=ame+1.959964*se,
Brier=mean((p-holdout$purchase)^2), LogLoss=-mean(holdout$purchase*log(p)+(1-holdout$purchase)*log(1-p)),
AUC=auc(holdout$purchase,p), Calibration=mean(p)-mean(holdout$purchase)))
}IBM SPSS Statistics 31.0.0.0 · secundaria
* IBM SPSS Statistics 31, secondary fit syntax.
GET DATA /TYPE=TXT /FILE='msc-p026-logit-probit.csv' /FIRSTCASE=2
/DELIMITERS=',' /VARIABLES=customer_id A5 split A7
prior_engagement_z F10.6 discount_pct F2.0 mobile F1.0 purchase F1.0.
COMPUTE discount_10=discount_pct/10.
TEMPORARY. SELECT IF split='train'.
GENLIN purchase (REFERENCE=FIRST) WITH prior_engagement_z discount_10 mobile
/MODEL prior_engagement_z discount_10 mobile INTERCEPT=YES DISTRIBUTION=BINOMIAL LINK=LOGIT.
TEMPORARY. SELECT IF split='train'.
GENLIN purchase (REFERENCE=FIRST) WITH prior_engagement_z discount_10 mobile
/MODEL prior_engagement_z discount_10 mobile INTERCEPT=YES DISTRIBUTION=BINOMIAL LINK=PROBIT.
* Use a saved model or OMS workflow to score the unchanged holdout.SAS 9.4 TS1M8 · secundaria
/* SAS 9.4 TS1M8, secondary fit syntax */
proc import datafile='msc-p026-logit-probit.csv' out=d dbms=csv replace; guessingrows=max; run;
data d; set d; discount_10=discount_pct/10; run;
proc logistic data=d(where=(split='train'));
model purchase(event='1')=prior_engagement_z discount_10 mobile / link=logit;
run;
proc logistic data=d(where=(split='train'));
model purchase(event='1')=prior_engagement_z discount_10 mobile / link=probit;
run;
/* Score the same holdout and compute Brier, log-loss, AUC and calibration separately. */Python es la referencia numéricamente verificada. R replica modelos y métricas. SPSS y SAS son sintaxis secundarias; el scoring holdout y el informe deben completarse y verificarse localmente.
18
Entregable final esperado
- 01
Pregunta, población, unidad, horizonte, resultado binario y predictores fechados.
- 02
Separación entrenamiento-holdout, preprocesamiento y especificaciones idénticas.
- 03
Coeficientes en su propia escala, probabilidades, efectos marginales con IC, convergencia y separación.
- 04
Brier, log-loss, AUC, calibración, perfiles de cola y umbrales en el mismo holdout.
- 05
Conclusión permitida, conclusión prohibida, elección humana y regla de reevaluación.
19
Fuentes científicas y nivel de evidencia
- Amemiya (1975), Qualitative Response ModelsArtículo fundacional, texto completo verificado
Define modelos binarios y formas normal y logística. Indica estimaciones a menudo próximas salvo un factor multiplicativo. No demuestra equivalencia universal.
- Gündüz & Fokoué (2015)Comparación teórica y computacional, texto completo verificado
Documenta similitud central, diferencias en colas y comparaciones predictivas. Los resultados dependen de definiciones y contextos; la conclusión queda acotada.
- Dimitriadis et al. (2023)Artículo metodológico sobre evaluación probabilística, texto completo verificado
Separa calibración, discriminación y rendimiento global y define Brier y log score. No decide qué enlace conviene a una población de marketing.
- Nelder & Wedderburn (1972)Fundamento de modelos lineales generalizados, texto completo verificado
Establece la regresión ponderada iterativa para estimar por máxima verosimilitud modelos lineales generalizados, incluidas respuestas binarias.
- Hill, Griffiths & Lim (2018), chapter 16Capítulo de referencia econométrica, texto completo verificado
Define efectos marginales continuos, su promedio muestral y la incertidumbre delta. El intervalo mostrado queda condicionado al diseño declarado.
Dataset · Herramienta
Conexiones metodológicas
