¿Qué clientes presentan la mayor probabilidad de abandono?
El churn se predice para una fecha de decisión y un horizonte fijos. La separación temporal, la prevención de fugas y la calibración importan tanto como la discriminación.
Redacción científica : Marketing Science Center
Respuesta directa
Priorizar una revisión humana según un riesgo probabilístico calibrado.
El churn se predice para una fecha de decisión y un horizonte fijos. La separación temporal, la prevención de fugas y la calibración importan tanto como la discriminación.
scikit-learn average_precision_scoreDimitriadis et al., 2023
01
Resumen operativo
Pregunta científica y alcance
¿Qué clientes presentan la mayor probabilidad de abandono?
Admisible
Priorizar una revisión humana según un riesgo probabilístico calibrado.
Prohibido
Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
02
Tres niveles de lectura
- 01
Responsable — Conectar el resultado con una decisión, un umbral útil y un coste de error declarados.
- 02
Profesional — Fijar población, unidad, horizonte, variables disponibles y regla de análisis antes del cálculo.
- 03
Analista — Reproducir el cálculo, cuantificar la incertidumbre y documentar diagnósticos, fallos y sensibilidad.
03
Situación de marketing concreta
El churn se predice para una fecha de decisión y un horizonte fijos. La separación temporal, la prevención de fugas y la calibración importan tanto como la discriminación.
04
Pregunta científica y alcance
¿Qué clientes presentan la mayor probabilidad de abandono?
Riesgo predictivo de baja en holdout temporal
Datos necesarios
Cliente × ventana de variables × horizonte
La población, la unidad de análisis, la fecha de origen y el horizonte deben declararse en el entregable. Sin ellos, el estimando cambia sin advertencia.
05
Por qué puede fallar un análisis simple
- Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
- Disponibilidad de variables al decidir
- Separación temporal
- Calibración
06
Intuición del método
El método no convierte automáticamente una asociación en evidencia. Vincula una pregunta declarada con un estimando, una especificación, datos compatibles y una regla de interpretación limitada.
Riesgo predictivo de baja en holdout temporal
07
Datos necesarios
Diccionario de símbolos científicos
p_i- Probabilidad prevista de baja del cliente i del holdout usando solo información disponible en la fecha de decisión. Unidad:
probabilidad· Tipo:número estrictamente entre 0 y 1· Función:entrada y_i- Resultado binario observado de baja del cliente i al horizonte fijo del holdout. Unidad:
binario· Tipo:0 o 1· Función:entrada Brier- Error cuadrático medio de probabilidad en el holdout temporal. Unidad:
probabilidad al cuadrado· Tipo:número no negativo· Función:salida log_loss- Media de la log-verosimilitud negativa de Bernoulli en el holdout temporal. Unidad:
nat por observación· Tipo:número no negativo· Función:salida calibration_gap- Probabilidad prevista media menos tasa observada; un valor negativo indica infrapredicción media con esta convención. Unidad:
probabilidad· Tipo:número en [−1, 1]· Función:salida AP_threshold- Precisión media no interpolada calculada sobre umbrales únicos con puntuaciones empatadas agrupadas; no es una PR-AUC genérica. Unidad:
proporción· Tipo:número en [0, 1]· Función:salida
Entradas exactas y selladas del motor
predicted_risk_1- Valor:
0.05· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_2- Valor:
0.10· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_3- Valor:
0.20· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_4- Valor:
0.30· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_5- Valor:
0.45· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_6- Valor:
0.60· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_7- Valor:
0.75· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético predicted_risk_8- Valor:
0.90· Unidad:probabilidad· Tipo:número· Estado de los datos:sintético outcome_1- Valor:
0· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_2- Valor:
0· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_3- Valor:
0· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_4- Valor:
1· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_5- Valor:
0· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_6- Valor:
1· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_7- Valor:
1· Unidad:binario· Tipo:entero· Estado de los datos:sintético outcome_8- Valor:
1· Unidad:binario· Tipo:entero· Estado de los datos:sintético temporal_holdout_declared- Valor:
1· Unidad:binario· Tipo:entero· Estado de los datos:parámetro declarado
08
Modelo formal
Modelo formal
temporal_holdout_declared = 1; Brier = mean((p_i−y_i)^2); log_loss = −mean(y_i×log(p_i)+(1−y_i)×log(1−p_i)); calibration_gap = mean(p_i)−mean(y_i); AP_threshold = grouped_average_precision(p_i, y_i)Afirmaciones respaldadas: MSC-P029-C01 · MSC-P029-C02 · MSC-P029-C03 · MSC-P029-C04 · MSC-P029-C05 · MSC-P029-C06 · MSC-P029-C07 · MSC-P029-C08 · MSC-P029-C09 · MSC-P029-C10
Pregunta científica y alcance
Riesgo predictivo de baja en holdout temporal
09
Cálculo declarado
- 01
Congelar el holdout temporal y validar probabilidades y resultados emparejados con ambas clases representadas.
- 02
Calcular Brier, pérdida logarítmica, precisión media agrupada por umbral y brecha de calibración predicción menos observación.
- 03
Informar discriminación y calibración por separado y etiquetar el minúsculo holdout sintético como insuficiente para despliegue o validación causal.
10
Ejemplo numérico o caso de aplicación
Ilustración sintética — valores didácticos, no observados — datos sintéticos o parámetros declarados; ninguna observación real
Entradas selladas
predicted_risk_1=0.05 [probabilidad]predicted_risk_2=0.10 [probabilidad]predicted_risk_3=0.20 [probabilidad]predicted_risk_4=0.30 [probabilidad]predicted_risk_5=0.45 [probabilidad]predicted_risk_6=0.60 [probabilidad]predicted_risk_7=0.75 [probabilidad]predicted_risk_8=0.90 [probabilidad]outcome_1=0 [binario]outcome_2=0 [binario]outcome_3=0 [binario]outcome_4=1 [binario]outcome_5=0 [binario]outcome_6=1 [binario]outcome_7=1 [binario]outcome_8=1 [binario]temporal_holdout_declared=1 [binario]
Resultados reproducibles
Brier=0.122188log_loss=0.385684threshold_grouped_average_precision=0.95mean_predicted_minus_observed=-0.08125
Dosier verificado: afirmaciones vinculadas a fuentes a nivel de pasaje, cálculo Python/R reproducido, límites explícitos y revisión científica independiente completada.
11
Supuestos de validez
- ¿Cada variable estaba disponible al tiempo de predicción declarado y el holdout es posterior en el tiempo?
- ¿Las puntuaciones empatadas se agrupan de forma coherente al calcular la precisión media?
- ¿Calibración, discriminación y utilidad decisional se evalúan por separado en una muestra suficientemente grande y representativa del despliegue?
12
Diagnósticos e incertidumbre
Diagnósticos e incertidumbre
Disponibilidad de variables al decidir · Separación temporal · Calibración · Discriminación · Utilidad decisional
Diagnóstico acotado
La convención de signo es predicción menos observación. La precisión media se agrupa por umbral y no es una PR-AUC genérica. Solo una ilustración sintética mínima.
Contrato explícito de incertidumbre · not_estimable_from_sealed_inputs
Método : Evaluación explícita de la no estimabilidad frente al esquema de entradas sellado.
Objetivo : Incertidumbre muestral de las métricas de calibración y discriminación del holdout.
Evidencia del motor : diagnostic=average_precision_is_threshold_grouped_not_generic_pr_auc_tiny_synthetic_holdout_not_deployment_validation_or_causal_effect
Interpretación : Ocho observaciones sintéticas de holdout son insuficientes para intervalos defendibles o incertidumbre por subgrupos.
Detenerse si
Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
13
Interpretación del resultado
- Priorizar una revisión humana según un riesgo probabilístico calibrado.
- El resultado está condicionado por la población, el horizonte, la especificación y los controles declarados. No debe extenderse a otra decisión sin nueva justificación.
14
Conclusión admisible y prohibida
Admisible
Priorizar una revisión humana según un riesgo probabilístico calibrado.
Prohibido
Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
15
Decisión de marketing posible
- 01
Priorizar una revisión humana según un riesgo probabilístico calibrado.
- 02
El resultado está condicionado por la población, el horizonte, la especificación y los controles declarados. No debe extenderse a otra decisión sin nueva justificación.
16
Cuándo usar — cuándo detenerse
Usar si
Priorizar una revisión humana según un riesgo probabilístico calibrado.
Cliente × ventana de variables × horizonte
Detenerse si
Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
Alternativas metodológicas
- Usar curvas de calibración con incertidumbre por rango de riesgo y subgrupo.
- Usar análisis ROC solo para preguntas de discriminación, no de calibración.
- Usar curvas de decisión o análisis de umbral sensible a costes cuando el objetivo sea la utilidad de la acción.
17
Contrato de reproducibilidad
Python y R son las referencias ejecutables. SPSS y SAS siguen siendo sintaxis secundarias hasta verificarse con los mismos datos, especificación y diagnósticos.
El motor selecciona únicamente el segmento y la rama explícita de esta página. Su hash, salidas y diagnósticos quedan sellados en el expediente atómico; no se permite ninguna rama genérica de respaldo.
Huella del segmento: 05348452a7d6e9c0921fab5459274f7d09e9ba76b92659dd05112935133f85f7
CSV · CC0
msc-validation-inputs-v1.csv ↓Python · MIT
msc-validation-reference-v1.py ↓R · MIT
msc-validation-reference-v1.R ↓SPSS / SAS · MIT · solo inspección
SPSS ↓SAS ↓Modelo formal
temporal_holdout_declared = 1; Brier = mean((p_i−y_i)^2); log_loss = −mean(y_i×log(p_i)+(1−y_i)×log(1−p_i)); calibration_gap = mean(p_i)−mean(y_i); AP_threshold = grouped_average_precision(p_i, y_i)Dosier verificado: afirmaciones vinculadas a fuentes a nivel de pasaje, cálculo Python/R reproducido, límites explícitos y revisión científica independiente completada.
18
Entregable final esperado
- 01
¿Qué clientes presentan la mayor probabilidad de abandono? —
Cliente × ventana de variables × horizonte - 02
p_i · y_i · Brier · log_loss · calibration_gap · AP_threshold
- 03
temporal_holdout_declared = 1; Brier = mean((p_i−y_i)^2); log_loss = −mean(y_i×log(p_i)+(1−y_i)×log(1−p_i)); calibration_gap = mean(p_i)−mean(y_i); AP_threshold = grouped_average_precision(p_i, y_i) - 04
Disponibilidad de variables al decidir · Separación temporal · Calibración · Discriminación · Utilidad decisional
- 05
Priorizar una revisión humana según un riesgo probabilístico calibrado. / Afirmar qué acción reducirá el churn solo a partir del modelo predictivo.
19
Fuentes científicas y estado de la evidencia
Dosier verificado: afirmaciones vinculadas a fuentes a nivel de pasaje, cálculo Python/R reproducido, límites explícitos y revisión científica independiente completada.
MSC-P029-C01— Las puntuaciones probabilísticas deben evaluarse en un conjunto de prueba declarado.MSC-P029-C02— La calibración concierne a la frecuencia observada del evento condicionada a la probabilidad prevista.MSC-P029-C03— La discriminación ROC no determina la calibración de probabilidades.MSC-P029-C04— Calibración y discriminación requieren diagnósticos distintos.MSC-P029-C05— Brier y logarítmica son reglas de puntuación probabilística propias.MSC-P029-C06— Los objetivos predictivos y causales cambian todo el proceso de modelización, no solo la métrica final.MSC-P029-C07— La precisión predictiva debe evaluarse en observaciones excluidas del ajuste.MSC-P029-C08— La AP informada usa precisión por umbral ponderada por incrementos de exhaustividad.MSC-P029-C09— La convención ejecutable es no interpolada.MSC-P029-C10— La precisión media no se etiqueta como PR-AUC trapezoidal genérica.
Conexiones metodológicas

