¿Cómo validar un pronóstico de marketing?
Un pronóstico se valida en periodos no usados para ajustar, con origen temporal realista, benchmark ingenuo y métrica acorde al coste del error.
Redacción científica: Marketing Science Center
Respuesta directa
Comparar modelos para un horizonte y coste de error declarados.
Un pronóstico se valida en periodos no usados para ajustar, con origen temporal realista, benchmark ingenuo y métrica acorde al coste del error.
01 · PROTOCOLO
Resumen operativo
Un modelo de pronóstico semanal se reajusta en trece orígenes sucesivos y luego se juzga sobre 52 semanas que nunca ha visto. Su error absoluto escalado vale 0,420792, frente a 1,039025 de un pronóstico ingenuo estacional: supera claramente el punto de comparación. Sus intervalos al 80 % contienen el resultado en 0,750000 de los casos, dentro de la tolerancia declarada de 0,10 pero del lado estrecho. Ambos controles pasan. Veredicto: FORECAST_READABLE_FOR_PLANNING.
02 · PROTOCOLO
Situación de marketing concreta
Un equipo debe comprometer existencias y presupuestos de medios con cuatro semanas de antelación. Dispone de un modelo que pronostica la facturación semanal y que, sobre el histórico, se ajusta notablemente bien a los datos. La pregunta que hay que hacerse antes de usarlo es simple: ¿cuándo se ha enfrentado ese modelo a semanas que no conocía, y qué ocurrió? Sin esa respuesta, la bondad de ajuste observada no dice nada sobre el uso previsto.
03 · PROTOCOLO
Pregunta científica
Para esta serie semanal, este modelo declarado, estos trece orígenes declarados y este horizonte de cuatro semanas, ¿es el error del modelo sobre semanas no usadas para ajustarlo inferior al de un pronóstico ingenuo estacional llevado a la misma escala? ¿Y sus intervalos al 80 % contienen el resultado tan a menudo como pretenden? Las dos preguntas son distintas y cada una recibe su respuesta: un pronóstico puntual acertado puede venir con una incertidumbre falsa.
04 · PROTOCOLO
Por qué puede fallar el enfoque simple
Juzgar un modelo sobre las semanas que sirvieron para ajustarlo siempre halaga: cuantos más parámetros se añaden, mejor parece el resultado, sin que se haya demostrado capacidad predictiva alguna. Tampoco basta dividir una sola vez el histórico en ajuste y prueba, porque la puntuación depende entonces del azar de una única frontera. Y reportar un error en euros sin punto de comparación no permite juzgar a nadie: 55 € de error medio es excelente o catastrófico según la serie.
05 · PROTOCOLO
Intuición del método
El método reproduce el uso real. Uno se sitúa en una fecha pasada, usa solo lo que se conocía ese día, pronostica las cuatro semanas siguientes, luego avanza cuatro semanas y vuelve a empezar. Trece veces. Cada error se divide después por una cantidad de referencia calculada sobre el solo pasado disponible en esa fecha: el error que habría cometido un pronóstico ingenuo estacional. Un valor inferior a uno significa que el modelo lo hizo mejor que esa regla simple. En paralelo se cuenta cuántas veces el intervalo anunciado contuvo realmente el resultado.
06 · PROTOCOLO
Datos necesarios
Se fijan antes de cualquier lectura: la numeración de semanas sin huecos, la facturación semanal, la forma del modelo (constante, tendencia lineal y dos armónicos anuales), el periodo estacional de 52 semanas, los trece orígenes de 104 a 152 con paso 4, el horizonte de 4 semanas, el pronóstico ingenuo estacional como punto de comparación, la cantidad de escala, el nivel nominal de 0,80, el cuantil 1,281552 y los dos umbrales. El archivo sellado contiene 156 semanas. El caso es sintético y así se declara.
07 · PROTOCOLO
Modelo formal y símbolos
En cada origen, el modelo ajusta por mínimos cuadrados una constante, una tendencia lineal y dos armónicos anuales, o sea seis parámetros, sobre las solas semanas anteriores al origen. El error absoluto escalado divide cada error fuera de muestra por la media de las diferencias absolutas a 52 semanas observadas en esa misma ventana. El intervalo tiene como semiamplitud 1,281552 veces la desviación típica residual del ajuste, siendo ese cuantil el de la ley normal estándar en 0,90. La puntuación de intervalo añade a la anchura una penalización proporcional a cualquier rebasamiento, dividida por el riesgo aceptado.
08 · PROTOCOLO
Cálculo declarado
El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme o demasiado corto para el plan de validación; en cada origen, construir la matriz de diseño sobre las solas semanas anteriores; resolver las ecuaciones normales por eliminación de Gauss con pivote parcial, rechazar una ventana singular y calcular la desviación típica residual restando los seis parámetros de los grados de libertad; calcular la escala estacional sobre la misma ventana y rechazar una escala nula; para cada uno de los cuatro horizontes, registrar el error absoluto, el error escalado, el del pronóstico ingenuo, la pertenencia al intervalo, la anchura y la puntuación; promediar sobre los 52 pronósticos y luego por horizonte; aplicar los dos umbrales declarados y la regla del veredicto.
09 · PROTOCOLO
Ejemplo numérico completo
Ilustración sintética — valores didácticos, no observados
En el archivo sellado: 156 semanas, 13 orígenes de la semana 104 a la 152, horizonte 4, o sea 52 pronósticos fuera de muestra. Error absoluto escalado del modelo 0,420792, frente a 1,039025 del pronóstico ingenuo estacional; error absoluto medio 54,912955 unidades monetarias; control de exactitud superado. Por horizonte: 0,418133, 0,520418, 0,279945 y 0,464672. Nivel nominal 0,80, cobertura observada 0,750000, anchura media 168,860643 y puntuación de intervalo media 243,378776; control de calibración superado. Veredicto: FORECAST_READABLE_FOR_PLANNING.
10 · PROTOCOLO
Supuestos de validez
La validación supone que el mecanismo que produjo las semanas pasadas sigue siendo el que producirá las futuras, que el periodo estacional es realmente de 52 semanas y que los valores históricos no se revisaron a posteriori. Supone además, para los intervalos, que los residuos se comportan como un ruido normal de varianza constante. Tres cosas no son comprobables aquí: la ausencia de un futuro cambio de régimen, el efecto de un canal o de un precio que nunca varió en el histórico, y la calidad de los datos en el momento en que el pronóstico se produzca realmente.
11 · PROTOCOLO
Diagnósticos e incertidumbre
Dos reservas merecen leerse antes del veredicto. La cobertura observada vale 0,750000 para un nivel anunciado de 0,80: la diferencia se mantiene dentro de la tolerancia declarada, pero los intervalos están del lado estrecho, que es exactamente lo que cabe esperar de intervalos construidos sobre la sola dispersión residual, sin tener en cuenta la incertidumbre sobre los parámetros ni su crecimiento con el horizonte. Y los errores por horizonte — 0,418133, 0,520418, 0,279945, 0,464672 — no aumentan de forma regular con el horizonte: con trece pronósticos por horizonte ese perfil es ruido, y no se les asocia ningún umbral.
12 · PROTOCOLO
Robustez y alternativas
Alternativas declaradas antes del resultado: sustituir los intervalos normales por intervalos construidos sobre los cuantiles empíricos de los errores fuera de muestra, uno por horizonte; añadir al punto de comparación un paseo aleatorio simple, más difícil de batir sin estacionalidad; alargar el horizonte hasta trece semanas para ver dónde desaparece la ventaja del modelo; o rehacer el ejercicio con un modelo más simple, sin armónico de orden dos. Cada variante debe anunciarse antes de leer y reportarse aunque degrade el veredicto.
13 · PROTOCOLO
Interpretación del resultado
El modelo pronostica mejor que una regla simple, y con holgura: su error vale menos de media unidad, mientras que el pronóstico ingenuo estacional supera uno, es decir lo hace peor fuera de muestra que sobre su propio pasado. Pero esa comparación vale lo que vale el punto de comparación: batir a un ingenuo estacional en una serie con tendencia visible no es una prueba exigente. El resultado utilizable es por tanto modesto y preciso: en esta serie y este horizonte, este modelo produjo pronósticos utilizables e intervalos apenas demasiado estrechos.
14 · PROTOCOLO
Conclusiones permitidas
Permitido: usar este modelo para planificar a cuatro semanas en esta serie; publicar el error escalado junto con el del punto de comparación, nunca uno sin el otro; anunciar los intervalos al 80 % señalando que en la práctica cubren algo menos; repetir esta misma validación cada trimestre para vigilar una deriva; y exigir el mismo protocolo a cualquier proveedor de pronósticos. También permitido: decir que este resultado vale para este horizonte, y rehacer el examen si el horizonte cambia.
15 · PROTOCOLO
Conclusiones prohibidas
Prohibido: presentar 0,420792 como una precisión garantizada para las semanas venideras; anunciar los intervalos al 80 % sin mencionar que cubrieron 0,750000; concluir que un modelo validado seguirá siendo válido tras un cambio de precio, canal o competencia; comparar este error escalado con el de otra serie sin volver a verificar que el punto de comparación es el mismo; o elegir el número de orígenes y el horizonte tras ver los resultados. También prohibido: presentar este caso sintético como una medición observada.
16 · PROTOCOLO
Posible decisión de marketing
La decisión razonable es comprometer el plan a cuatro semanas con este modelo, pero dimensionar el stock de seguridad sobre la cobertura observada y no sobre la anunciada, ya que los intervalos resultaron algo estrechos. La validación se repite luego cada trimestre con el mismo protocolo, sin modificarlo, de modo que un deterioro aparezca como deterioro y no como un cambio de regla. Ninguno de estos pasos se automatiza sin alguien que lea las dos banderas.
17 · PROTOCOLO
Cuándo usar o evitar el método
Usar este protocolo antes de toda puesta en producción de un pronóstico, y a intervalos regulares después. Evitarlo cuando el histórico es demasiado corto para obtener varios orígenes, cuando los valores pasados se revisaron tras su publicación, o cuando la serie acaba de sufrir una ruptura visible: en este último caso la validación mide un régimen que ya no existe. Evitarlo también como respuesta a la pregunta del efecto de una acción, que compete a un experimento y no a un pronóstico.
18 · PROTOCOLO
Implementaciones y entregable final
El CSV CC0 contiene las 156 semanas sintéticas. Python y R son las implementaciones de referencia; SPSS retoma el mismo cálculo en un bloque Python; SAS emplea el mismo diseño y los mismos orígenes pero confía el ajuste a su propio procedimiento de regresión, y verifica las dos banderas en vez de cada decimal. El entregable final reúne los datos, el diccionario de variables, la forma del modelo declarada, los orígenes y el horizonte, el punto de comparación, la cantidad de escala, el nivel nominal y el cuantil, los dos umbrales, los siete pasos numerados, el error escalado del modelo y del punto de comparación, los errores por horizonte, la cobertura, la anchura, la puntuación de intervalo, las dos banderas, el veredicto y las versiones de software.
Datos sintéticos · CC0
msc-p033-weekly-series.csv ↓Protocolo reproducible
msc-p033-reproducibility-readme.md ↓Referencia Python · MIT
msc-p033-reference.py ↓Referencia R · MIT
msc-p033-reference.R ↓Implementación SPSS · MIT
msc-p033-secondary.sps ↓Implementación SAS · MIT
msc-p033-secondary.sas ↓19 · PROTOCOLO
Fuentes y nivel de evidencia
Hyndman y Koehler proponen el error absoluto escalado como medida estándar de comparación, recuerdan que un valor superior a uno señala pronósticos peores en promedio, y muestran que muchas medidas corrientes no son aplicables en general. Hyndman y Khandakar recuerdan que los errores fuera de muestra suelen ser demasiado pocos para concluir, y que dos modelos pueden dar los mismos pronósticos puntuales con intervalos distintos. Makridakis, Spiliotis y Assimakopoulos señalan la frecuente ausencia de un punto de comparación y la brecha entre bondad de ajuste y exactitud fuera de muestra. Petropoulos y coautores describen el paso de un origen fijo a uno deslizante, la puntuación de intervalo como medida apropiada, y el hecho de que los intervalos publicados son demasiado estrechos. Referencias fundacionales: Hyndman y Koehler (2006, International Journal of Forecasting, con revisión por pares) y Hyndman y Khandakar (2008, Journal of Statistical Software, acceso abierto CC BY, con revisión). Desarrollos recientes: Makridakis, Spiliotis y Assimakopoulos (2018, PLOS ONE, acceso abierto CC BY, con revisión) y Petropoulos et al. (2022, preprint en arXiv; publicado en el International Journal of Forecasting, con revisión).
- Hyndman & Koehler (2006) Texto completo verificado, con extracto breve localizado en la fuente.
- Hyndman & Khandakar (2008) Texto completo verificado, con extracto breve localizado en la fuente.
- Makridakis, Spiliotis & Assimakopoulos (2018) Texto completo verificado, con extracto breve localizado en la fuente.
- Petropoulos et al. (2022) Texto completo verificado, con extracto breve localizado en la fuente.
Conexiones metodológicas

