Research & Evidence

Buscar un método

Busca entre títulos, preguntas, territorios e identificadores MSC.

41 resultados
  1. MSC-P-001¿Cómo transformar una afirmación de marketing en una pregunta comprobable?Ciencia de la decisión↗
  2. MSC-P-002Correlación o causalidad: ¿qué permite afirmar realmente un análisis?Medición de marketing↗
  3. MSC-P-003¿Cómo expresar la incertidumbre de un resultado de marketing?Ciencia de la decisión↗
  4. MSC-P-004Significación o tamaño del efecto: ¿qué resultado debe interpretarse?Ciencia de la decisión↗
  5. MSC-P-005¿Cómo medir un constructo de marketing que no es directamente observable?Investigación de mercados↗
  6. MSC-P-006¿Cómo diseñar y validar una escala de medición?Investigación de mercados↗
  7. MSC-P-007Alfa u omega: ¿cómo evaluar la fiabilidad de una escala?Investigación de mercados↗
  8. MSC-P-009ACP, AFE o AFC: ¿qué método elegir?Investigación de mercados↗
  9. MSC-P-010¿Cuándo debe realizarse un experimento de marketing?Medición de marketing↗
  10. MSC-P-011¿Cómo diseñar una prueba A/B que estime realmente un efecto?Medición de marketing↗
  11. MSC-P-012¿Cuántas observaciones necesita un experimento?Ciencia de la decisión↗
  12. MSC-P-013¿Cómo medir el efecto incremental de una campaña con un grupo de control?Medición de marketing↗
  13. MSC-P-017¿Cómo detectar selección, contaminación y pérdida en un experimento?Medición de marketing↗
  14. MSC-P-018Regresión predictiva o causal: ¿qué se intenta estimar?Modelos de marketing↗
  15. MSC-P-019¿Cómo diagnosticar una regresión de marketing antes de interpretarla?Modelos de marketing↗
  16. MSC-P-022¿Cómo estimar la elasticidad-precio y su incertidumbre?Ciencia de precios↗
  17. MSC-P-026Logit vs Probit: ¿cómo elegir para una probabilidad de compra?Ciencia del cliente↗
  18. MSC-P-029¿Qué clientes presentan la mayor probabilidad de abandono?Ciencia del cliente↗
  19. MSC-P-027TAM, UTAUT o UTAUT2: ¿qué marco usar para estudiar la aceptación tecnológica?Investigación de mercados↗
  20. MSC-H-001Medición y causalidad: ¿cómo establecer un efecto de marketing?Medición de marketing↗
  21. MSC-H-002Modelos de respuesta de marketing: forma, retardo y saturaciónModelos de marketing↗
  22. MSC-H-003Ciencia de precios: conectar precio, demanda y contribuciónCiencia de precios↗
  23. MSC-H-004Ciencia del cliente y elección: comportamiento, valor y heterogeneidadCiencia del cliente↗
  24. MSC-H-005Ciencia de la medición: construir indicadores válidosInvestigación de mercados↗
  25. MSC-H-006Métodos estadísticos de decisión: elegir, cuantificar, validarCiencia de la decisión↗
  26. MSC-P-008¿Cómo validar una escala de medición de marketing?Investigación de mercados↗
  27. MSC-P-014¿Cómo diseñar un experimento geográfico de marketing?Medición de marketing↗
  28. MSC-P-015¿Cómo estimar un efecto con diferencias en diferencias?Medición de marketing↗
  29. MSC-P-020¿Cómo tratar la endogeneidad del precio?Ciencia de precios↗
  30. MSC-P-021Efectos fijos o aleatorios: ¿qué modelo de panel elegir?Modelos de marketing↗
  31. MSC-P-023¿Cómo estimar una función de demanda?Ciencia de precios↗
  32. MSC-P-024¿Cómo simular un escenario precio-volumen-margen?Ciencia de precios↗
  33. MSC-P-028¿Cómo estimar la CLV con BG/NBD y Gamma-Gamma?Ciencia del cliente↗
  34. MSC-P-030¿Cómo analizar la retención con un modelo de supervivencia?Ciencia del cliente↗
  35. MSC-P-043¿Cuánto vale un suscriptor con solo seis meses de retención observada?Ciencia del cliente↗
  36. MSC-P-031¿Cómo construir una segmentación de clientes útil?Ciencia del cliente↗
  37. MSC-P-032¿Cómo probar la estabilidad de una segmentación?Ciencia del cliente↗
  38. MSC-P-033¿Cómo validar un pronóstico de marketing?Ciencia de la decisión↗
  39. MSC-P-034¿Cómo construir una simulación Monte Carlo para una decisión de marketing?Ciencia de la decisión↗
  40. MSC-P-035¿Cómo modelar saturación y adstock?Modelos de marketing↗
  41. MSC-P-039¿Qué prueba estadística elegir?Ciencia de la decisión↗
← Todos los métodos
FICHA DE MÉTODOMSC-P-033Regresión y econometríaDosier científico verificado

¿Cómo validar un pronóstico de marketing?

Un pronóstico se valida en periodos no usados para ajustar, con origen temporal realista, benchmark ingenuo y métrica acorde al coste del error.

Redacción científica: Marketing Science Center

Respuesta directa

Comparar modelos para un horizonte y coste de error declarados.

Un pronóstico se valida en periodos no usados para ajustar, con origen temporal realista, benchmark ingenuo y métrica acorde al coste del error.

Shmueli, 2010Hyndman & Koehler, 2006

01 · PROTOCOLO

Resumen operativo

Un modelo de pronóstico semanal se reajusta en trece orígenes sucesivos y luego se juzga sobre 52 semanas que nunca ha visto. Su error absoluto escalado vale 0,420792, frente a 1,039025 de un pronóstico ingenuo estacional: supera claramente el punto de comparación. Sus intervalos al 80 % contienen el resultado en 0,750000 de los casos, dentro de la tolerancia declarada de 0,10 pero del lado estrecho. Ambos controles pasan. Veredicto: FORECAST_READABLE_FOR_PLANNING.

02 · PROTOCOLO

Situación de marketing concreta

Un equipo debe comprometer existencias y presupuestos de medios con cuatro semanas de antelación. Dispone de un modelo que pronostica la facturación semanal y que, sobre el histórico, se ajusta notablemente bien a los datos. La pregunta que hay que hacerse antes de usarlo es simple: ¿cuándo se ha enfrentado ese modelo a semanas que no conocía, y qué ocurrió? Sin esa respuesta, la bondad de ajuste observada no dice nada sobre el uso previsto.

03 · PROTOCOLO

Pregunta científica

Para esta serie semanal, este modelo declarado, estos trece orígenes declarados y este horizonte de cuatro semanas, ¿es el error del modelo sobre semanas no usadas para ajustarlo inferior al de un pronóstico ingenuo estacional llevado a la misma escala? ¿Y sus intervalos al 80 % contienen el resultado tan a menudo como pretenden? Las dos preguntas son distintas y cada una recibe su respuesta: un pronóstico puntual acertado puede venir con una incertidumbre falsa.

04 · PROTOCOLO

Por qué puede fallar el enfoque simple

Juzgar un modelo sobre las semanas que sirvieron para ajustarlo siempre halaga: cuantos más parámetros se añaden, mejor parece el resultado, sin que se haya demostrado capacidad predictiva alguna. Tampoco basta dividir una sola vez el histórico en ajuste y prueba, porque la puntuación depende entonces del azar de una única frontera. Y reportar un error en euros sin punto de comparación no permite juzgar a nadie: 55 € de error medio es excelente o catastrófico según la serie.

05 · PROTOCOLO

Intuición del método

El método reproduce el uso real. Uno se sitúa en una fecha pasada, usa solo lo que se conocía ese día, pronostica las cuatro semanas siguientes, luego avanza cuatro semanas y vuelve a empezar. Trece veces. Cada error se divide después por una cantidad de referencia calculada sobre el solo pasado disponible en esa fecha: el error que habría cometido un pronóstico ingenuo estacional. Un valor inferior a uno significa que el modelo lo hizo mejor que esa regla simple. En paralelo se cuenta cuántas veces el intervalo anunciado contuvo realmente el resultado.

06 · PROTOCOLO

Datos necesarios

Se fijan antes de cualquier lectura: la numeración de semanas sin huecos, la facturación semanal, la forma del modelo (constante, tendencia lineal y dos armónicos anuales), el periodo estacional de 52 semanas, los trece orígenes de 104 a 152 con paso 4, el horizonte de 4 semanas, el pronóstico ingenuo estacional como punto de comparación, la cantidad de escala, el nivel nominal de 0,80, el cuantil 1,281552 y los dos umbrales. El archivo sellado contiene 156 semanas. El caso es sintético y así se declara.

07 · PROTOCOLO

Modelo formal y símbolos

En cada origen, el modelo ajusta por mínimos cuadrados una constante, una tendencia lineal y dos armónicos anuales, o sea seis parámetros, sobre las solas semanas anteriores al origen. El error absoluto escalado divide cada error fuera de muestra por la media de las diferencias absolutas a 52 semanas observadas en esa misma ventana. El intervalo tiene como semiamplitud 1,281552 veces la desviación típica residual del ajuste, siendo ese cuantil el de la ley normal estándar en 0,90. La puntuación de intervalo añade a la anchura una penalización proporcional a cualquier rebasamiento, dividida por el riesgo aceptado.

08 · PROTOCOLO

Cálculo declarado

El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme o demasiado corto para el plan de validación; en cada origen, construir la matriz de diseño sobre las solas semanas anteriores; resolver las ecuaciones normales por eliminación de Gauss con pivote parcial, rechazar una ventana singular y calcular la desviación típica residual restando los seis parámetros de los grados de libertad; calcular la escala estacional sobre la misma ventana y rechazar una escala nula; para cada uno de los cuatro horizontes, registrar el error absoluto, el error escalado, el del pronóstico ingenuo, la pertenencia al intervalo, la anchura y la puntuación; promediar sobre los 52 pronósticos y luego por horizonte; aplicar los dos umbrales declarados y la regla del veredicto.

09 · PROTOCOLO

Ejemplo numérico completo

Ilustración sintética — valores didácticos, no observados

En el archivo sellado: 156 semanas, 13 orígenes de la semana 104 a la 152, horizonte 4, o sea 52 pronósticos fuera de muestra. Error absoluto escalado del modelo 0,420792, frente a 1,039025 del pronóstico ingenuo estacional; error absoluto medio 54,912955 unidades monetarias; control de exactitud superado. Por horizonte: 0,418133, 0,520418, 0,279945 y 0,464672. Nivel nominal 0,80, cobertura observada 0,750000, anchura media 168,860643 y puntuación de intervalo media 243,378776; control de calibración superado. Veredicto: FORECAST_READABLE_FOR_PLANNING.

10 · PROTOCOLO

Supuestos de validez

La validación supone que el mecanismo que produjo las semanas pasadas sigue siendo el que producirá las futuras, que el periodo estacional es realmente de 52 semanas y que los valores históricos no se revisaron a posteriori. Supone además, para los intervalos, que los residuos se comportan como un ruido normal de varianza constante. Tres cosas no son comprobables aquí: la ausencia de un futuro cambio de régimen, el efecto de un canal o de un precio que nunca varió en el histórico, y la calidad de los datos en el momento en que el pronóstico se produzca realmente.

11 · PROTOCOLO

Diagnósticos e incertidumbre

Dos reservas merecen leerse antes del veredicto. La cobertura observada vale 0,750000 para un nivel anunciado de 0,80: la diferencia se mantiene dentro de la tolerancia declarada, pero los intervalos están del lado estrecho, que es exactamente lo que cabe esperar de intervalos construidos sobre la sola dispersión residual, sin tener en cuenta la incertidumbre sobre los parámetros ni su crecimiento con el horizonte. Y los errores por horizonte — 0,418133, 0,520418, 0,279945, 0,464672 — no aumentan de forma regular con el horizonte: con trece pronósticos por horizonte ese perfil es ruido, y no se les asocia ningún umbral.

12 · PROTOCOLO

Robustez y alternativas

Alternativas declaradas antes del resultado: sustituir los intervalos normales por intervalos construidos sobre los cuantiles empíricos de los errores fuera de muestra, uno por horizonte; añadir al punto de comparación un paseo aleatorio simple, más difícil de batir sin estacionalidad; alargar el horizonte hasta trece semanas para ver dónde desaparece la ventaja del modelo; o rehacer el ejercicio con un modelo más simple, sin armónico de orden dos. Cada variante debe anunciarse antes de leer y reportarse aunque degrade el veredicto.

13 · PROTOCOLO

Interpretación del resultado

El modelo pronostica mejor que una regla simple, y con holgura: su error vale menos de media unidad, mientras que el pronóstico ingenuo estacional supera uno, es decir lo hace peor fuera de muestra que sobre su propio pasado. Pero esa comparación vale lo que vale el punto de comparación: batir a un ingenuo estacional en una serie con tendencia visible no es una prueba exigente. El resultado utilizable es por tanto modesto y preciso: en esta serie y este horizonte, este modelo produjo pronósticos utilizables e intervalos apenas demasiado estrechos.

14 · PROTOCOLO

Conclusiones permitidas

Permitido: usar este modelo para planificar a cuatro semanas en esta serie; publicar el error escalado junto con el del punto de comparación, nunca uno sin el otro; anunciar los intervalos al 80 % señalando que en la práctica cubren algo menos; repetir esta misma validación cada trimestre para vigilar una deriva; y exigir el mismo protocolo a cualquier proveedor de pronósticos. También permitido: decir que este resultado vale para este horizonte, y rehacer el examen si el horizonte cambia.

15 · PROTOCOLO

Conclusiones prohibidas

Prohibido: presentar 0,420792 como una precisión garantizada para las semanas venideras; anunciar los intervalos al 80 % sin mencionar que cubrieron 0,750000; concluir que un modelo validado seguirá siendo válido tras un cambio de precio, canal o competencia; comparar este error escalado con el de otra serie sin volver a verificar que el punto de comparación es el mismo; o elegir el número de orígenes y el horizonte tras ver los resultados. También prohibido: presentar este caso sintético como una medición observada.

16 · PROTOCOLO

Posible decisión de marketing

La decisión razonable es comprometer el plan a cuatro semanas con este modelo, pero dimensionar el stock de seguridad sobre la cobertura observada y no sobre la anunciada, ya que los intervalos resultaron algo estrechos. La validación se repite luego cada trimestre con el mismo protocolo, sin modificarlo, de modo que un deterioro aparezca como deterioro y no como un cambio de regla. Ninguno de estos pasos se automatiza sin alguien que lea las dos banderas.

17 · PROTOCOLO

Cuándo usar o evitar el método

Usar este protocolo antes de toda puesta en producción de un pronóstico, y a intervalos regulares después. Evitarlo cuando el histórico es demasiado corto para obtener varios orígenes, cuando los valores pasados se revisaron tras su publicación, o cuando la serie acaba de sufrir una ruptura visible: en este último caso la validación mide un régimen que ya no existe. Evitarlo también como respuesta a la pregunta del efecto de una acción, que compete a un experimento y no a un pronóstico.

18 · PROTOCOLO

Implementaciones y entregable final

El CSV CC0 contiene las 156 semanas sintéticas. Python y R son las implementaciones de referencia; SPSS retoma el mismo cálculo en un bloque Python; SAS emplea el mismo diseño y los mismos orígenes pero confía el ajuste a su propio procedimiento de regresión, y verifica las dos banderas en vez de cada decimal. El entregable final reúne los datos, el diccionario de variables, la forma del modelo declarada, los orígenes y el horizonte, el punto de comparación, la cantidad de escala, el nivel nominal y el cuantil, los dos umbrales, los siete pasos numerados, el error escalado del modelo y del punto de comparación, los errores por horizonte, la cobertura, la anchura, la puntuación de intervalo, las dos banderas, el veredicto y las versiones de software.

19 · PROTOCOLO

Fuentes y nivel de evidencia

Hyndman y Koehler proponen el error absoluto escalado como medida estándar de comparación, recuerdan que un valor superior a uno señala pronósticos peores en promedio, y muestran que muchas medidas corrientes no son aplicables en general. Hyndman y Khandakar recuerdan que los errores fuera de muestra suelen ser demasiado pocos para concluir, y que dos modelos pueden dar los mismos pronósticos puntuales con intervalos distintos. Makridakis, Spiliotis y Assimakopoulos señalan la frecuente ausencia de un punto de comparación y la brecha entre bondad de ajuste y exactitud fuera de muestra. Petropoulos y coautores describen el paso de un origen fijo a uno deslizante, la puntuación de intervalo como medida apropiada, y el hecho de que los intervalos publicados son demasiado estrechos. Referencias fundacionales: Hyndman y Koehler (2006, International Journal of Forecasting, con revisión por pares) y Hyndman y Khandakar (2008, Journal of Statistical Software, acceso abierto CC BY, con revisión). Desarrollos recientes: Makridakis, Spiliotis y Assimakopoulos (2018, PLOS ONE, acceso abierto CC BY, con revisión) y Petropoulos et al. (2022, preprint en arXiv; publicado en el International Journal of Forecasting, con revisión).

  1. Hyndman & Koehler (2006) Texto completo verificado, con extracto breve localizado en la fuente.
  2. Hyndman & Khandakar (2008) Texto completo verificado, con extracto breve localizado en la fuente.
  3. Makridakis, Spiliotis & Assimakopoulos (2018) Texto completo verificado, con extracto breve localizado en la fuente.
  4. Petropoulos et al. (2022) Texto completo verificado, con extracto breve localizado en la fuente.

Conexiones metodológicas

Territorio principalMétodos estadísticos de decisión: elegir, cuantificar, validarRequiere¿Cómo expresar la incertidumbre de un resultado de marketing?Comparar conEfectos fijos o aleatorios: ¿qué modelo de panel elegir?

Leer después

MSC-H-002Modelos de respuesta de marketing: forma, retardo y saturación→MSC-H-006Métodos estadísticos de decisión: elegir, cuantificar, validar→MSC-P-003¿Cómo expresar la incertidumbre de un resultado de marketing?→MSC-P-021Efectos fijos o aleatorios: ¿qué modelo de panel elegir?→