Research & Evidence

Buscar un método

Busca entre títulos, preguntas, territorios e identificadores MSC.

    ← Todos los métodos
    FICHA DE MÉTODOMSC-P-046Ciencia del clienteDosier científico verificado

    ¿Cuánto gastará un cliente por compra? El modelo Gamma-Gamma

    Modelo Gamma-Gamma: prever el gasto medio por compra de cada cliente con sus compras pasadas, comprobado con datos reales de CDNOW y un periodo reservado.

    Redacción científica: Marketing Science Center

    Respuesta directa

    Prever el gasto medio por compra de cada cliente a partir del número y el importe de sus compras, con un intervalo, y validar el pronóstico en un periodo reservado frente a las medias simples.

    Modelo Gamma-Gamma: prever el gasto medio por compra de cada cliente con sus compras pasadas, comprobado con datos reales de CDNOW y un periodo reservado.

    Fader, Hardie & Lee, 2005Fader & Hardie, 2013

    01

    En resumen

    El valor de un cliente depende de dos cosas: cuántas veces comprará y cuánto gastará en cada compra. El modelo Gamma-Gamma de Fader, Hardie y Lee se ocupa de la segunda [C02]: pronostica el gasto medio por compra, el ticket medio, de cada cliente a partir de sus compras pasadas [C01]. Su regla: el pronóstico acerca la media observada de un cliente a la del conjunto de los clientes, tanto más cuanto menos ha comprado [C20, C21].

    El programa de la página lo aplica a los datos reales publicados por los autores: 2.357 clientes de la tienda de discos en línea CDNOW, captados en el primer trimestre de 1997 [C03, C04]. Recupera los resultados que los autores publicaron sobre estos datos, salvo un estadístico descriptivo. Después evalúa los pronósticos en treinta y nueve semanas que la estimación no ha visto, para los 491 clientes que vuelven a comprar:

    • el modelo de los autores, que solo usa las compras repetidas, se equivoca de media en 16,37 $ por compra; es claramente mejor que la media de esas compras repetidas, 17,35 $, pero no mejor que la media de todas las compras del cliente, incluida la primera, 16,09 $;
    • el mismo modelo estimado con todas las compras, una variante añadida por la página tras una primera lectura de esas semanas, se equivoca en 15,78 $: algo mejor que esa media simple, pero sin una diferencia clara con el modelo de los autores. Queda por confirmar con otros datos.

    El modelo también subestima la dispersión de las compras de un cliente en torno a su media, y corrige demasiado poco los tickets bajos. Sirve para corregir las medias basadas en pocas compras; no pronostica mejor el total de la base.

    02

    La situación

    Una tienda de discos en línea captó a sus clientes en el primer trimestre de 1997. A 30 de septiembre de 1997, 946 de los 2.357 clientes de la muestra han recomprado al menos una vez [C07]. Para cuantificar su valor, el equipo de marketing ya dispone de un modelo que pronostica cuántas compras hará cada uno, como el de la página sobre la estimación del CLV no contractual; le falta el importe de esas compras.

    Dos clientes le plantean dudas. El primero ha recomprado una sola vez, por 100 $; el segundo, seis veces, por 20 $ de media. ¿Hay que prever 100 $ para el primero, 20 $ para el segundo, u otra cosa?

    Los datos de la página son los de CDNOW, tal como los publica Bruce Hardie: una muestra sistemática de la décima parte de la cohorte [C03], es decir, 6.919 filas con la fecha de la compra, el número de discos y el importe en dólares [C05].

    03

    La pregunta científica

    ¿Qué ticket medio cabe esperar de un cliente, conociendo el número x de sus compras repetidas y su importe medio z̄? La media observada no es más que una estimación imperfecta de la verdadera media del cliente, que no se ve [C08]; hay que corregirla, por tanto, indicar en cuánto y comprobar que la corrección pronostica mejor que las medias simples.

    04

    Por qué falla el método sencillo

    Tres atajos habituales:

    • Tomar la media pasada del cliente. Los autores se preguntan si hace falta un modelo y responden que no se puede confiar necesariamente en esa media [C09]: si el gasto medio de todos los clientes es de 35 $, ¿qué prever para un cliente cuya única recompra costó 100 $ [C10]? En las semanas reservadas para validación, los clientes cuya media de recompras era inferior a 20 $, 14,84 $ de media, gastaron después 26,82 $ por compra; aquellos cuya media alcanzaba o superaba los 50 $, 79,07 $ de media, gastaron 69,20 $. Las desviaciones extremas de un número reducido de compras tienden a no repetirse. Contar la primera compra en la media ya atenúa este defecto.
    • Tomar la media de todos los clientes. Borra las diferencias reales entre clientes: en las semanas reservadas para validación, es el peor de los pronósticos comparados.
    • Suponer una distribución normal, como Schmittlein y Peterson: admite gastos negativos y es simétrica [C11], mientras que los gastos son asimétricos, con una larga cola hacia los importes altos [C12]. Aquí, la media de los tickets, 35,08 $, supera a la mediana, 27,50 $, que supera a la moda, 14,96 $.

    Multiplicar el número de compras previstas por la media observada del cliente resulta tentador; los autores escriben que así se ignora la regresión a la media [C46, C47].

    05

    La intuición

    El modelo descansa en tres supuestos de fondo [C14, C15, C16]: el importe de cada compra de un cliente varía al azar en torno a su propia media; estas medias difieren de un cliente a otro, pero no cambian con el tiempo; y su distribución entre clientes no depende de la frecuencia de compra. A ello añade dos elecciones de forma, que se detallan más abajo.

    El modelo aprende de toda la base dos cosas: cuánto varían las compras de un mismo cliente en torno a su media, y cuánto varían las medias de un cliente a otro. Para cada cliente, el pronóstico es una media ponderada entre la media de la población y la media observada del cliente [C20]; cuanto más ha comprado el cliente, más pesa su propia media [C21]. Con estos datos, una sola recompra ya da un peso de 0,69 a la media del cliente; cuatro recompras, 0,90.

    06

    Los datos necesarios

    Para cada cliente, en el periodo de estimación:

    • el número x de sus compras repetidas, es decir, sin contar la primera;
    • el importe medio z̄ de esas compras repetidas: la tabla descriptiva de los autores se refiere al valor medio de las compras repetidas [C07, C24].

    Las compras de un mismo día se suman y cuentan como una sola compra; esta convención recupera exactamente los 946 clientes y la tabla descriptiva de los autores. Los clientes sin compras repetidas no entran en la estimación de los autores; su pronóstico es la media de la población [C48]. La variante de la página cuenta también la primera compra: en ella entran todos los clientes, salvo 8 cuya única compra figura en el archivo con un importe de 0 $.

    Después hay que verificar el supuesto de independencia: los autores miden una correlación de 0,11 entre el gasto medio y el número de compras [C38], que no consideran lo bastante fuerte como para cuestionar el modelo [C41].

    07

    El modelo formal

    Esta sección está dirigida al especialista. Quien toma decisiones puede saltársela y continuar en «El cálculo declarado»: basta con la frase «En pocas palabras» que la cierra.

    • z₁, …, z_x: los importes de las x compras repetidas de un cliente; z̄ su media. Z designa el importe de una compra; un acento circunflejo, como en p̂, designa un valor estimado.
    • Cada importe sigue una distribución gamma de forma p y tasa ν (los autores dicen «escala»; la media vale ζ = p/ν, el verdadero gasto medio del cliente) [C17]. El parámetro p es el mismo para todos: todos los clientes tienen el mismo coeficiente de variación, la desviación típica de una compra dividida por la media del cliente, 1/√p [C19].
    • ν varía entre clientes según una distribución gamma de forma q y tasa γ [C18]; estos dos supuestos de forma constituyen el modelo Gamma-Gamma [C53]. La verdadera media ζ = p/ν sigue entonces una distribución gamma inversa. La distribución gamma tiene propiedades cercanas a las de la log-normal, con una cola algo más fina; a diferencia de la log-normal, da fórmulas cerradas [C13]. El modelo adapta el de Colombo y Jiang [C54].
    • Distribución de la media observada: f(z̄ | x) = Γ(px + q) / (Γ(px) Γ(q)) × γ^q z̄^(px−1) x^(px) / (γ + x z̄)^(px+q), donde Γ es la función gamma, que extiende el factorial, y no debe confundirse con el parámetro γ. Esta fórmula da la densidad de probabilidad de una media z̄ observada tras x compras.
    • Media de la población: E(Z) = pγ / (q − 1).
    • Pronóstico para un cliente: E(Z | z̄, x) = p(γ + x z̄) / (px + q − 1), es decir, la media ponderada (1 − w) E(Z) + w z̄, con un peso w = px / (px + q − 1) asignado a la media del cliente [C20, C21].
    • Estimación: se eligen los valores de p, q y γ que hacen más verosímiles las medias observadas de los 946 clientes, es decir, el máximo de la log-verosimilitud, suma de los ln f(z̄ | x), hallado mediante un método numérico estándar [C22].

    En pocas palabras: cada cliente tiene su verdadero gasto medio, que sus primeras compras solo revelan en parte; mientras haya comprado poco, se prevé un valor entre su media y la de todos, y más cerca de la suya con cada compra.

    08

    El cálculo declarado

    1. Datos. El archivo publicado, leído tal cual: 6.919 filas, 2.357 clientes, 244.091,94 $; sumadas las compras de un mismo día, quedan 6.696 días de compra. Estimación en las semanas 1 a 39, hasta el 30 de septiembre de 1997; semanas 40 a 78, del 1 de octubre de 1997 al 30 de junio de 1998, reservadas para validación, como en el trabajo de los autores [C06].
    2. Control con los valores publicados. Antes de cualquier resultado, los dos programas recuperan los 946 clientes que han recomprado [C07], las ocho filas de la tabla descriptiva de la nota [C24, C25, C26, C27, C28, C29, C30, C31], los tres parámetros [C23], la diferencia de nueve centavos entre la media teórica y la media observada [C34], las dos modas [C35, C36], las correlaciones [C38, C39, C40], las log-verosimilitudes del artículo [C42] y la media sobre 78 semanas [C44]. En caso contrario, se detienen con un error. Los cuartiles se calculan con la regla de Weibull, la posición (n + 1) × probabilidad, la única de uso corriente que recupera los dos valores publicados.
    3. Estimación del máximo de verosimilitud sobre los logaritmos de p, q y γ, mediante el símplex de Nelder-Mead, un algoritmo que busca paso a paso el mejor ajuste, reiniciado hasta la estabilidad; después, los programas comprueban que la pendiente de la verosimilitud es nula en ese punto. La función log-gamma está escrita íntegramente en los dos lenguajes.
    4. Variante de la página: el mismo modelo, estimado con todas las compras de las semanas 1 a 39, incluida la primera. Se añadió tras una primera lectura de las semanas reservadas para validación, a raíz de una revisión: su validación no es, por tanto, ciega, y sus errores típicos no tienen en cuenta esta elección.
    5. Validación en las semanas reservadas: se comparan cinco pronósticos del gasto medio por compra con lo que gastaron los clientes: la media de las compras repetidas, la media de todas las compras, la media de la población, el modelo de los autores y la variante. El error es el gasto observado menos el pronóstico; si es positivo, indica un pronóstico por defecto. Cada diferencia se da con su error típico, que mide la imprecisión debida únicamente a la selección de los clientes; una diferencia de más de dos errores típicos se considera clara. Las diferencias se calculan antes de redondear.
    6. Dispersión de un cliente en torno a su media: para los clientes con al menos tres recompras, el coeficiente de variación observado de sus compras se compara con el que dan 200 simulaciones del modelo, con los mismos números de compras.
    7. Incertidumbre: bootstrap, que vuelve a extraer al azar, con reemplazo, 1.000 veces 946 clientes entre los 946, y reestima el modelo cada vez; intervalo del 25.º al 975.º valor ordenado. Estos intervalos se denominan al 95 % nominal: es el nivel al que apunta el método, que aquí nada garantiza con exactitud. El generador de números pseudoaleatorios está escrito íntegramente (semilla 20261007; s ← 1103515245 · s + 12345 mod 2³¹), para que Python y R extraigan los mismos números.
    8. Invariantes: 19 identidades, entre ellas que la distribución de z̄ integra a 1, que su media es igual a pγ / (q − 1) y que el pronóstico es igual a la media ponderada; los programas se detienen si una falla.

    09

    El ejemplo numérico completo

    Los resultados publicados, recalculados. Valor medio de las compras repetidas por cliente, semanas 1 a 39, en dólares:

    EstadísticoRecalculadoPublicado
    Mínimo2,992,99 [C24]
    Primer cuartil15,74515,75 [C25]
    Mediana27,497527,50 [C26]
    Tercer cuartil41,795641,80 [C27]
    Máximo299,6338299,63 [C28]
    Media35,077835,08 [C29]
    Desviación típica30,283530,28 [C30]
    Moda14,9614,96 [C31]

    Se recuperan los parámetros: p̂ = 6,2496, q̂ = 3,7442, γ̂ = 15,4435, frente a los 6,25, 3,74 y 15,44 publicados [C23]. La herramienta Solver de Excel, en el libro de cálculo de los autores, se detiene en un punto algo distinto en el cuarto decimal, porque la superficie de verosimilitud es casi plana; el máximo alcanzado aquí es apenas más alto. La media teórica, 35,1704 $, supera a la media observada en 0,0925 $, los nueve centavos de los autores [C34]. La moda de la distribución ajustada cae en 19 $, la de los datos en 14,96 $, como se publicó [C35, C36]. La correlación entre gasto medio y número de compras vale 0,1139, y 0,0570 sin el cliente de 21 compras y 299,63 $ de media; la prueba de que esta correlación es nula da entonces un valor p de 0,0801. Son los 0,11, 0,06 y 0,08 publicados [C38, C39, C40].

    Quedan dos diferencias.

    • La log-verosimilitud. En el máximo, la fórmula de la nota da −4.055,92. El artículo publica −4.659 [C42]. La diferencia es exactamente la suma de los ln x de los 946 clientes, 603,37: −4.055,92 − 603,37 = −4.659,29. Así pues, el artículo calculó probablemente la verosimilitud del gasto total x z̄, aunque la fórmula que da es la de la media z̄; el máximo, y por tanto los parámetros, son los mismos. Con esta convención, los parámetros estimados sobre las 78 semanas dan −4.661,41 en las semanas 1 a 39, los −4.661 publicados [C42], y una media de la población de 35,81 $, los «36 $» de los autores [C44].
    • La asimetría. El artículo da una asimetría de 4 y una curtosis de 17 [C32, C33]. La página obtiene 17,15 para la curtosis, en exceso respecto a la distribución normal, pero 3,40 para la asimetría; ninguna de las variantes de definición probadas da 4.

    El modelo ajustado. Las verdaderas medias de los clientes tienen una media de 35,17 $ y una desviación típica de 26,63 $. El modelo estima en 0,40 el coeficiente de variación de las compras de un cliente en torno a su propia media; lo que sigue muestra que los datos lo contradicen.

    El pronóstico para un cliente, en dólares por compra, según el modelo de los autores:

    Compras repetidasPeso de la media del clienteMedia observada 20 $50 $100 $
    10,694924,6345,4880,22
    20,820022,7347,3388,33
    40,901121,5048,5393,59
    80,948020,7949,2396,63

    Para el cliente con una única recompra de 100 $ se esperan 80,22 $ por compra; para el de seis recompras de 20 $, 21,03 $. El peso de la media del cliente alcanza el 90 %, un umbral elegido por la página, en la cuarta recompra; con los parámetros estimados sobre 78 semanas, en la séptima. Los autores consideran, sin un umbral cifrado, que hacen falta siete u ocho compras antes de fiarse de la media observada [C45].

    La variante de la página, estimada con todas las compras de las semanas 1 a 39: p̂ = 9,8813, q̂ = 3,3988, γ̂ = 7,9286, media de la población 32,66 $. Para un cliente cuya única compra costó 100 $, la variante espera 86,85 $, con un peso de 0,80 asignado a su media. En un mismo cliente, la primera compra es más o menos igual a las recompras: 36,14 $ de media para los 946 clientes que han recomprado, frente a 35,08 $ para la media de sus recompras, con una razón mediana de 0,97. En cambio, los 1.411 clientes que no han recomprado habían hecho una primera compra de solo 30,88 $: los clientes cuya primera compra fue más pequeña recompraron menos. La variante mezcla estos dos grupos, y su media de la población resulta más baja.

    La validación en las semanas 40 a 78. De los 946 clientes que han recomprado, 491 vuelven a comprar. Error en su gasto medio por compra, en dólares, y diferencia de error absoluto con la media de todas las compras:

    PronósticoError absoluto medioRaíz del error cuadrático medioError medioDiferencia con la media de todas las compras
    Media de las compras repetidas17,3529,652,30+1,26 (error típico 0,45)
    Media de todas las compras16,0928,282,05—
    Media de la población18,9431,622,67+2,85 (0,91)
    Modelo de los autores16,3728,062,17+0,28 (0,41)
    Variante de la página15,7827,832,19−0,31 (0,09)

    El modelo de los autores reduce el error un 5,6 % frente a la media de solo las recompras del cliente, es decir, 0,98 $ por compra (error típico 0,25), pero no mejora la media de todas las compras: su diferencia, +0,28 $, es inferior a su error típico. La variante mejora esta media simple en un 1,9 %, es decir, 0,31 $ por compra; frente al modelo de los autores, su ventaja, 0,59 $ (error típico 0,37), no es clara. Es una mejora media: la variante supera a la media simple en 285 clientes de 491, es decir, el 58,0 %.

    Para otros 193 clientes, que no habían hecho ninguna recompra durante la estimación pero compran después, el valor de su única compra se equivoca en 20,25 $, la media de la población, pronóstico del modelo de los autores, en 20,92 $, la variante en 18,75 $. La ventaja de la variante es clara frente a la única compra, 1,51 $ (error típico 0,44), pero no frente a la media de la población, 2,17 $ (error típico 1,72). Sobre los 684 clientes que compran durante esas semanas, el error es de 17,27 $ para la media de todas las compras, 17,65 $ para el modelo de los autores y 16,62 $ para la variante; la diferencia entre la variante y el modelo de los autores, 1,03 $ (error típico 0,55), no es clara.

    La regresión a la media, por tramo de media de las recompras, pronósticos del modelo de los autores y de la variante:

    Tramo de media de las recomprasClientesMedia de las recomprasModelo de los autoresVarianteGasto observado despuésObservado menos modelo de los autores
    Menos de 20 $14914,8419,4019,6526,827,42 (error típico 1,61)
    De 20 a 50 $25532,7833,1632,9133,570,41 (1,10)
    50 $ o más8779,0770,8471,0369,20−1,64 (5,70)

    Los dos modelos acercan las medias extremas en el sentido correcto, pero no lo suficiente: los tickets bajos se pronostican claramente por defecto, en 7,42 $ por compra; los tickets altos se pronostican por exceso en 1,64 $, dentro del margen del azar.

    El total de la base. Multiplicado por el número de compras realmente efectuadas, el pronóstico del modelo de los autores da 68.181,97 $ de gasto en las semanas 40 a 78, frente a 70.976,39 $ observados, es decir, −3,9 %; la variante, −4,6 %; la media de todas las compras, −4,2 %. Por número de recompras durante la estimación, gasto total medio por cliente en esas semanas:

    RecomprasClientesObservadoPrevisto por el modelo de los autoresDiferencia
    01.4118,308,33−0,03 (error típico 0,55)
    143927,4223,164,26 (1,82)
    221451,9253,72−1,80 (3,95)
    310063,1956,236,96 (4,47)
    46290,98100,75−9,77 (6,54)
    538124,45105,7018,75 (13,68)
    629127,17126,740,43 (8,29)
    7 o más64246,04237,638,42 (12,84)

    Solo la fila de una recompra se aparta más de lo que explicaría el azar: esos clientes se pronostican por defecto en 4,26 $. Los autores, que no dan errores típicos, juzgan a simple vista que ningún sesgo particular pone en duda sus supuestos [C50].

    La dispersión de un cliente en torno a su media. Para los 293 clientes con al menos tres recompras, el coeficiente de variación mediano de sus compras es de 0,47. Calculado con pocas compras, un coeficiente de variación es de media más pequeño que el verdadero: el modelo espera, por tanto, 0,36 y no 0,40, y en el 95 % de las 200 simulaciones, entre 0,34 y 0,38. Las compras de un cliente varían, por tanto, claramente más de lo que supone el modelo, sobre todo cuando su gasto es alto: 0,38 para los 61 clientes por debajo de 20 $, 0,48 para los 180 de 20 a 50 $, 0,50 para los 52 de 50 $ o más.

    10

    Los supuestos de validez

    • Un gasto independiente de la frecuencia [C16]. Aquí, la correlación es de 0,11, reducida a la mitad al retirar un solo cliente [C38, C39], y los autores no ven en ella una violación grave [C41]. Pero los clientes que no recompran habían hecho una primera compra más pequeña, 30,88 $ frente a 36,14 $ (diferencia de 5,26 $, error típico 1,47): un indicio de que gasto y frecuencia no son del todo independientes. Para productos de los que los clientes hacen acopio cabe esperar un vínculo aún más fuerte entre el ritmo de las compras y su importe [C51]. ¿Sus grandes compradores compran también con más frecuencia, o con menos?
    • Un gasto medio estable en el tiempo para cada cliente [C15]. La log-verosimilitud apenas cambia al pasar de 39 a 78 semanas [C42, C43], pero los parámetros se mueven: el peso de una sola recompra pasa de 0,69 a 0,59, y el pronóstico para el cliente con una única recompra de 100 $ pasa de 80,22 $ a 73,99 $. El nivel medio, en cambio, ha cambiado poco: una recompra valía de media 38,81 $ durante la estimación, una compra 37,71 $ después. ¿Han cambiado sus precios, su oferta o su clientela desde el periodo de estimación?
    • El mismo coeficiente de variación para todos los clientes [C19]. Los datos lo contradicen: las compras de un cliente varían más de lo previsto, sobre todo en los grandes clientes. Es una pista para explicar la regresión a la media insuficiente, pero no explica el pronóstico por defecto de los tickets bajos, cuya dispersión es cercana a la del modelo. ¿Sus grandes clientes tienen tickets más irregulares que los pequeños?
    • Una distribución gamma de los importes, sin umbrales de precio. El modelo no conoce los precios redondos o psicológicos, terminados en ,99: sitúa la moda en 19 $ cuando los datos la sitúan en el precio de un disco, 15 $ [C35, C36, C37]. Los autores prefirieron un modelo sencillo a un mejor ajuste [C52]. ¿Sus tickets se concentran en unos pocos precios?
    • Solo compras repetidas, en el modelo de los autores: la primera compra no entra en la media, y a los clientes sin recompra se les asigna la media de la población [C48]. ¿Qué proporción de sus clientes aún no ha recomprado?
    • Comprobable solo de forma indirecta: la distribución gamma inversa de las verdaderas medias, puesto que nunca se observa una verdadera media, solo medias de unas pocas compras; se juzga por el ajuste de la distribución de las medias observadas. No comprobable aquí: que la media de un cliente se mantenga estable más allá del 30 de junio de 1998.

    11

    Diagnósticos e incertidumbre

    • Ajuste: comparar la distribución de las medias observadas con la que prevé el modelo. Aquí, la media teórica solo se aparta de la observada en 0,0925 $, pero la moda prevista, 19 $, supera a la observada, 14,96 $ [C35].
    • Independencia: calcular la correlación entre gasto medio y número de compras, con y sin los clientes extremos [C38, C40], y comparar la primera compra de los que recompran y de los que no recompran.
    • Dispersión de un cliente: comparar el coeficiente de variación observado de las compras de cada cliente con el del modelo; aquí, 0,47 frente a 0,36.
    • Validación fuera del periodo: comparar el modelo con las medias simples, incluida la media de todas las compras, con el error típico de cada diferencia. Ponderado por el número de compras efectuadas después, el error absoluto medio mantiene el mismo orden: 13,44 $ para la variante, 13,60 $ para el modelo de los autores, 13,80 $ para la media de todas las compras, 14,61 $ para la media de las recompras.
    • Incertidumbre de estimación, por bootstrap sobre los 946 clientes, intervalos al 95 % nominal: la media de la población va de 33,26 a 37,02 $; el pronóstico para el cliente con una única recompra de 100 $, de 72,95 a 88,58 $; el peso de una sola recompra, de 0,59 a 0,82; el coeficiente de variación, de 0,30 a 0,46; la desviación típica de las verdaderas medias, de 21,75 a 32,58 $. Los datos distinguen mal p de γ: p va de 4,68 a 10,85 y γ de 7,42 a 24,47, mientras que los pronósticos, que los combinan, se mantienen más estables. Estos intervalos se refieren a pronósticos medios, no a lo que un cliente gastará realmente: una compra aislada varía mucho más.
    • Lo que la validación no verifica: solo abarca a los clientes que vuelven a comprar, y cada uno pesa lo mismo sea cual sea su número de compras; usa el número de compras realmente efectuadas en las semanas 40 a 78 y no evalúa el pronóstico de ese número, que corresponde a otro modelo [C49]. Esas semanas incluyen las fiestas de fin de año de 1997, que podrían elevar el gasto, algo que el nivel medio no muestra. No se dice nada más allá del 30 de junio de 1998.
    • Lo que estos datos no pueden zanjar: un solo minorista, un solo producto, clientes captados en 1997; el resultado no se traslada sin comprobación.

    12

    Interpretación

    Tres enseñanzas. Primero, la media de las recompras de un cliente es un mal pronóstico cuando ha comprado poco: una única recompra de 100 $ anuncia unos 80 $, no 100 $. El modelo cuantifica esta regresión a la media en lugar de adivinarla.

    Segundo, con estos datos el modelo de los autores no aporta nada frente a una media simple de todas las compras, incluida la primera: supera a la media de las recompras porque corrige, pero renuncia a la información de la primera compra. Alimentado con todas las compras, el mismo modelo lo hace algo mejor que esa media simple, de media sobre los clientes; pero se eligió a posteriori, y su ventaja sobre el modelo de los autores no es clara. Ninguno pronostica mejor el total de la base: la mejora se refiere al valor de cada cliente, no a la facturación global.

    Por último, el modelo corrige demasiado poco: los clientes por debajo de 20 $ gastaron después 26,82 $ por compra, cuando preveía 19,40. Estos datos no revelan la causa. Aquí se mide una dispersión de cada cliente mayor de lo previsto, pero afecta sobre todo a los grandes clientes; siguen siendo posibles los umbrales de precio, la forma de la distribución de las verdaderas medias, el vínculo entre gasto y frecuencia o un cambio en el tiempo.

    13

    Conclusiones permitidas y prohibidas

    • Permitido: «Para un cliente de CDNOW que ha recomprado una sola vez, por 100 $, el modelo de los autores pronostica un gasto medio de aproximadamente 80 $ por compra en sus compras siguientes, de 72,95 a 88,58 $ al 95 % nominal, contando solo la incertidumbre de estimación.»
    • Permitido: «En las semanas 40 a 78, el modelo estimado con todas las compras, una variante elegida tras una primera lectura de esas semanas, se equivoca de media en 15,78 $ por compra, frente a 16,09 $ para la media de todas las compras del cliente; queda por confirmar con otros datos.»
    • Prohibido: presentar el pronóstico del modelo como el valor de un cliente. Solo pronostica el importe por compra; hay que combinarlo con un modelo del número de compras, como hacen los autores [C49], y después con un margen y una tasa de descuento [C55, C56].
    • Prohibido: afirmar que el modelo de los autores pronostica mejor que la media pasada del cliente sin decir cuál: supera a la media de las recompras, no a la media de todas las compras.
    • Prohibido: concluir que una acción de marketing haría gastar más. El modelo describe gastos; no mide el efecto de ninguna acción.
    • Prohibido: aplicar los parámetros de CDNOW a otra empresa, o aplicar el modelo sin haber verificado que el gasto de los clientes de su empresa no depende de su frecuencia de compra [C51].

    14

    Posible decisión de marketing

    • Valorar a cada cliente con un pronóstico corregido, no con la media de solo las recompras del cliente; a falta de modelo, la media de todas las compras del cliente lo hace casi igual de bien. Se puede considerar el modelo estimado con todas las compras, y validarlo después con los propios datos, en un periodo que aún no se haya examinado. Multiplicar después por el número de compras futuras esperadas, cada una llevada a su valor actual, y por el margen, como hacen los autores, que adoptan un margen del 30 % y un descuento del 15 % anual [C49, C55, C56].
    • Ni sobrestimar una compra grande aislada ni subestimar una pequeña: una única recompra de 100 $ equivale a un pronóstico de 80,22 $ según el modelo de los autores, y un cliente con 20 $ de media tras una sola recompra, a 24,63 $; los datos muestran incluso que la corrección debería ser más fuerte para los tickets bajos.
    • Comprobar con los propios datos, antes de usarlo, la independencia entre gasto y frecuencia, la dispersión de las compras de cada cliente y la validación frente a la media de todas las compras; reestimar tras cualquier cambio de precios.

    La decisión sigue siendo humana y compromete a la dirección de marketing y, en lo que respecta al valor de los clientes, a la dirección financiera.

    15

    Cuándo usarlo y cuándo no

    • Usar: compras repetidas de importe variable, fuera de una suscripción, cuando se quiere el valor de cada cliente; como complemento de un modelo del número de compras, como el de la página sobre la estimación del CLV no contractual o el de la página sobre el valor de un cliente de temporada.
    • Usar con prudencia cuando el gasto depende de la frecuencia, por ejemplo con productos de los que los clientes hacen acopio [C51]: hace falta entonces un modelo que relacione el número de compras y su importe en lugar de suponerlos independientes. También con prudencia cuando los precios se concentran en unos pocos valores [C37], o cuando las compras de un cliente son muy irregulares.
    • No usar para una suscripción de precio fijo, en la que el importe se conoce: véase la página sobre el valor de un suscriptor; ni para valorar la base completa con los clientes futuros: véase la página sobre el valor de la base de clientes.
    • No usar para medir el efecto de una acción sobre el gasto: hace falta un experimento.
    • Para expresar la incertidumbre de un resultado, véase la página sobre la expresión de la incertidumbre; para juzgar un pronóstico en un periodo reservado, la de la validación de un pronóstico de marketing.

    16

    Implementaciones reproducibles

    • Python 3.14.5, solo biblioteca estándar: msc-p046-reference.py, se ejecuta con python msc-p046-reference.py
    • R 4.6.1, solo base: msc-p046-reference.R, se ejecuta con Rscript msc-p046-reference.R
    • Los datos no se redistribuyen: descargue la muestra de CDNOW en brucehardie.com/datasets y coloque CDNOW_sample.txt junto a los programas.
    • Los dos programas imprimen exactamente las mismas líneas; su huella sha256, tras normalizar los finales de línea, consta en el manifiesto del expediente. Semilla declarada 20261007. Ninguna biblioteca de terceros: el software no valida el método, lo reproduce.

    17

    Entregable

    Para cada cliente, el número de compras, su importe medio y el pronóstico corregido con su peso; los parámetros estimados y su intervalo; la comprobación de independencia entre gasto y frecuencia y la de la dispersión de cada cliente; la validación en un periodo reservado, frente a la media de todas las compras, con los errores típicos; y los supuestos que hay que verificar antes de decidir.

    18

    Referencias y nivel de evidencia

    • Fader, P. S., Hardie, B. G. S. & Lee, K. L. (2005). RFM and CLV: Using Iso-Value Curves for Customer Base Analysis. Journal of Marketing Research 42(4), 415–430. — versión de los autores difundida por Bruce Hardie, texto completo verificado; en ella se citan Schmittlein y Peterson (1994) y Colombo y Jiang (1999).
    • Fader, P. S. & Hardie, B. G. S. (2013). The Gamma-Gamma Model of Monetary Value. Nota técnica. brucehardie.com/notes/025 — texto completo verificado.
    • Muestra de CDNOW y su documentación, publicadas por Bruce Hardie: brucehardie.com/datasets (CDNOW_sample.zip); la cohorte completa cuenta con 23.570 clientes [C04].
    • Nivel de evidencia: datos reales, un minorista, 1997 y 1998; resultados publicados recuperados a partir de los datos, salvo la asimetría; validación en 39 semanas reservadas, con una variante añadida tras una primera lectura de esas semanas; reproducible en Python y en R. No es una prueba de que el modelo convenga a su empresa.

    Conexiones metodológicas

    Territorio principalCiencia del cliente y elección: comportamiento, valor y heterogeneidadComparar con¿Cómo estimar la CLV con BG/NBD y Gamma-Gamma?Comparar con¿Cuánto vale un cliente que compra como mucho una vez por temporada?Comparar con¿Cuánto valen los clientes de una empresa, actuales y futuros?Requiere¿Cómo expresar la incertidumbre de un resultado de marketing?Valida¿Cómo validar un pronóstico de marketing?

    Leer después

    MSC-H-004Ciencia del cliente y elección: comportamiento, valor y heterogeneidad→MSC-P-028¿Cómo estimar la CLV con BG/NBD y Gamma-Gamma?→MSC-P-044¿Cuánto vale un cliente que compra como mucho una vez por temporada?→MSC-P-045¿Cuánto valen los clientes de una empresa, actuales y futuros?→