Research & Evidence

Rechercher une méthode

Recherchez parmi les titres, les questions, les territoires et les identifiants MSC.

    ← Toutes les méthodes
    FICHE MÉTHODEMSC-P-046Science clientDossier scientifique vérifié

    Combien un client dépensera-t-il par achat ? Le modèle Gamma-Gamma

    Modèle Gamma-Gamma : prévoir le panier moyen de chaque client d’après ses achats passés, vérifié sur les données réelles de CDNOW et une période mise de côté.

    Rédaction scientifique : Marketing Science Center

    Réponse directe

    Prévoir la dépense moyenne par achat de chaque client à partir du nombre et du montant de ses achats, avec un intervalle, et valider la prévision sur une période mise de côté face aux moyennes simples.

    Modèle Gamma-Gamma : prévoir le panier moyen de chaque client d’après ses achats passés, vérifié sur les données réelles de CDNOW et une période mise de côté.

    Fader, Hardie & Lee, 2005Fader & Hardie, 2013

    01

    En bref

    La valeur d'un client tient à deux choses : combien de fois il achètera, et combien il dépensera à chaque achat. Le modèle Gamma-Gamma de Fader, Hardie et Lee traite la seconde [C02] : il prévoit la dépense moyenne par achat, le panier moyen, de chaque client à partir de ses achats passés [C01]. Sa règle : la prévision tire la moyenne observée d'un client vers celle de l'ensemble des clients, d'autant plus fort qu'il a peu acheté [C20, C21].

    Le programme de la page l'applique aux données réelles publiées par les auteurs : 2 357 clients du disquaire en ligne CDNOW, recrutés au premier trimestre 1997 [C03, C04]. Il retrouve les résultats publiés par les auteurs sur ces données, sauf une statistique descriptive. Puis il juge les prévisions sur trente-neuf semaines que l'estimation n'a pas vues, pour les 491 clients qui achètent à nouveau :

    • le modèle des auteurs, qui n'utilise que les achats répétés, se trompe en moyenne de 16,37 $ par achat ; c'est nettement mieux que la moyenne de ces seuls achats, 17,35 $, mais pas mieux que la moyenne de tous les achats du client, premier compris, 16,09 $ ;
    • le même modèle estimé sur tous les achats, une variante ajoutée par la page après une première lecture de ces semaines, se trompe de 15,78 $ : un peu mieux que cette moyenne simple, mais sans écart net avec le modèle des auteurs. Elle reste à confirmer sur d'autres données.

    Le modèle sous-estime aussi la dispersion des achats d'un client autour de sa moyenne, et il corrige trop peu les petits paniers. Il sert à corriger les moyennes fondées sur peu d'achats ; il ne prévoit pas mieux le total de la base.

    02

    La situation

    Un disquaire en ligne a recruté ses clients au premier trimestre 1997. Au 30 septembre 1997, 946 des 2 357 clients de l'échantillon ont racheté au moins une fois [C07]. Pour chiffrer leur valeur, l'équipe marketing dispose déjà d'un modèle qui prévoit combien d'achats chacun fera, comme celui de la page sur l'estimation de la CLV non contractuelle ; il lui manque le montant de ces achats.

    Deux clients l'embarrassent. Le premier a racheté une seule fois, pour 100 $ ; le second six fois, pour 20 $ en moyenne. Faut-il prévoir 100 $ pour le premier, 20 $ pour le second, ou autre chose ?

    Les données de la page sont celles de CDNOW, telles que Bruce Hardie les publie : un échantillon systématique au dixième de la cohorte [C03], soit 6 919 lignes portant la date de l'achat, le nombre de disques et le montant en dollars [C05].

    03

    La question scientifique

    Quel panier moyen attendre d'un client, sachant le nombre x de ses achats répétés et leur montant moyen z̄ ? La moyenne observée n'est qu'une estimation imparfaite de la vraie moyenne du client, que l'on ne voit pas [C08] ; il faut donc la corriger, dire de combien, et vérifier que la correction prévoit mieux que les moyennes simples.

    04

    Pourquoi la méthode simple échoue

    Trois raccourcis courants :

    • Prendre la moyenne passée du client. Les auteurs se demandent s'il faut un modèle et répondent qu'on ne peut pas nécessairement se fier à cette moyenne [C09] : si la dépense moyenne de tous les clients est de 35 $, que prévoir pour un client dont l'unique rachat a coûté 100 $ [C10] ? Sur les semaines mises de côté, les clients dont la moyenne des rachats était inférieure à 20 $, 14,84 $ en moyenne, ont dépensé ensuite 26,82 $ par achat ; ceux dont elle atteignait ou dépassait 50 $, 79,07 $ en moyenne, ont dépensé 69,20 $. Les écarts extrêmes d'un petit nombre d'achats tendent à ne pas se répéter. Compter le premier achat dans la moyenne atténue déjà ce défaut.
    • Prendre la moyenne de tous les clients. Elle efface les différences réelles entre clients : sur les semaines mises de côté, c'est la pire des prévisions comparées.
    • Supposer une loi normale, comme Schmittlein et Peterson : elle admet des dépenses négatives et elle est symétrique [C11], alors que les dépenses sont asymétriques, avec une longue queue vers les gros montants [C12]. Ici, la moyenne des paniers, 35,08 $, dépasse la médiane, 27,50 $, qui dépasse le mode, 14,96 $.

    Multiplier le nombre d'achats prévus par la moyenne observée du client est tentant ; les auteurs écrivent que cela ignore le retour vers la moyenne [C46, C47].

    05

    L'intuition

    Le modèle repose sur trois hypothèses de fond [C14, C15, C16] : le montant de chaque achat d'un client varie au hasard autour de sa propre moyenne ; ces moyennes diffèrent d'un client à l'autre mais ne changent pas dans le temps ; et leur répartition entre clients ne dépend pas de la fréquence d'achat. Il y ajoute deux choix de forme, détaillés plus bas.

    Le modèle apprend de toute la base deux choses : combien les achats d'un même client varient autour de sa moyenne, et combien les moyennes varient d'un client à l'autre. Pour chaque client, la prévision est une moyenne pondérée entre la moyenne de la population et la moyenne observée du client [C20] ; plus le client a acheté, plus sa propre moyenne pèse [C21]. Sur ces données, un seul rachat donne déjà un poids de 0,69 à la moyenne du client ; quatre rachats, 0,90.

    06

    Les données nécessaires

    Pour chaque client, sur la période d'estimation :

    • le nombre x de ses achats répétés, c'est-à-dire sans compter le premier ;
    • le montant moyen z̄ de ces achats répétés : le tableau descriptif des auteurs porte sur la valeur moyenne des achats répétés [C07, C24].

    Les achats d'un même jour sont additionnés et comptent pour un seul achat ; cette convention retrouve exactement les 946 clients et le tableau descriptif des auteurs. Les clients sans achat répété n'entrent pas dans l'estimation des auteurs ; leur prévision est la moyenne de la population [C48]. La variante de la page compte aussi le premier achat : tous les clients y entrent, sauf 8 dont l'unique achat est enregistré à 0 $ dans le fichier.

    Il faut ensuite vérifier l'hypothèse d'indépendance : les auteurs mesurent une corrélation de 0,11 entre la dépense moyenne et le nombre d'achats [C38], qu'ils ne jugent pas assez forte pour remettre en cause le modèle [C41].

    07

    Le modèle formel

    Cette section s'adresse au praticien. Le décideur peut la sauter et reprendre à « Le calcul déclaré » : la phrase « En clair » qui la termine suffit.

    • z₁, …, z_x : les montants des x achats répétés d'un client ; z̄ leur moyenne. Z désigne le montant d'un achat ; un chapeau, comme dans p̂, désigne une valeur estimée.
    • Chaque montant suit une loi gamma de forme p et de taux ν (les auteurs disent « échelle » ; la moyenne vaut ζ = p/ν, la vraie dépense moyenne du client) [C17]. Le paramètre p est le même pour tous : tous les clients ont le même coefficient de variation, l'écart-type d'un achat rapporté à la moyenne du client, 1/√p [C19].
    • ν varie entre clients selon une loi gamma de forme q et de taux γ [C18] ; ces deux hypothèses de forme constituent le modèle Gamma-Gamma [C53]. La vraie moyenne ζ = p/ν suit alors une loi gamma inverse. La loi gamma a des propriétés proches de la loi log-normale, avec une queue un peu plus fine ; contrairement à la loi log-normale, elle donne des formules fermées [C13]. Le modèle adapte celui de Colombo et Jiang [C54].
    • Loi de la moyenne observée : f(z̄ | x) = Γ(px + q) / (Γ(px) Γ(q)) × γ^q z̄^(px−1) x^(px) / (γ + x z̄)^(px+q), où Γ est la fonction gamma, qui prolonge la factorielle, à ne pas confondre avec le paramètre γ. Cette formule donne la densité de probabilité d'une moyenne z̄ observée après x achats.
    • Moyenne de la population : E(Z) = pγ / (q − 1).
    • Prévision pour un client : E(Z | z̄, x) = p(γ + x z̄) / (px + q − 1), soit la moyenne pondérée (1 − w) E(Z) + w z̄, avec un poids w = px / (px + q − 1) donné à la moyenne du client [C20, C21].
    • Estimation : on retient les valeurs de p, q et γ qui rendent les moyennes observées des 946 clients les plus vraisemblables, c'est-à-dire le maximum de la log-vraisemblance, somme des ln f(z̄ | x), trouvé par une méthode numérique standard [C22].

    En clair : chaque client a sa vraie dépense moyenne, que ses premiers achats ne révèlent qu'en partie ; tant qu'il a peu acheté, on prévoit entre sa moyenne et celle de tous, et plus près de la sienne à chaque achat.

    08

    Le calcul déclaré

    1. Données. Le fichier publié, lu tel quel : 6 919 lignes, 2 357 clients, 244 091,94 $ ; les achats d'un même jour additionnés, il reste 6 696 jours d'achat. Estimation sur les semaines 1 à 39, jusqu'au 30 septembre 1997 ; semaines 40 à 78, du 1er octobre 1997 au 30 juin 1998, mises de côté, comme chez les auteurs [C06].
    2. Contrôle sur les valeurs publiées. Avant tout résultat, les deux programmes retrouvent les 946 clients ayant racheté [C07], les huit lignes du tableau descriptif de la note [C24, C25, C26, C27, C28, C29, C30, C31], les trois paramètres [C23], l'écart de neuf cents entre moyenne théorique et moyenne observée [C34], les deux modes [C35, C36], les corrélations [C38, C39, C40], les log-vraisemblances de l'article [C42] et la moyenne sur 78 semaines [C44]. Ils s'arrêtent en erreur sinon. Les quartiles sont calculés par la règle de Weibull, la position (n + 1) × probabilité, la seule courante qui retrouve les deux valeurs publiées.
    3. Estimation du maximum de vraisemblance sur les logarithmes de p, q et γ, par le simplexe de Nelder-Mead, un algorithme qui cherche le meilleur ajustement pas à pas, relancé jusqu'à stabilité ; les programmes vérifient ensuite que la pente de la vraisemblance y est nulle. La fonction log-gamma est écrite en clair dans les deux langages.
    4. Variante de la page : le même modèle, estimé sur tous les achats des semaines 1 à 39, premier compris. Elle a été ajoutée après une première lecture des semaines mises de côté, à la suite d'une revue : sa validation n'est donc pas aveugle, et ses erreurs-types ne tiennent pas compte de ce choix.
    5. Validation sur les semaines mises de côté : cinq prévisions de la dépense moyenne par achat sont comparées à ce que les clients ont dépensé : la moyenne des achats répétés, la moyenne de tous les achats, la moyenne de la population, le modèle des auteurs et la variante. L'erreur est la dépense observée moins la prévision ; positive, elle signale une sous-prévision. Chaque écart est donné avec son erreur-type, qui mesure l'imprécision due au seul choix des clients ; un écart de plus de deux erreurs-types est jugé net. Les écarts sont calculés avant arrondi.
    6. Dispersion d'un client autour de sa moyenne : pour les clients d'au moins trois rachats, le coefficient de variation observé de leurs achats est comparé à celui que donnent 200 simulations du modèle, avec les mêmes nombres d'achats.
    7. Incertitude : bootstrap, qui tire de nouveau au hasard, avec remise, 1 000 fois 946 clients parmi les 946, et réestime le modèle chaque fois ; intervalle de la 25ᵉ à la 975ᵉ valeur triée. Ces intervalles sont dits à 95 % nominal : c'est le niveau visé par la méthode, que rien ici ne garantit exactement. Le générateur de nombres pseudo-aléatoires est écrit en clair (graine 20261007 ; s ← 1103515245 · s + 12345 mod 2³¹), pour que Python et R tirent les mêmes nombres.
    8. Invariants : 19 identités, dont la loi de z̄ qui s'intègre à 1, sa moyenne égale à pγ / (q − 1) et la prévision égale à la moyenne pondérée ; les programmes s'arrêtent si l'une échoue.

    09

    L'exemple chiffré complet

    Les résultats publiés, recalculés. Valeur moyenne des achats répétés par client, semaines 1 à 39, en dollars :

    StatistiqueRecalculéePubliée
    Minimum2,992,99 [C24]
    Premier quartile15,74515,75 [C25]
    Médiane27,497527,50 [C26]
    Troisième quartile41,795641,80 [C27]
    Maximum299,6338299,63 [C28]
    Moyenne35,077835,08 [C29]
    Écart-type30,283530,28 [C30]
    Mode14,9614,96 [C31]

    Les paramètres sont retrouvés : p̂ = 6,2496, q̂ = 3,7442, γ̂ = 15,4435, pour 6,25, 3,74 et 15,44 publiés [C23]. L'outil Solveur d'Excel, dans le classeur des auteurs, s'arrête un peu ailleurs à la quatrième décimale, la surface de vraisemblance étant presque plate ; le maximum atteint ici est très légèrement plus haut. La moyenne théorique, 35,1704 $, dépasse la moyenne observée de 0,0925 $, les neuf cents des auteurs [C34]. Le mode de la loi ajustée tombe à 19 $, celui des données à 14,96 $, comme publié [C35, C36]. La corrélation entre dépense moyenne et nombre d'achats vaut 0,1139, et 0,0570 sans le client aux 21 achats et 299,63 $ de moyenne ; le test de nullité de cette corrélation donne alors une valeur p de 0,0801. Ce sont les 0,11, 0,06 et 0,08 publiés [C38, C39, C40].

    Deux écarts restent.

    • La log-vraisemblance. Au maximum, la formule de la note donne −4 055,92. L'article publie −4 659 [C42]. L'écart est exactement la somme des ln x des 946 clients, 603,37 : −4 055,92 − 603,37 = −4 659,29. L'article a donc vraisemblablement calculé la vraisemblance de la dépense totale x z̄, bien que la formule qu'il donne soit celle de la moyenne z̄ ; le maximum, et donc les paramètres, sont les mêmes. Avec cette convention, les paramètres estimés sur les 78 semaines donnent −4 661,41 sur les semaines 1 à 39, les −4 661 publiés [C42], et une moyenne de population de 35,81 $, les « 36 $ » des auteurs [C44].
    • L'asymétrie. L'article donne une asymétrie de 4 et un aplatissement de 17 [C32, C33]. La page trouve 17,15 pour l'aplatissement, en excès sur la loi normale, mais 3,40 pour l'asymétrie ; aucune variante de définition essayée ne donne 4.

    Le modèle ajusté. Les vraies moyennes des clients ont pour moyenne 35,17 $ et pour écart-type 26,63 $. Le modèle estime à 0,40 le coefficient de variation des achats d'un client autour de sa propre moyenne ; la suite montre que les données le contredisent.

    La prévision pour un client, en dollars par achat, selon le modèle des auteurs :

    Achats répétésPoids de la moyenne du clientMoyenne observée 20 $50 $100 $
    10,694924,6345,4880,22
    20,820022,7347,3388,33
    40,901121,5048,5393,59
    80,948020,7949,2396,63

    Pour le client au rachat unique de 100 $, on attend 80,22 $ par achat ; pour celui aux six rachats de 20 $, 21,03 $. Le poids de la moyenne du client atteint 90 %, un seuil choisi par la page, au quatrième rachat ; avec les paramètres estimés sur 78 semaines, au septième. Les auteurs jugent, sans seuil chiffré, qu'il faut sept ou huit achats avant de se fier à la moyenne observée [C45].

    La variante de la page, estimée sur tous les achats des semaines 1 à 39 : p̂ = 9,8813, q̂ = 3,3988, γ̂ = 7,9286, moyenne de population 32,66 $. Pour un client dont l'unique achat a coûté 100 $, la variante en attend 86,85 $, avec un poids de 0,80 donné à sa moyenne. Chez un même client, le premier achat est à peu près égal aux rachats : 36,14 $ en moyenne pour les 946 clients qui ont racheté, contre 35,08 $ pour la moyenne de leurs rachats, avec un rapport médian de 0,97. En revanche, les 1 411 clients qui n'ont pas racheté avaient fait un premier achat de 30,88 $ seulement : les clients dont le premier achat était plus petit ont moins racheté. La variante mêle ces deux groupes, et sa moyenne de population s'en trouve abaissée.

    La validation sur les semaines 40 à 78. Parmi les 946 clients ayant racheté, 491 achètent à nouveau. Erreur sur leur dépense moyenne par achat, en dollars, et écart d'erreur absolue avec la moyenne de tous les achats :

    PrévisionErreur absolue moyenneRacine de l'erreur quadratique moyenneErreur moyenneÉcart avec la moyenne de tous les achats
    Moyenne des achats répétés17,3529,652,30+1,26 (erreur-type 0,45)
    Moyenne de tous les achats16,0928,282,05—
    Moyenne de la population18,9431,622,67+2,85 (0,91)
    Modèle des auteurs16,3728,062,17+0,28 (0,41)
    Variante de la page15,7827,832,19−0,31 (0,09)

    Le modèle des auteurs réduit l'erreur de 5,6 % face à la moyenne des seuls rachats du client, soit 0,98 $ par achat (erreur-type 0,25), mais ne fait pas mieux que la moyenne de tous les achats : son écart, +0,28 $, est inférieur à son erreur-type. La variante fait mieux que cette moyenne simple, de 1,9 %, soit 0,31 $ par achat ; face au modèle des auteurs, son avantage, 0,59 $ (erreur-type 0,37), n'est pas net. C'est un gain moyen : la variante bat la moyenne simple pour 285 clients sur 491, soit 58,0 %.

    Pour 193 autres clients, qui n'avaient fait aucun rachat pendant l'estimation mais achètent ensuite, la valeur de leur seul achat se trompe de 20,25 $, la moyenne de la population, prévision du modèle des auteurs, de 20,92 $, la variante de 18,75 $. L'avantage de la variante est net face au seul achat, 1,51 $ (erreur-type 0,44), mais pas face à la moyenne de la population, 2,17 $ (erreur-type 1,72). Sur les 684 clients qui achètent pendant ces semaines, l'erreur vaut 17,27 $ pour la moyenne de tous les achats, 17,65 $ pour le modèle des auteurs, 16,62 $ pour la variante ; l'écart entre la variante et le modèle des auteurs, 1,03 $ (erreur-type 0,55), n'est pas net.

    Le retour vers la moyenne, par tranche de moyenne des rachats, prévisions du modèle des auteurs et de la variante :

    Tranche de moyenne des rachatsClientsMoyenne des rachatsModèle des auteursVarianteDépense observée ensuiteObservée moins modèle des auteurs
    Moins de 20 $14914,8419,4019,6526,827,42 (erreur-type 1,61)
    De 20 à 50 $25532,7833,1632,9133,570,41 (1,10)
    50 $ et plus8779,0770,8471,0369,20−1,64 (5,70)

    Les deux modèles tirent les moyennes extrêmes dans le bon sens, mais pas assez : les petits paniers sont nettement sous-prévus, de 7,42 $ par achat ; les gros paniers sont surprévus de 1,64 $, dans la marge du hasard.

    Le total de la base. Multipliée par le nombre d'achats réellement faits, la prévision du modèle des auteurs donne 68 181,97 $ de dépenses sur les semaines 40 à 78, pour 70 976,39 $ observés, soit −3,9 % ; la variante, −4,6 % ; la moyenne de tous les achats, −4,2 %. Par nombre de rachats pendant l'estimation, dépense totale moyenne par client sur ces semaines :

    RachatsClientsObservéePrévue par le modèle des auteursÉcart
    01 4118,308,33−0,03 (erreur-type 0,55)
    143927,4223,164,26 (1,82)
    221451,9253,72−1,80 (3,95)
    310063,1956,236,96 (4,47)
    46290,98100,75−9,77 (6,54)
    538124,45105,7018,75 (13,68)
    629127,17126,740,43 (8,29)
    7 et plus64246,04237,638,42 (12,84)

    Seule la ligne d'un rachat s'écarte au-delà du hasard : ces clients sont sous-prévus de 4,26 $. Les auteurs, qui ne donnent pas d'erreur-type, jugent à l'œil qu'aucun biais particulier ne remet en cause leurs hypothèses [C50].

    La dispersion d'un client autour de sa moyenne. Pour les 293 clients d'au moins trois rachats, le coefficient de variation médian de leurs achats vaut 0,47. Calculé sur quelques achats, un coefficient de variation est en moyenne plus petit que le vrai : le modèle en attend donc 0,36 et non 0,40, et dans 95 % des 200 simulations, entre 0,34 et 0,38. Les achats d'un client varient donc nettement plus que le modèle ne le suppose, surtout quand sa dépense est élevée : 0,38 pour les 61 clients sous 20 $, 0,48 pour les 180 de 20 à 50 $, 0,50 pour les 52 à 50 $ et plus.

    10

    Les hypothèses de validité

    • Une dépense indépendante de la fréquence [C16]. Ici, la corrélation est de 0,11, réduite de moitié quand on retire un seul client [C38, C39], et les auteurs n'y voient pas une violation sérieuse [C41]. Mais les clients qui ne rachètent pas avaient fait un premier achat plus petit, 30,88 $ contre 36,14 $ (écart 5,26 $, erreur-type 1,47) : un indice que dépense et fréquence ne sont pas tout à fait indépendantes. Pour des produits que les clients stockent, on peut s'attendre à un lien plus fort encore entre le rythme des achats et leur montant [C51]. Vos gros acheteurs achètent-ils aussi plus souvent, ou moins souvent ?
    • Une dépense moyenne stable dans le temps pour chaque client [C15]. La log-vraisemblance change à peine quand on passe de 39 à 78 semaines [C42, C43], mais les paramètres bougent : le poids d'un seul rachat passe de 0,69 à 0,59, et le client au rachat unique de 100 $ passe de 80,22 $ à 73,99 $. Le niveau moyen, lui, a peu changé : un rachat valait en moyenne 38,81 $ pendant l'estimation, un achat 37,71 $ ensuite. Vos prix, votre offre ou votre clientèle ont-ils changé depuis la période d'estimation ?
    • Le même coefficient de variation pour tous les clients [C19]. Les données le contredisent : les achats d'un client varient plus que prévu, surtout chez les gros clients. C'est une piste pour expliquer le retour vers la moyenne insuffisant, mais elle n'explique pas la sous-prévision des petits paniers, dont la dispersion est proche de celle du modèle. Vos gros clients ont-ils des paniers plus irréguliers que les petits ?
    • Une loi gamma des montants, sans seuils de prix. Le modèle ne connaît pas les prix ronds ou psychologiques, en ,99 : il place le mode à 19 $ quand les données le placent au prix d'un disque, 15 $ [C35, C36, C37]. Les auteurs ont préféré un modèle simple à un meilleur ajustement [C52]. Vos paniers se concentrent-ils sur quelques prix ?
    • Des achats répétés seulement, dans le modèle des auteurs : le premier achat n'entre pas dans la moyenne, et les clients sans rachat reçoivent la moyenne de la population [C48]. Quelle part de vos clients n'a pas encore racheté ?
    • Testable seulement indirectement : la loi gamma inverse des vraies moyennes, puisqu'on n'observe jamais une vraie moyenne, seulement des moyennes de quelques achats ; elle se juge par l'ajustement de la loi des moyennes observées. Non testable ici : que la moyenne d'un client reste stable au-delà du 30 juin 1998.

    11

    Diagnostics et incertitude

    • Ajustement : comparer la loi des moyennes observées à celle que prévoit le modèle. Ici, la moyenne théorique ne s'écarte de l'observée que de 0,0925 $, mais le mode prévu, 19 $, dépasse l'observé, 14,96 $ [C35].
    • Indépendance : calculer la corrélation entre dépense moyenne et nombre d'achats, avec et sans les clients extrêmes [C38, C40], et comparer le premier achat de ceux qui rachètent et de ceux qui ne rachètent pas.
    • Dispersion d'un client : comparer le coefficient de variation observé des achats de chaque client à celui du modèle ; ici 0,47 contre 0,36.
    • Validation hors période : comparer le modèle aux moyennes simples, y compris la moyenne de tous les achats, avec l'erreur-type de chaque écart. Pondérée par le nombre d'achats faits ensuite, l'erreur absolue moyenne garde le même classement : 13,44 $ pour la variante, 13,60 $ pour le modèle des auteurs, 13,80 $ pour la moyenne de tous les achats, 14,61 $ pour la moyenne des rachats.
    • Incertitude d'estimation, par bootstrap sur les 946 clients, intervalles à 95 % nominal : la moyenne de la population va de 33,26 à 37,02 $ ; la prévision pour le client au rachat unique de 100 $, de 72,95 à 88,58 $ ; le poids d'un seul rachat, de 0,59 à 0,82 ; le coefficient de variation, de 0,30 à 0,46 ; l'écart-type des vraies moyennes, de 21,75 à 32,58 $. Les données distinguent mal p de γ : p va de 4,68 à 10,85 et γ de 7,42 à 24,47, alors que les prévisions, qui les combinent, restent plus stables. Ces intervalles portent sur des prévisions moyennes, pas sur ce qu'un client dépensera réellement : un achat isolé varie bien davantage.
    • Ce que la validation ne vérifie pas : elle ne porte que sur les clients qui achètent de nouveau, chacun pesant autant quel que soit son nombre d'achats ; elle utilise le nombre d'achats réellement faits sur les semaines 40 à 78 et ne juge pas la prévision de ce nombre, qui revient à un autre modèle [C49]. Ces semaines comprennent les fêtes de fin d'année 1997, qui pourraient relever la dépense, ce que le niveau moyen ne montre pas. Rien n'est dit au-delà du 30 juin 1998.
    • Ce que ces données ne peuvent pas trancher : un seul détaillant, un seul produit, des clients recrutés en 1997 ; le résultat ne se transpose pas sans contrôle.

    12

    Interprétation

    Trois enseignements. D'abord, la moyenne des rachats d'un client est une mauvaise prévision quand il a peu acheté : un rachat unique de 100 $ annonce environ 80 $, pas 100 $. Le modèle chiffre ce retour vers la moyenne au lieu de le deviner.

    Ensuite, le modèle des auteurs n'apporte rien, sur ces données, face à une moyenne simple de tous les achats, premier compris : il gagne sur la moyenne des seuls rachats parce qu'il corrige, mais il se prive de l'information du premier achat. Nourri de tous les achats, le même modèle fait un peu mieux que cette moyenne simple, en moyenne sur les clients ; mais il a été choisi après coup, et son avantage sur le modèle des auteurs n'est pas net. Aucun ne prévoit mieux le total de la base : le gain porte sur la valeur de chaque client, pas sur le chiffre d'affaires global.

    Enfin, le modèle corrige trop peu : les clients à moins de 20 $ ont dépensé 26,82 $ par achat ensuite, quand il en prévoyait 19,40. Ces données n'en livrent pas la cause. Une dispersion de chaque client plus forte que prévu est mesurée ici, mais elle concerne surtout les gros clients ; les seuils de prix, la forme de la loi des vraies moyennes, le lien entre dépense et fréquence ou un changement dans le temps restent possibles.

    13

    Conclusions permises et interdites

    • Permis : « Pour un client de CDNOW qui a racheté une seule fois, pour 100 $, le modèle des auteurs prévoit une dépense moyenne d'environ 80 $ par achat pour ses achats suivants, de 72,95 à 88,58 $ à 95 % nominal en ne comptant que l'incertitude d'estimation. »
    • Permis : « Sur les semaines 40 à 78, le modèle estimé sur tous les achats, une variante choisie après une première lecture de ces semaines, se trompe en moyenne de 15,78 $ par achat, contre 16,09 $ pour la moyenne de tous les achats du client ; c'est à confirmer sur d'autres données. »
    • Interdit : présenter la prévision du modèle comme la valeur d'un client. Il ne prévoit que le montant par achat ; il faut le combiner à un modèle du nombre d'achats, comme le font les auteurs [C49], puis à une marge et à un taux d'actualisation [C55, C56].
    • Interdit : affirmer que le modèle des auteurs prévoit mieux que la moyenne passée du client sans dire laquelle : il bat la moyenne des rachats, pas la moyenne de tous les achats.
    • Interdit : en conclure qu'une action marketing ferait dépenser plus. Le modèle décrit des dépenses ; il ne mesure l'effet d'aucune action.
    • Interdit : appliquer les paramètres de CDNOW à une autre entreprise, ou appliquer le modèle sans avoir vérifié que la dépense de vos clients ne dépend pas de leur fréquence d'achat [C51].

    14

    Décision marketing possible

    • Valoriser chaque client avec une prévision corrigée, pas avec la moyenne de ses seuls rachats ; à défaut de modèle, la moyenne de tous ses achats fait presque aussi bien. Le modèle estimé sur tous les achats peut être envisagé, puis validé sur ses propres données, sur une période que l'on n'a pas encore regardée. Multiplier ensuite par le nombre d'achats futurs attendu, chacun ramené à sa valeur d'aujourd'hui, et par la marge, comme le font les auteurs, qui retiennent une marge de 30 % et une actualisation de 15 % par an [C49, C55, C56].
    • Ni surestimer un gros achat isolé, ni sous-estimer un petit : un rachat unique de 100 $ vaut une prévision de 80,22 $ selon le modèle des auteurs, et un client à 20 $ de moyenne après un seul rachat, 24,63 $ ; les données montrent même que la correction devrait être plus forte pour les petits paniers.
    • Contrôler sur ses propres données, avant de s'en servir, l'indépendance entre dépense et fréquence, la dispersion des achats de chaque client et la validation face à la moyenne de tous les achats ; réestimer après tout changement de prix.

    La décision reste humaine et engage la direction marketing et, pour la valeur des clients, la direction financière.

    15

    Quand l'utiliser, quand ne pas l'utiliser

    • Utiliser : des achats répétés aux montants variables, hors abonnement, quand on veut la valeur de chaque client ; en complément d'un modèle du nombre d'achats, comme celui de la page sur l'estimation de la CLV non contractuelle ou celui de la page sur la valeur d'un client saisonnier.
    • Utiliser avec prudence quand la dépense dépend de la fréquence, par exemple pour des produits que l'on stocke [C51] : il faut alors un modèle qui relie le nombre d'achats et leur montant au lieu de les supposer indépendants. Prudence aussi quand les prix se concentrent sur quelques valeurs [C37], ou quand les achats d'un client sont très irréguliers.
    • Ne pas utiliser pour un abonnement à prix fixe, où le montant est connu : voir la page sur la valeur d'un abonné ; ni pour valoriser la base entière avec les clients futurs : voir la page sur la valeur de la base clients.
    • Ne pas utiliser pour mesurer l'effet d'une action sur la dépense : il faut une expérience.
    • Pour exprimer l'incertitude d'un résultat, voir la page sur l'expression de l'incertitude ; pour juger une prévision sur une période mise de côté, celle sur la validation d'une prévision marketing.

    16

    Implémentations reproductibles

    • Python 3.14.5, bibliothèque standard seule : msc-p046-reference.py, à lancer par python msc-p046-reference.py
    • R 4.6.1, base seule : msc-p046-reference.R, à lancer par Rscript msc-p046-reference.R
    • Les données ne sont pas redistribuées : télécharger l'échantillon CDNOW sur brucehardie.com/datasets et placer CDNOW_sample.txt à côté des programmes.
    • Les deux programmes impriment exactement les mêmes lignes ; leur empreinte sha256, après normalisation des fins de ligne, est consignée dans le manifeste du dossier. Graine déclarée 20261007. Aucune bibliothèque tierce : le logiciel ne valide pas la méthode, il la reproduit.

    17

    Livrable

    Pour chaque client, le nombre d'achats, leur montant moyen et la prévision corrigée avec son poids ; les paramètres estimés et leur intervalle ; le contrôle d'indépendance entre dépense et fréquence et celui de la dispersion de chaque client ; la validation sur une période mise de côté, face à la moyenne de tous les achats, avec les erreurs-types ; et les hypothèses à vérifier avant décision.

    18

    Références et niveau de preuve

    • Fader, P. S., Hardie, B. G. S. & Lee, K. L. (2005). RFM and CLV: Using Iso-Value Curves for Customer Base Analysis. Journal of Marketing Research 42(4), 415–430. — version auteur diffusée par Bruce Hardie, texte intégral vérifié ; Schmittlein et Peterson (1994) et Colombo et Jiang (1999) y sont cités.
    • Fader, P. S. & Hardie, B. G. S. (2013). The Gamma-Gamma Model of Monetary Value. Note technique. brucehardie.com/notes/025 — texte intégral vérifié.
    • Échantillon CDNOW et sa notice, publiés par Bruce Hardie : brucehardie.com/datasets (CDNOW_sample.zip) ; la cohorte complète compte 23 570 clients [C04].
    • Niveau de preuve : données réelles, un détaillant, 1997 et 1998 ; résultats publiés retrouvés à partir des données, sauf l'asymétrie ; validation sur 39 semaines mises de côté, avec une variante ajoutée après une première lecture de ces semaines ; reproductible en Python et en R. Ce n'est pas une preuve que le modèle convient à votre entreprise.

    Connexions méthodologiques

    Territoire parentScience client et choix : comportement, valeur et hétérogénéitéComparer avecComment estimer la CLV avec BG/NBD et Gamma-Gamma ?Comparer avecCombien vaut un client qui achète au plus une fois par saison ?Comparer avecCombien valent les clients d’une entreprise, actuels et futurs ?PrérequisComment exprimer l’incertitude d’un résultat marketing ?ValideComment valider une prévision marketing ?

    À lire ensuite

    MSC-H-004Science client et choix : comportement, valeur et hétérogénéité→MSC-P-028Comment estimer la CLV avec BG/NBD et Gamma-Gamma ?→MSC-P-044Combien vaut un client qui achète au plus une fois par saison ?→MSC-P-045Combien valent les clients d’une entreprise, actuels et futurs ?→