Comment traiter l’endogénéité du prix ?
Le prix est endogène lorsqu’il covarie avec des déterminants non observés de la demande. Contrôles, effets fixes ou variables instrumentales répondent à des sources de biais différentes.
Réponse directe
Estimer une élasticité sous un ensemble déclaré d’hypothèses d’identification.
Le prix est endogène lorsqu’il covarie avec des déterminants non observés de la demande. Contrôles, effets fixes ou variables instrumentales répondent à des sources de biais différentes.
01
Pourquoi prix et ventes ne suffisent pas
Une baisse de prix accompagnée d’une hausse des ventes ne prouve pas que la baisse a causé cette hausse. Le prix a peut-être été réduit précisément parce que la demande ralentissait. Une promotion, une rupture concurrente, la saison ou un changement d’assortiment peuvent aussi déplacer simultanément le prix et les quantités.
- 01
Problème métier : le prix influence les ventes, mais les ventes anticipées influencent aussi le prix.
- 02
Problème statistique : le prix est corrélé à des déterminants non observés contenus dans l’erreur.
- 03
Stratégie IV : isoler une variation du prix issue d’une source externe à la demande non observée.
02
Exemple marketing suivi de bout en bout
Illustration synthétique : valeurs pédagogiques, non observées et non réutilisables comme benchmark.
Le jeu synthétique suit 60 produits pendant 10 semaines, soit 600 lignes. Le prix répond à un choc de coût fournisseur, mais aussi à un choc de demande non observé. La quantité répond au prix, à la promotion, à la saison et à ce même choc de demande. Cette construction rend le prix endogène tout en conservant un instrument pertinent et exogène par construction.
Dans cette réalisation synthétique, OLS est biaisée vers zéro et 2SLS se rapproche du coefficient générateur −1,20. La valeur −1,011 n’est ni un benchmark ni une élasticité universelle. Elle décrit uniquement la variation de prix isolée par ce protocole synthétique, sous ses hypothèses déclarées.
03
Question scientifique et estimand
Pour les 60 produits et les 10 semaines du fichier, quel est le coefficient log-log du prix sur la quantité pour la variation de prix induite par le choc de coût fournisseur, conditionnellement à la promotion et à la saison ? L’estimand est β dans l’équation structurelle déclarée, avec une inférence clusterisée au niveau produit.
Contrefactuel : pour un même produit i et une même semaine t, comparer Qᵢₜ(p₁) à Qᵢₜ(p₀) lorsque seul le prix log p varie par la composante induite par Z, les contrôles X étant maintenus constants. Ce contraste est défini par le modèle structurel homogène déclaré ; il n’est pas directement observé.
04
Pourquoi la régression simple peut échouer
OLS attribue au prix toute variation résiduelle commune au prix et à la demande. Ici, le choc de demande non observé augmente simultanément le prix et la quantité. La condition E[u | ln(P), X] = 0 est donc violée. Le sens et l’ampleur du biais dépendent du processus de fixation du prix ; ils ne se déduisent pas d’une règle universelle.
05
Le mécanisme causal à rendre crédible
06
Données nécessaires et qualité minimale
- Unité : produit × semaine ; 600 lignes, 60 clusters produit et 10 périodes sans valeurs manquantes dans l’exemple.
- Variables : log_quantity, log_price, supplier_cost_shock, promotion, season_index, product_id et week.
- À documenter sur des données réelles : source du coût, calendrier de fixation, ruptures, qualité, assortiment, promotions, concurrence, erreurs de mesure, attrition et support de prix.
07
Modèle formel et symboles
ln(Pᵢₜ) = α₁ + πZᵢₜ + δXᵢₜ + vᵢₜ
ln(Qᵢₜ) = α₂ + βln(Pᵢₜ) + γXᵢₜ + uᵢₜ
i, t | indices du produit et de la semaine |
|---|---|
Q | quantité vendue ; log_quantity est observé |
P | prix ; log_price est observé mais endogène |
Z | supplier_cost_shock, instrument candidat observé |
X | promotion et season_index, contrôles observés |
β | coefficient 2SLS estimé de ln(P) dans l’équation de quantité |
π | coefficient de première étape de Z sur ln(P) |
α₁, α₂ | constantes des équations de prix et de quantité |
δ, γ | vecteurs de coefficients des contrôles X dans les deux équations |
ln(P)̂ | log-prix ajusté projeté par Z et X à la première étape |
Qᵢₜ(p) | quantité contrefactuelle du produit i en semaine t sous le log-prix p |
u, v | erreurs non observées des équations structurelle et de prix |
08
Ce que font réellement les deux étapes
Étape 1 : expliquer le prix
ln(P) = α₁ + πZ + δX + vOn estime la part du logarithme du prix expliquée par l’instrument Z et les contrôles X. Cette étape produit la valeur ajustée de ln(P), notée ln(P)̂, utilisée par le modèle IV.
Étape 2 : expliquer les quantités
ln(Q) = α₂ + β·ln(P)̂ + γX + uβ est estimé à partir de la variation de prix projetée par l’instrument, pas à partir de toute la variation observée de P. Pour l’inférence, utilisez un estimateur 2SLS complet : une seconde OLS manuelle sur la valeur ajustée de ln(P) donnerait des erreurs standards incorrectes.
09
Résultat numérique reproductible
Le script standard library reproduit : βOLS = −0,577216 (ET 0,046332), π = 0,434136 (ET 0,027147), R² partiel = 0,310020, Wald clusterisé χ²(1) = 255,749005 et βIV = −1,011208 (ET 0,083104 ; IC asymptotique à 95 %, z = 1,96, 60 clusters : [−1,174092 ; −0,848325]). Le coefficient exploratoire du résidu de première étape vaut 0,628993 (ET 0,091948 ; t descriptif = 6,840731). Parce qu’il utilise un régresseur généré, ce dernier calcul n’est pas présenté comme un test formel cluster-robuste et ne valide pas l’exclusion.
10
Six conditions et contrôles à traduire en questions métier
| Condition ou contrôle | Question opérationnelle | Preuve à documenter |
|---|---|---|
| Pertinence | L’instrument fait-il suffisamment varier le prix après les contrôles ? | Coefficient de première étape, R² partiel et statistique robuste adaptée au plan. |
| Indépendance | Z est-il indépendant de la demande non observée conditionnellement à X ? | Chronologie, processus de fixation, équilibre des covariables et connaissance du marché. |
| Exclusion | Z peut-il affecter les ventes autrement que par le prix ? | DAG, audit opérationnel et recherche de voies directes comme disponibilité, qualité ou assortiment. |
| Force | La variation isolée est-elle assez informative pour une estimation stable ? | Diagnostics d’instruments faibles et intervalles robustes à l’identification faible. |
| Hétérogénéité | L’hypothèse d’un coefficient structurel homogène est-elle défendable ? | L’exemple impose un β homogène. Sur données réelles, documenter l’hétérogénéité et ne pas transformer automatiquement le 2SLS en élasticité universelle. |
| Sensibilité | Le résultat résiste-t-il à d’autres spécifications plausibles ? | Fenêtres, contrôles, effets fixes, clusters, instruments et échantillons alternatifs déclarés. |
Pertinence et force sont quantifiables. Indépendance et exclusion ne sont pas testables à partir du seul fichier ; elles exigent une justification causale externe.
11
Diagnostics à produire avant d’interpréter β
- 01
Première étape : coefficient de Z, R² partiel et statistique robuste. F > 10 n’est pas une validation universelle.
- 02
Instruments faibles : compléter l’intervalle 2SLS par une inférence robuste de type Anderson–Rubin ou CLR lorsque l’identification est incertaine.
- 03
Incertitude : choisir des erreurs standards robustes ou clusterisées cohérentes avec l’unité d’assignation et la dépendance temporelle.
- 04
Suridentification : disponible seulement avec plus d’instruments exclus que de variables endogènes. Un non-rejet ne prouve pas leur validité.
- 05
Endogénéité : un test Durbin–Wu–Hausman non significatif ne prouve pas que le prix est exogène, notamment avec un instrument faible.
- 06
Sensibilité : comparer OLS, 2SLS, spécifications alternatives et domaines de support sans choisir après coup le résultat préféré.
12
Interpréter le résultat sans le surétendre
Dans le modèle log-log homogène déclaré, βIV = −1,011 signifie qu’une hausse de prix de 1 % induite par Z correspond, sous les hypothèses IV et structurelles, à environ 1,011 % de quantité en moins sur le support étudié. Pour +5 %, le calcul fini donne 100 × [(1,05)^−1,011208 − 1] = −4,81 %. Cette conversion ne transporte pas l’effet hors de la population, de la période ou du mécanisme de coût étudiés.
13
Ce que vous pouvez conclure
Sous les hypothèses d’identification et l’hypothèse structurelle homogène explicitement imposée dans cet exemple, β décrit la réponse causale à la variation de prix induite par l’instrument, dans la population, la période et le support analysés. Une hausse de 1 % correspond alors approximativement à β % de variation des quantités ; le calcul fini exact est 100 × [(1,01)^β − 1].
Cette élasticité s’applique nécessairement à tous les produits, clients, périodes, niveaux de prix et futures politiques tarifaires.
14
Décision marketing possible
Décision possible : comparer un scénario de hausse de prix borné au support observé avec un scénario sans hausse, en présentant séparément volume, marge et intervalle d’incertitude. Décision impossible : automatiser un prix optimal ou extrapoler à des produits, clients ou niveaux de prix non couverts. Si l’exclusion ou l’indépendance restent fragiles, la décision doit être reportée ou remplacée par une expérimentation sûre.
15
Quand ne pas utiliser cette méthode
- Aucun instrument crédible n’est disponible.
- L’instrument candidat affecte directement la demande, la disponibilité, la qualité ou l’assortiment.
- La première étape est trop faible pour produire une estimation utile.
- Le nombre d’observations ou de clusters est insuffisant pour l’incertitude visée.
- Une expérimentation tarifaire éthique et opérationnellement sûre est possible.
- Une règle connue de fixation du prix permet une stratégie d’identification plus directe.
16
Implémentations de référence
Python 3.13 · standard library · reference
python msc-p020-reference.py --csv msc-p020-price-endogeneity.csvTéléchargerR 4.5 · ivreg / sandwich / lmtest · companion syntax not executed in this build
library(ivreg); library(sandwich); library(lmtest)
d <- read.csv('msc-p020-price-endogeneity.csv')
fit <- ivreg(log_quantity ~ log_price + promotion + season_index |
supplier_cost_shock + promotion + season_index, data=d)
summary(fit, diagnostics=TRUE)
coeftest(fit, vcov.=vcovCL(fit, cluster=d$product_id, type='HC1'))Documentation officielleIBM SPSS Statistics 31 · secondary syntax
2SLS log_quantity WITH log_price promotion season_index
/INSTRUMENTS=promotion season_index supplier_cost_shock
/ENDOGENOUS=log_price
/PRINT=COV.Documentation officielleSAS 9.4 · secondary syntax
proc syslin data=pricing 2sls;
endogenous log_price;
instruments supplier_cost_shock promotion season_index;
model log_quantity = log_price promotion season_index;
run;Documentation officiellePython est l’unique référence exécutée dans ce build. Le bloc R est une syntaxe complémentaire non exécutée ici ; SPSS et SAS sont secondaires et ne reproduisent pas l’inférence clusterisée. Aucune syntaxe ne rend l’instrument valide : vérifiez les versions, la covariance et les diagnostics d’instruments faibles dans votre environnement.
17
Livrable attendu pour une décision tarifaire
- 01
Question tarifaire, population, unité d’analyse, période et estimand log-log.
- 02
DAG et justification écrite de pertinence, indépendance et exclusion.
- 03
Première étape complète, force de l’instrument et domaine de variation identifié.
- 04
Coefficient 2SLS, intervalle adapté, inférence robuste aux instruments faibles et plan de cluster.
- 05
Comparaison OLS/IV, sensibilités, limites de transport et décisions explicitement interdites.
18
Repères scientifiques
Montre pourquoi l’endogénéité des variables marketing, dont le prix, peut biaiser les paramètres et les usages décisionnels des modèles de choix.
Clarifie que l’interprétation causale IV dépend d’hypothèses explicites sur l’instrument, l’assignation et le modèle structurel.
Établit le risque de biais et d’instabilité lorsque les instruments expliquent peu la variable endogène.
19
Niveau de preuve et limites de transport
Niveau du dossier : méthode illustrée et répliquée sur données synthétiques, avec trois textes intégraux vérifiés au niveau des affirmations. Il ne s’agit ni d’une validation empirique d’un instrument réel ni d’une preuve de transportabilité. Sur données réelles, la pertinence est quantifiable ; l’indépendance et l’exclusion restent des hypothèses causales à défendre par le processus métier, le graphe causal et des sensibilités.
Dataset · Outil
Connexions méthodologiques
