Research & Evidence

Buscar un método

Busca entre títulos, preguntas, territorios e identificadores MSC.

41 resultados
  1. MSC-P-001¿Cómo transformar una afirmación de marketing en una pregunta comprobable?Ciencia de la decisión↗
  2. MSC-P-002Correlación o causalidad: ¿qué permite afirmar realmente un análisis?Medición de marketing↗
  3. MSC-P-003¿Cómo expresar la incertidumbre de un resultado de marketing?Ciencia de la decisión↗
  4. MSC-P-004Significación o tamaño del efecto: ¿qué resultado debe interpretarse?Ciencia de la decisión↗
  5. MSC-P-005¿Cómo medir un constructo de marketing que no es directamente observable?Investigación de mercados↗
  6. MSC-P-006¿Cómo diseñar y validar una escala de medición?Investigación de mercados↗
  7. MSC-P-007Alfa u omega: ¿cómo evaluar la fiabilidad de una escala?Investigación de mercados↗
  8. MSC-P-009ACP, AFE o AFC: ¿qué método elegir?Investigación de mercados↗
  9. MSC-P-010¿Cuándo debe realizarse un experimento de marketing?Medición de marketing↗
  10. MSC-P-011¿Cómo diseñar una prueba A/B que estime realmente un efecto?Medición de marketing↗
  11. MSC-P-012¿Cuántas observaciones necesita un experimento?Ciencia de la decisión↗
  12. MSC-P-013¿Cómo medir el efecto incremental de una campaña con un grupo de control?Medición de marketing↗
  13. MSC-P-017¿Cómo detectar selección, contaminación y pérdida en un experimento?Medición de marketing↗
  14. MSC-P-018Regresión predictiva o causal: ¿qué se intenta estimar?Modelos de marketing↗
  15. MSC-P-019¿Cómo diagnosticar una regresión de marketing antes de interpretarla?Modelos de marketing↗
  16. MSC-P-022¿Cómo estimar la elasticidad-precio y su incertidumbre?Ciencia de precios↗
  17. MSC-P-026Logit vs Probit: ¿cómo elegir para una probabilidad de compra?Ciencia del cliente↗
  18. MSC-P-029¿Qué clientes presentan la mayor probabilidad de abandono?Ciencia del cliente↗
  19. MSC-P-027TAM, UTAUT o UTAUT2: ¿qué marco usar para estudiar la aceptación tecnológica?Investigación de mercados↗
  20. MSC-H-001Medición y causalidad: ¿cómo establecer un efecto de marketing?Medición de marketing↗
  21. MSC-H-002Modelos de respuesta de marketing: forma, retardo y saturaciónModelos de marketing↗
  22. MSC-H-003Ciencia de precios: conectar precio, demanda y contribuciónCiencia de precios↗
  23. MSC-H-004Ciencia del cliente y elección: comportamiento, valor y heterogeneidadCiencia del cliente↗
  24. MSC-H-005Ciencia de la medición: construir indicadores válidosInvestigación de mercados↗
  25. MSC-H-006Métodos estadísticos de decisión: elegir, cuantificar, validarCiencia de la decisión↗
  26. MSC-P-008¿Cómo validar una escala de medición de marketing?Investigación de mercados↗
  27. MSC-P-014¿Cómo diseñar un experimento geográfico de marketing?Medición de marketing↗
  28. MSC-P-015¿Cómo estimar un efecto con diferencias en diferencias?Medición de marketing↗
  29. MSC-P-020¿Cómo tratar la endogeneidad del precio?Ciencia de precios↗
  30. MSC-P-021Efectos fijos o aleatorios: ¿qué modelo de panel elegir?Modelos de marketing↗
  31. MSC-P-023¿Cómo estimar una función de demanda?Ciencia de precios↗
  32. MSC-P-024¿Cómo simular un escenario precio-volumen-margen?Ciencia de precios↗
  33. MSC-P-028¿Cómo estimar la CLV con BG/NBD y Gamma-Gamma?Ciencia del cliente↗
  34. MSC-P-030¿Cómo analizar la retención con un modelo de supervivencia?Ciencia del cliente↗
  35. MSC-P-043¿Cuánto vale un suscriptor con solo seis meses de retención observada?Ciencia del cliente↗
  36. MSC-P-031¿Cómo construir una segmentación de clientes útil?Ciencia del cliente↗
  37. MSC-P-032¿Cómo probar la estabilidad de una segmentación?Ciencia del cliente↗
  38. MSC-P-033¿Cómo validar un pronóstico de marketing?Ciencia de la decisión↗
  39. MSC-P-034¿Cómo construir una simulación Monte Carlo para una decisión de marketing?Ciencia de la decisión↗
  40. MSC-P-035¿Cómo modelar saturación y adstock?Modelos de marketing↗
  41. MSC-P-039¿Qué prueba estadística elegir?Ciencia de la decisión↗
← Todos los métodos
FICHA DE MÉTODOMSC-P-031Ciencia del clienteDosier científico verificado

¿Cómo construir una segmentación de clientes útil?

Una segmentación útil conecta variables admisibles, distancia, algoritmo, estabilidad y uso decisional. Los grupos no son esencias naturales sino una representación condicional.

Redacción científica: Marketing Science Center

Respuesta directa

Construir una partición descriptiva accionable y documentar su incertidumbre.

Una segmentación útil conecta variables admisibles, distancia, algoritmo, estabilidad y uso decisional. Los grupos no son esencias naturales sino una representación condicional.

Rousseeuw, 1987Hennig, 2007

01 · PROTOCOLO

Resumen operativo

Novecientos clientes se reparten en cuatro segmentos mediante una construcción enteramente declarada, sin sorteo. En el caso sintético sellado los tamaños son 283, 246, 184 y 187, la silueta media 0,407973 y el índice de Rand ajustado entre dos reconstrucciones independientes 0,984661. El ingreso del trimestre siguiente, nunca usado para construir los segmentos, va de 69,260000 a 644,625668 según el segmento, con una razón de 9,307330. Los cuatro controles pasan. Veredicto: SEGMENTATION_READABLE_FOR_ACTION.

02 · PROTOCOLO

Situación de marketing concreta

Un equipo de CRM quiere dejar de tratar su base como un bloque único. Para cada cliente dispone de recencia, frecuencia, cesta media, número de categorías compradas y proporción de pedidos en línea. Quiere cuatro grupos, porque cuatro es el número de programas relacionales que puede animar de verdad. La pregunta no es encontrar los grupos verdaderos, que no existen como tales, sino obtener un reparto que se sostenga y sirva para decidir.

03 · PROTOCOLO

Pregunta científica

Para estos novecientos clientes, estas cinco variables declaradas y esta distancia declarada, ¿el reparto en cuatro segmentos está separado, equilibrado, es reproducible en otras observaciones y distingue un resultado que la construcción nunca vio? La pregunta no trata de si existen grupos naturales en la clientela, sino de si un reparto declarado se sostiene y resulta útil para decidir.

04 · PROTOCOLO

Por qué puede fallar el enfoque simple

Lanzar un algoritmo de partición y comentar los grupos obtenidos siempre produce grupos: el método fabrica tantos como se le piden, incluso en una nube sin estructura. Cambiar las variables, la escala o la distancia cambia el resultado, y un sorteo inicial distinto puede mover las fronteras. Sin controles se describe un artefacto del algoritmo y se le llama segmentación de clientes. La expresión «segmento verdadero» tampoco tiene definición operativa en la literatura.

05 · PROTOCOLO

Intuición del método

El método consiste en declararlo todo antes de mirar: las cinco variables, su transformación, su escala, la distancia, el número de segmentos, el punto de partida de los centros y los cuatro umbrales. El arranque no se sortea: son las observaciones situadas en cuatro rangos fijos de una puntuación compuesta declarada. Después el reparto se somete a cuatro preguntas: ¿están separados los segmentos, son todos accionables, reaparecen al reconstruir sobre otros clientes y distinguen un resultado ajeno a la construcción?

06 · PROTOCOLO

Datos necesarios

Se fijan antes de cualquier lectura: el identificador de cliente ordenado sin huecos, la recencia, la frecuencia, la cesta media, el número de categorías, la proporción en línea, el ingreso del trimestre siguiente, las transformaciones declaradas, la estandarización, el número de segmentos fijado en cuatro por el contexto de decisión, el arranque declarado y los cuatro umbrales. El ingreso nunca entra en la construcción. El archivo sellado contiene novecientos clientes. El caso es sintético y así se declara.

07 · PROTOCOLO

Modelo formal y símbolos

Cada cliente es un vector de cinco coordenadas estandarizadas: logaritmo de la recencia, frecuencia, logaritmo de la cesta, número de categorías, proporción en línea. La distancia es euclídea al cuadrado. Un segmento es un conjunto de clientes más cercanos a su centro que a cualquier otro; el centro es la media de sus miembros. La silueta de un cliente compara su distancia media a los miembros de su segmento con su distancia media al segmento más cercano. El índice de Rand ajustado compara dos repartos corrigiendo el acuerdo debido al azar.

08 · PROTOCOLO

Cálculo declarado

El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme; transformar y estandarizar las cinco variables sobre todo el archivo; colocar los cuatro centros iniciales en los rangos declarados de la puntuación compuesta e iterar hasta que las asignaciones dejen de cambiar o cien pasadas, fallando si un segmento se vacía; informar tamaños y cuotas y aplicar el umbral de equilibrio; calcular la silueta media sobre la muestra sistemática declarada; reconstruir por separado sobre clientes pares e impares, reasignar todo el archivo bajo cada solución y calcular el índice de Rand ajustado; calcular las medias de ingreso por segmento, su razón y la varianza explicada, y aplicar la regla del veredicto.

09 · PROTOCOLO

Ejemplo numérico completo

Ilustración sintética — valores didácticos, no observados

En el archivo sellado: 900 clientes, 4 segmentos. Tamaños 283, 246, 184, 187; cuotas 0,314444, 0,273333, 0,204444 y 0,207778; cuota más pequeña 0,204444, control superado. Silueta media 0,407973, control superado. Índice de Rand ajustado entre las dos reconstrucciones 0,984661, control superado. Ingreso medio por segmento: 192,210318; 106,899593; 69,260000; 644,625668. Razón entre el más alto y el más bajo 9,307330 y varianza explicada 0,692635, control superado. Veredicto: SEGMENTATION_READABLE_FOR_ACTION.

10 · PROTOCOLO

Supuestos de validez

La construcción supone que las cinco variables describen lo que el equipo quiere distinguir, que la estandarización les da un peso aceptable, que la distancia euclídea tiene sentido en esas coordenadas y que cuatro segmentos corresponden a una capacidad real de acción. No supone que existan grupos naturales. Tres cosas no son comprobables aquí: la pertinencia de las variables elegidas, la estabilidad del reparto en el tiempo y que un segmento reaccione distinto a una acción, lo cual compete a un experimento.

11 · PROTOCOLO

Diagnósticos e incertidumbre

La silueta mide una separación relativa bajo la distancia declarada, no una verdad geométrica: sería distinta con otras variables. Aquí se calcula sobre una muestra sistemática de clientes, pero comparados con todos los clientes; una biblioteca estándar que restringe las distancias solo a los puntos muestreados devuelve 0,406210 en vez de 0,407973 en este archivo, y la página lo señala en lugar de sugerir una definición única. El índice de Rand ajustado alcanza 0,984661 porque la estructura sintética es nítida; en datos reales, un valor por encima de 0,60 ya es tranquilizador. Ninguno de estos números es una p.

12 · PROTOCOLO

Robustez y alternativas

Alternativas declaradas antes del resultado: rehacer el reparto con tres o cinco segmentos y comparar los cuatro controles; sustituir la estandarización por una ponderación explícita de las variables y publicar ambos perfiles; quitar la proporción en línea, que puede reflejar un canal de captación más que un comportamiento; o sustituir la partición por un método que admita pertenencias parciales. Cada variante debe anunciarse antes de leer y reportarse aunque cambie los segmentos.

13 · PROTOCOLO

Interpretación del resultado

Los cuatro controles pasan, así que el reparto puede servir para decidir. El resultado utilizable es el perfil de los segmentos y la brecha de valor entre ellos: un segmento concentra un ingreso medio de 644,625668 en el trimestre siguiente, otro de 69,260000, y el reparto explica el 69,2635 por ciento de la varianza del ingreso. Esa estructura justifica programas diferenciados. No dice que un programa hará reaccionar más a un segmento que a otro: es una asociación, medida sobre un resultado que la construcción no vio, no un efecto.

14 · PROTOCOLO

Conclusiones permitidas

Permitido: publicar los perfiles de los segmentos, sus tamaños, su separación, su reproducibilidad y su brecha de valor; construir cuatro programas relacionales distintos; seguir en el tiempo la cuota de cada segmento; concluir que la base no es homogénea y que cuatro grupos se sostienen bajo los criterios declarados. También permitido: decir que estos segmentos dependen de las variables elegidas y republicar el reparto si esas variables cambian.

15 · PROTOCOLO

Conclusiones prohibidas

Prohibido: presentar estos cuatro segmentos como los grupos verdaderos de la clientela; afirmar que un cliente pertenece definitivamente a su segmento, cuando cambia de posición en cuanto cambian sus compras; atribuir la brecha de ingreso a la pertenencia al segmento como si fuera un efecto; elegir el número de segmentos tras ver los perfiles y luego publicar los controles como si se hubiera fijado de antemano; o trasladar estos segmentos a otro mercado. También prohibido: presentar este caso sintético como una medición observada.

16 · PROTOCOLO

Posible decisión de marketing

La decisión razonable consiste en dar a cada segmento un programa relacional distinto, dimensionado por su cuota y su brecha de valor, y después medir el efecto de esos programas con un experimento en vez de comparando los segmentos entre sí. El segmento más denso en valor justifica el mayor esfuerzo, pero nada asegura todavía que responda mejor: lo dirá la campaña siguiente, con un grupo de control en cada segmento.

17 · PROTOCOLO

Cuándo usar o evitar el método

Usar este método cuando el equipo sabe cuántos programas puede animar y qué variables describen lo que quiere distinguir. Evitarlo como herramienta de pura exploración: sin un propósito declarado, ningún criterio dice que un reparto sea mejor que otro. Evitarlo también cuando las variables elegidas miden sobre todo el canal de captación, cuando la base acaba de renovarse o cuando el objetivo real es medir el efecto de una acción, lo que exige un experimento.

18 · PROTOCOLO

Implementaciones y entregable final

El CSV CC0 contiene los novecientos clientes sintéticos. Python y R son las implementaciones de referencia; SPSS retoma el mismo cálculo en un bloque Python; SAS recibe los mismos cuatro puntos de partida declarados pero aplica su propio orden de asignación y su regla de convergencia, y verifica equilibrio y utilidad en vez de reproducir cada decimal. El entregable final reúne los datos, el diccionario de variables, las variables y la distancia declaradas, el número de segmentos y su motivo, el arranque declarado, los cuatro umbrales, los siete pasos numerados, los perfiles, los cuatro controles, el veredicto y las versiones de software.

19 · PROTOCOLO

Fuentes y nivel de evidencia

Hennig recuerda que un análisis de partición se vuelve científico por la transparencia de sus elecciones, no por la unicidad de su resultado, y que la noción de grupo verdadero rara vez se define. Von Luxburg, Williamson y Guyon muestran que ningún procedimiento general ordena los métodos de partición sin tener en cuenta el contexto de uso. Romano et al. sitúan el índice de Rand ajustado entre las medidas corregidas por azar. Ullmann, Hennig y Boulesteix formalizan la validación de un reparto sobre otras observaciones, dividiendo el archivo en dos mitades. Referencias fundacionales: Hennig (2015, preprint en arXiv; publicado en Pattern Recognition Letters, con revisión por pares) y von Luxburg, Williamson y Guyon (2012, actas con revisión, sin DOI). Desarrollos recientes: Romano et al. (2016, Journal of Machine Learning Research, con revisión, sin DOI) y Ullmann, Hennig y Boulesteix (2021, preprint en arXiv; publicado en WIREs Data Mining and Knowledge Discovery, con revisión).

  1. Hennig (2015) Texto completo verificado, con extracto breve localizado en la fuente.
  2. von Luxburg, Williamson & Guyon (2012) Texto completo verificado, con extracto breve localizado en la fuente.
  3. Romano et al. (2016) Texto completo verificado, con extracto breve localizado en la fuente.
  4. Ullmann, Hennig & Boulesteix (2021) Texto completo verificado, con extracto breve localizado en la fuente.

Conexiones metodológicas

Territorio principalCiencia del cliente y elección: comportamiento, valor y heterogeneidadRequiere¿Cómo diagnosticar una regresión de marketing antes de interpretarla?

Leer después

MSC-H-004Ciencia del cliente y elección: comportamiento, valor y heterogeneidad→MSC-P-032¿Cómo probar la estabilidad de una segmentación?→MSC-P-019¿Cómo diagnosticar una regresión de marketing antes de interpretarla?→MSC-P-029¿Qué clientes presentan la mayor probabilidad de abandono?→