¿Cómo construir una segmentación de clientes útil?
Una segmentación útil conecta variables admisibles, distancia, algoritmo, estabilidad y uso decisional. Los grupos no son esencias naturales sino una representación condicional.
Redacción científica: Marketing Science Center
Respuesta directa
Construir una partición descriptiva accionable y documentar su incertidumbre.
Una segmentación útil conecta variables admisibles, distancia, algoritmo, estabilidad y uso decisional. Los grupos no son esencias naturales sino una representación condicional.
01 · PROTOCOLO
Resumen operativo
Novecientos clientes se reparten en cuatro segmentos mediante una construcción enteramente declarada, sin sorteo. En el caso sintético sellado los tamaños son 283, 246, 184 y 187, la silueta media 0,407973 y el índice de Rand ajustado entre dos reconstrucciones independientes 0,984661. El ingreso del trimestre siguiente, nunca usado para construir los segmentos, va de 69,260000 a 644,625668 según el segmento, con una razón de 9,307330. Los cuatro controles pasan. Veredicto: SEGMENTATION_READABLE_FOR_ACTION.
02 · PROTOCOLO
Situación de marketing concreta
Un equipo de CRM quiere dejar de tratar su base como un bloque único. Para cada cliente dispone de recencia, frecuencia, cesta media, número de categorías compradas y proporción de pedidos en línea. Quiere cuatro grupos, porque cuatro es el número de programas relacionales que puede animar de verdad. La pregunta no es encontrar los grupos verdaderos, que no existen como tales, sino obtener un reparto que se sostenga y sirva para decidir.
03 · PROTOCOLO
Pregunta científica
Para estos novecientos clientes, estas cinco variables declaradas y esta distancia declarada, ¿el reparto en cuatro segmentos está separado, equilibrado, es reproducible en otras observaciones y distingue un resultado que la construcción nunca vio? La pregunta no trata de si existen grupos naturales en la clientela, sino de si un reparto declarado se sostiene y resulta útil para decidir.
04 · PROTOCOLO
Por qué puede fallar el enfoque simple
Lanzar un algoritmo de partición y comentar los grupos obtenidos siempre produce grupos: el método fabrica tantos como se le piden, incluso en una nube sin estructura. Cambiar las variables, la escala o la distancia cambia el resultado, y un sorteo inicial distinto puede mover las fronteras. Sin controles se describe un artefacto del algoritmo y se le llama segmentación de clientes. La expresión «segmento verdadero» tampoco tiene definición operativa en la literatura.
05 · PROTOCOLO
Intuición del método
El método consiste en declararlo todo antes de mirar: las cinco variables, su transformación, su escala, la distancia, el número de segmentos, el punto de partida de los centros y los cuatro umbrales. El arranque no se sortea: son las observaciones situadas en cuatro rangos fijos de una puntuación compuesta declarada. Después el reparto se somete a cuatro preguntas: ¿están separados los segmentos, son todos accionables, reaparecen al reconstruir sobre otros clientes y distinguen un resultado ajeno a la construcción?
06 · PROTOCOLO
Datos necesarios
Se fijan antes de cualquier lectura: el identificador de cliente ordenado sin huecos, la recencia, la frecuencia, la cesta media, el número de categorías, la proporción en línea, el ingreso del trimestre siguiente, las transformaciones declaradas, la estandarización, el número de segmentos fijado en cuatro por el contexto de decisión, el arranque declarado y los cuatro umbrales. El ingreso nunca entra en la construcción. El archivo sellado contiene novecientos clientes. El caso es sintético y así se declara.
07 · PROTOCOLO
Modelo formal y símbolos
Cada cliente es un vector de cinco coordenadas estandarizadas: logaritmo de la recencia, frecuencia, logaritmo de la cesta, número de categorías, proporción en línea. La distancia es euclídea al cuadrado. Un segmento es un conjunto de clientes más cercanos a su centro que a cualquier otro; el centro es la media de sus miembros. La silueta de un cliente compara su distancia media a los miembros de su segmento con su distancia media al segmento más cercano. El índice de Rand ajustado compara dos repartos corrigiendo el acuerdo debido al azar.
08 · PROTOCOLO
Cálculo declarado
El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme; transformar y estandarizar las cinco variables sobre todo el archivo; colocar los cuatro centros iniciales en los rangos declarados de la puntuación compuesta e iterar hasta que las asignaciones dejen de cambiar o cien pasadas, fallando si un segmento se vacía; informar tamaños y cuotas y aplicar el umbral de equilibrio; calcular la silueta media sobre la muestra sistemática declarada; reconstruir por separado sobre clientes pares e impares, reasignar todo el archivo bajo cada solución y calcular el índice de Rand ajustado; calcular las medias de ingreso por segmento, su razón y la varianza explicada, y aplicar la regla del veredicto.
09 · PROTOCOLO
Ejemplo numérico completo
Ilustración sintética — valores didácticos, no observados
En el archivo sellado: 900 clientes, 4 segmentos. Tamaños 283, 246, 184, 187; cuotas 0,314444, 0,273333, 0,204444 y 0,207778; cuota más pequeña 0,204444, control superado. Silueta media 0,407973, control superado. Índice de Rand ajustado entre las dos reconstrucciones 0,984661, control superado. Ingreso medio por segmento: 192,210318; 106,899593; 69,260000; 644,625668. Razón entre el más alto y el más bajo 9,307330 y varianza explicada 0,692635, control superado. Veredicto: SEGMENTATION_READABLE_FOR_ACTION.
10 · PROTOCOLO
Supuestos de validez
La construcción supone que las cinco variables describen lo que el equipo quiere distinguir, que la estandarización les da un peso aceptable, que la distancia euclídea tiene sentido en esas coordenadas y que cuatro segmentos corresponden a una capacidad real de acción. No supone que existan grupos naturales. Tres cosas no son comprobables aquí: la pertinencia de las variables elegidas, la estabilidad del reparto en el tiempo y que un segmento reaccione distinto a una acción, lo cual compete a un experimento.
11 · PROTOCOLO
Diagnósticos e incertidumbre
La silueta mide una separación relativa bajo la distancia declarada, no una verdad geométrica: sería distinta con otras variables. Aquí se calcula sobre una muestra sistemática de clientes, pero comparados con todos los clientes; una biblioteca estándar que restringe las distancias solo a los puntos muestreados devuelve 0,406210 en vez de 0,407973 en este archivo, y la página lo señala en lugar de sugerir una definición única. El índice de Rand ajustado alcanza 0,984661 porque la estructura sintética es nítida; en datos reales, un valor por encima de 0,60 ya es tranquilizador. Ninguno de estos números es una p.
12 · PROTOCOLO
Robustez y alternativas
Alternativas declaradas antes del resultado: rehacer el reparto con tres o cinco segmentos y comparar los cuatro controles; sustituir la estandarización por una ponderación explícita de las variables y publicar ambos perfiles; quitar la proporción en línea, que puede reflejar un canal de captación más que un comportamiento; o sustituir la partición por un método que admita pertenencias parciales. Cada variante debe anunciarse antes de leer y reportarse aunque cambie los segmentos.
13 · PROTOCOLO
Interpretación del resultado
Los cuatro controles pasan, así que el reparto puede servir para decidir. El resultado utilizable es el perfil de los segmentos y la brecha de valor entre ellos: un segmento concentra un ingreso medio de 644,625668 en el trimestre siguiente, otro de 69,260000, y el reparto explica el 69,2635 por ciento de la varianza del ingreso. Esa estructura justifica programas diferenciados. No dice que un programa hará reaccionar más a un segmento que a otro: es una asociación, medida sobre un resultado que la construcción no vio, no un efecto.
14 · PROTOCOLO
Conclusiones permitidas
Permitido: publicar los perfiles de los segmentos, sus tamaños, su separación, su reproducibilidad y su brecha de valor; construir cuatro programas relacionales distintos; seguir en el tiempo la cuota de cada segmento; concluir que la base no es homogénea y que cuatro grupos se sostienen bajo los criterios declarados. También permitido: decir que estos segmentos dependen de las variables elegidas y republicar el reparto si esas variables cambian.
15 · PROTOCOLO
Conclusiones prohibidas
Prohibido: presentar estos cuatro segmentos como los grupos verdaderos de la clientela; afirmar que un cliente pertenece definitivamente a su segmento, cuando cambia de posición en cuanto cambian sus compras; atribuir la brecha de ingreso a la pertenencia al segmento como si fuera un efecto; elegir el número de segmentos tras ver los perfiles y luego publicar los controles como si se hubiera fijado de antemano; o trasladar estos segmentos a otro mercado. También prohibido: presentar este caso sintético como una medición observada.
16 · PROTOCOLO
Posible decisión de marketing
La decisión razonable consiste en dar a cada segmento un programa relacional distinto, dimensionado por su cuota y su brecha de valor, y después medir el efecto de esos programas con un experimento en vez de comparando los segmentos entre sí. El segmento más denso en valor justifica el mayor esfuerzo, pero nada asegura todavía que responda mejor: lo dirá la campaña siguiente, con un grupo de control en cada segmento.
17 · PROTOCOLO
Cuándo usar o evitar el método
Usar este método cuando el equipo sabe cuántos programas puede animar y qué variables describen lo que quiere distinguir. Evitarlo como herramienta de pura exploración: sin un propósito declarado, ningún criterio dice que un reparto sea mejor que otro. Evitarlo también cuando las variables elegidas miden sobre todo el canal de captación, cuando la base acaba de renovarse o cuando el objetivo real es medir el efecto de una acción, lo que exige un experimento.
18 · PROTOCOLO
Implementaciones y entregable final
El CSV CC0 contiene los novecientos clientes sintéticos. Python y R son las implementaciones de referencia; SPSS retoma el mismo cálculo en un bloque Python; SAS recibe los mismos cuatro puntos de partida declarados pero aplica su propio orden de asignación y su regla de convergencia, y verifica equilibrio y utilidad en vez de reproducir cada decimal. El entregable final reúne los datos, el diccionario de variables, las variables y la distancia declaradas, el número de segmentos y su motivo, el arranque declarado, los cuatro umbrales, los siete pasos numerados, los perfiles, los cuatro controles, el veredicto y las versiones de software.
Datos sintéticos · CC0
msc-p031-segmentation-panel.csv ↓Protocolo reproducible
msc-p031-reproducibility-readme.md ↓Referencia Python · MIT
msc-p031-reference.py ↓Referencia R · MIT
msc-p031-reference.R ↓Implementación SPSS · MIT
msc-p031-secondary.sps ↓Implementación SAS · MIT
msc-p031-secondary.sas ↓19 · PROTOCOLO
Fuentes y nivel de evidencia
Hennig recuerda que un análisis de partición se vuelve científico por la transparencia de sus elecciones, no por la unicidad de su resultado, y que la noción de grupo verdadero rara vez se define. Von Luxburg, Williamson y Guyon muestran que ningún procedimiento general ordena los métodos de partición sin tener en cuenta el contexto de uso. Romano et al. sitúan el índice de Rand ajustado entre las medidas corregidas por azar. Ullmann, Hennig y Boulesteix formalizan la validación de un reparto sobre otras observaciones, dividiendo el archivo en dos mitades. Referencias fundacionales: Hennig (2015, preprint en arXiv; publicado en Pattern Recognition Letters, con revisión por pares) y von Luxburg, Williamson y Guyon (2012, actas con revisión, sin DOI). Desarrollos recientes: Romano et al. (2016, Journal of Machine Learning Research, con revisión, sin DOI) y Ullmann, Hennig y Boulesteix (2021, preprint en arXiv; publicado en WIREs Data Mining and Knowledge Discovery, con revisión).
- Hennig (2015) Texto completo verificado, con extracto breve localizado en la fuente.
- von Luxburg, Williamson & Guyon (2012) Texto completo verificado, con extracto breve localizado en la fuente.
- Romano et al. (2016) Texto completo verificado, con extracto breve localizado en la fuente.
- Ullmann, Hennig & Boulesteix (2021) Texto completo verificado, con extracto breve localizado en la fuente.
Conexiones metodológicas

