¿Cómo probar la estabilidad de una segmentación?
La estabilidad evalúa si una estructura similar reaparece con remuestreo, cambio temporal o perturbación razonable de variables. No garantiza utilidad empresarial.
Redacción científica: Marketing Science Center
Respuesta directa
Comparar soluciones y cuantificar la robustez de las asignaciones.
La estabilidad evalúa si una estructura similar reaparece con remuestreo, cambio temporal o perturbación razonable de variables. No garantiza utilidad empresarial.
01 · PROTOCOLO
Resumen operativo
Se propone una segmentación en cuatro segmentos sobre 360 clientes. Se reconstruye en 40 remuestras extraídas con reemplazo y la recuperación de cada segmento se mide con el índice de Jaccard. El segmento más débil solo se recupera a 0,664749, por debajo del umbral declarado de 0,75. Peor: una referencia sin estructura, obtenida permutando cada variable, recupera sus propios segmentos a 0,829190, o sea mejor que el archivo real. Veredicto: PROPOSED_SEGMENTATION_NOT_STABLE. La solución de tres segmentos, en cambio, se sostiene a 0,986949.
02 · PROTOCOLO
Situación de marketing concreta
Una dirección de marketing ha recibido de un proveedor una segmentación en cuatro grupos, con nombres, personas y un plan de animación por grupo. Antes de comprometer cuatro presupuestos distintos, el equipo hace una pregunta simple: si se rehiciera el mismo trabajo sobre una muestra ligeramente distinta de los mismos clientes, ¿reaparecerían estos cuatro grupos? Nadie pregunta si los grupos son verdaderos. Se pregunta si se sostienen.
03 · PROTOCOLO
Pregunta científica
Para estos 360 clientes, estas tres variables declaradas, esta distancia declarada y este procedimiento de remuestreo declarado, ¿reaparece cada uno de los cuatro segmentos propuestos con suficiente frecuencia para justificar un presupuesto propio? ¿Y supera ese nivel de reaparición lo que un archivo sin estructura alguna ya produciría por el solo efecto del remuestreo? La pregunta no es la existencia de los grupos ni su utilidad, sino su reproducibilidad bajo perturbación.
04 · PROTOCOLO
Por qué puede fallar el enfoque simple
Mirar la solución una sola vez no dice nada: un algoritmo de partición siempre devuelve el número de grupos pedido, y en un único sorteo ese número siempre parece nítido. Repetir el cálculo sin cambiar los datos tampoco dice nada, ya que el arranque es determinista. Y medir una recuperación alta sin punto de comparación puede engañar por completo: en este archivo la referencia sin estructura alcanza 0,829190 con cuatro segmentos, una cifra que se leería con gusto como prueba de solidez si no se la enfrentara a otra cosa.
05 · PROTOCOLO
Intuición del método
La idea cabe en una frase: se perturba el archivo, se rehace exactamente el mismo trabajo y se mira qué vuelve. Cada perturbación es una remuestra extraída con reemplazo, del mismo tamaño que el archivo. Tras cada reconstrucción, todos los clientes de origen se reasignan a los nuevos centros, de modo que ambos repartos cubren a las mismas personas y se comparan sin artificio. Cada segmento de origen recibe entonces la mejor recuperación que obtiene frente a los segmentos reconstruidos. Todo se mide una segunda vez sobre una referencia sin estructura, para saber qué produce el ruido solo.
06 · PROTOCOLO
Datos necesarios
Se fijan antes de cualquier lectura: el identificador de cliente ordenado sin huecos, la recencia, la frecuencia, la cesta media, las transformaciones declaradas, la estandarización, la distancia, el arranque determinista, los números de segmentos examinados (2, 3 y 4), el número propuesto (4), las 40 remuestras, la recurrencia aritmética que las produce, la referencia sin estructura y los dos umbrales. El archivo sellado contiene 360 clientes. El caso es sintético y así se declara.
07 · PROTOCOLO
Modelo formal y símbolos
Cada cliente es un vector de tres coordenadas estandarizadas: logaritmo de la recencia, frecuencia, logaritmo de la cesta. La distancia es euclídea al cuadrado y un segmento reúne a los clientes más cercanos a su centro que a cualquier otro. La recuperación de un segmento S por un segmento reconstruido R es el índice de Jaccard, o sea el número de clientes comunes dividido por el número de clientes que pertenecen a uno u otro. Las remuestras provienen de una recurrencia declarada: el estado siguiente vale (1103515245 × estado + 12345) módulo 2^31, y el cliente extraído es el estado módulo el número de clientes.
08 · PROTOCOLO
Cálculo declarado
El cálculo declarado encadena siete pasos: validar el esquema y rechazar todo archivo no conforme; transformar y estandarizar las tres variables sobre todo el archivo; construir la referencia sin estructura permutando cada variable independientemente con la misma recurrencia; para cada número de segmentos examinado, construir el reparto sobre todo el archivo y registrar la composición de cada segmento; extraer las 40 remuestras, reconstruir, reasignar todos los clientes de origen y dar a cada segmento su mejor Jaccard, fallando si una remuestra no produce el número pedido; promediar sobre las remuestras, repetir de forma idéntica sobre la referencia sin estructura, y calcular la recuperación más débil, la de la referencia y su margen; aplicar los dos umbrales y luego la regla del veredicto al número propuesto.
09 · PROTOCOLO
Ejemplo numérico completo
Ilustración sintética — valores didácticos, no observados
En el archivo sellado: 360 clientes, 40 remuestras. Con dos segmentos, recuperaciones 0,977481 y 0,976322; la más débil vale 0,976322, la referencia sin estructura 0,647971, el margen 0,328351, luego STABLE. Con tres segmentos: 0,990139, 0,986949 y 0,997222; la más débil 0,986949, referencia 0,606088, margen 0,380860, luego STABLE. Con cuatro segmentos, el número propuesto: 0,848874, 0,664749, 0,827341 y 0,979621; la más débil 0,664749, por debajo del umbral de 0,75, referencia 0,829190 y margen −0,164441, luego NOT_STABLE. Veredicto: PROPOSED_SEGMENTATION_NOT_STABLE.
10 · PROTOCOLO
Supuestos de validez
El procedimiento supone que los clientes del archivo pueden tratarse como observaciones intercambiables de una misma población, lo que autoriza la extracción con reemplazo; que las tres variables son las que describen lo que el equipo quiere distinguir; y que la referencia obtenida permutando cada variable destruye realmente la estructura conjunta conservando cada distribución marginal. No supone que existan cuatro segmentos, ni que tres sea el número correcto. Tres cosas no son comprobables aquí: la pertinencia de las variables, la persistencia del reparto en el tiempo y la reacción diferenciada de un segmento a una acción.
11 · PROTOCOLO
Diagnósticos e incertidumbre
La recuperación media se calcula sobre 40 remuestras: no va acompañada de un intervalo, porque con ese número de sorteos la incertidumbre sobre la media seguiría siendo del mismo orden que las diferencias que se intenta leer, y la página lo dice en lugar de exhibir una precisión que no tiene. El diagnóstico decisivo no es el nivel bruto sino el margen: con cuatro segmentos es negativo, −0,164441, lo que significa que el archivo real reproduce sus segmentos peor que un archivo sin estructura. Ninguno de estos números es una p, y ninguno contrasta una hipótesis.
12 · PROTOCOLO
Robustez y alternativas
Alternativas declaradas antes del resultado: sustituir la extracción con reemplazo por un submuestreo sin reemplazo de tamaño fijado, y comprobar que la conclusión no depende del esquema; sustituir el índice de Jaccard por el índice de Rand ajustado, que juzga el reparto entero en vez de cada segmento; aumentar el número de remuestras para estrechar las medias; o perturbar las variables con un ruido declarado en lugar de un sorteo. Cada variante debe anunciarse antes de leer y reportarse aunque invierta el veredicto.
13 · PROTOCOLO
Interpretación del resultado
La solución propuesta no se sostiene. Uno de sus cuatro segmentos se disuelve en cuanto se repite el cálculo sobre clientes ligeramente distintos, y el conjunto se reproduce peor que un archivo sin estructura. El reparto en tres segmentos, en cambio, vuelve casi intacto. Pero la lectura se detiene ahí: el reparto en dos segmentos también es estable, lo que muestra que una buena recuperación no designa el número correcto de grupos. La estabilidad elimina candidatos; no corona a ninguno.
14 · PROTOCOLO
Conclusiones permitidas
Permitido: negarse a comprometer cuatro presupuestos en la solución propuesta; publicar la recuperación de cada segmento, la referencia sin estructura y el margen; decir que uno de los cuatro segmentos se disuelve bajo remuestreo; conservar tres segmentos como candidato serio a condición de justificarlo por algo que no sea la estabilidad; y exigir a un proveedor esas tres cifras con cada segmentación entregada. También permitido: decir que este resultado vale para estas variables y este periodo, y rehacer el examen si alguna cambia.
15 · PROTOCOLO
Conclusiones prohibidas
Prohibido: concluir que tres es el número verdadero de segmentos, cuando dos también supera los umbrales; leer una recuperación alta como prueba de que existe una estructura, cuando la referencia sin estructura alcanza 0,829190 con cuatro segmentos; presentar la estabilidad como medida de utilidad comercial; concluir que un segmento estable responderá mejor a una oferta; o rehacer el cálculo con varios umbrales y publicar solo el que conviene. También prohibido: presentar este caso sintético como una medición observada.
16 · PROTOCOLO
Posible decisión de marketing
La decisión razonable es devolver la segmentación de cuatro grupos a su autor con las tres cifras que la desmienten, y no financiar ninguno de los cuatro programas tal como están. Si el equipo quiere avanzar, parte de nuevo de la solución de tres segmentos, la justifica por su capacidad de animación y por la brecha de valor entre grupos, y luego mide el efecto real de cada programa con un experimento que lleve un grupo de control dentro de cada segmento. La estabilidad condiciona el derecho a continuar; no sustituye la medición.
17 · PROTOCOLO
Cuándo usar o evitar el método
Usar este examen cada vez que se entrega una segmentación para fundamentar presupuestos, y antes de cualquier puesta en producción. Evitarlo como criterio único para elegir el número de segmentos, ya que no designa ninguno. Evitarlo también cuando la base acaba de renovarse, cuando las variables no describen lo que se quiere distinguir, o cuando la pregunta real es el efecto de una acción sobre un segmento, lo que exige un experimento y no un remuestreo.
18 · PROTOCOLO
Implementaciones y entregable final
El CSV CC0 contiene los 360 clientes sintéticos. Python y R son las implementaciones de referencia; SPSS retoma el mismo cálculo en un bloque Python; SAS reproduce exactamente la recurrencia declarada, así que extrae las mismas remuestras, pero confía la agrupación a su propio procedimiento y verifica las banderas en vez de cada decimal. El entregable final reúne los datos, el diccionario de variables, las variables y la distancia declaradas, la recurrencia de remuestreo, la referencia sin estructura, los dos umbrales, los siete pasos numerados, la recuperación de cada segmento para cada número examinado, los márgenes, las banderas, el veredicto y las versiones de software.
Datos sintéticos · CC0
msc-p032-stability-panel.csv ↓Protocolo reproducible
msc-p032-reproducibility-readme.md ↓Referencia Python · MIT
msc-p032-reference.py ↓Referencia R · MIT
msc-p032-reference.R ↓Implementación SPSS · MIT
msc-p032-secondary.sps ↓Implementación SAS · MIT
msc-p032-secondary.sas ↓19 · PROTOCOLO
Fuentes y nivel de evidencia
Von Luxburg explica que probar la estabilidad exige relanzar el algoritmo sobre conjuntos de datos ligeramente distintos, y que un resultado estable con un número de segmentos demasiado pequeño no permite ninguna conclusión útil; recuerda además que la puntuación se compara con la de una distribución de referencia sin estructura, y que la extracción con reemplazo es el esquema estándar de la literatura del bootstrap. Hennig señala que la estabilidad es más fácil de alcanzar con pocos grupos, y que las variables deben elegirse para la pregunta planteada. Ullmann, Hennig y Boulesteix sitúan el análisis de estabilidad en un marco de validación y recuerdan el uso corriente de retener el número de segmentos más estable. Ullmann y coautores muestran por último que el número de segmentos es un ajuste cuyas consecuencias hay que examinar, y que protegerse del exceso de optimismo exige reglas fijadas de antemano. Referencias fundacionales: von Luxburg (2010, preprint en arXiv; publicado en Foundations and Trends in Machine Learning, con revisión por pares) y Hennig (2015, preprint en arXiv; publicado en Pattern Recognition Letters, con revisión). Desarrollos recientes: Ullmann, Hennig y Boulesteix (2021, preprint en arXiv; publicado en WIREs Data Mining and Knowledge Discovery, con revisión) y Ullmann et al. (2022, Advances in Data Analysis and Classification, acceso abierto CC BY, con revisión).
- von Luxburg (2010) Texto completo verificado, con extracto breve localizado en la fuente.
- Hennig (2015) Texto completo verificado, con extracto breve localizado en la fuente.
- Ullmann, Hennig & Boulesteix (2021) Texto completo verificado, con extracto breve localizado en la fuente.
- Ullmann et al. (2022) Texto completo verificado, con extracto breve localizado en la fuente.
Conexiones metodológicas

