Esta lección explica qué es el rango de un conjunto de datos, cómo calcularlo con la fórmula del valor máximo menos el valor mínimo, y cómo identificar valores atípicos usando el rango intercuartílico. Incluye ejemplos numéricos paso a paso y un diagrama que muestra cómo un valor atípico afecta el rango.
¿Qué es el rango en estadística?
El rango es la medida de dispersión más sencilla que existe. Indica qué tan "esparcidos" están los datos, calculando la diferencia entre el valor más grande y el valor más pequeño de un conjunto de datos. Se calcula con la fórmula:
\( R = x_{max} - x_{min} \)
Donde \( x_{max} \) es el dato mayor y \( x_{min} \) es el dato menor. A diferencia de la media (promedio) o de las medidas de mediana y moda, el rango no describe el "centro" de los datos, sino su amplitud total.
Cómo calcular el rango paso a paso
Supongamos que un grupo de estudiantes obtiene las siguientes calificaciones en un examen: 12, 14, 15, 16, 18, 19 y 20 puntos. El valor máximo es 20 y el valor mínimo es 12, así que:
\( R = 20 - 12 = 8 \)
El rango de este conjunto de datos es 8 puntos. Este número por sí solo nos dice que las calificaciones están relativamente agrupadas, sin necesidad de calcular todas las medidas de tendencia central.
¿Qué es un valor atípico?
Un valor atípico (también llamado dato extremo) es un número que se aleja de manera inusual del resto del conjunto de datos. Puede surgir por un error de medición, un caso excepcional real, o simplemente por la variabilidad natural de los datos. El problema es que un solo valor atípico puede distorsionar el rango y dar una idea equivocada de la dispersión real de los datos.
Para decidir si un dato es atípico de forma objetiva, los estadísticos suelen usar el rango intercuartílico, que es la diferencia entre el tercer cuartil \( Q_3 \) y el primer cuartil \( Q_1 \). Un dato se considera atípico si cae fuera de estos límites:
Límite inferior: \( Q_1 - 1.5(Q_3-Q_1) \)
Límite superior: \( Q_3 + 1.5(Q_3-Q_1) \)
Ejemplo: el efecto de un valor atípico en el rango
Ahora agreguemos un dato inusual al mismo grupo de calificaciones: 12, 14, 15, 16, 18, 19, 20 y 45. Supongamos que, al ordenar los datos, obtenemos \( Q_1 = 14.5 \) y \( Q_3 = 19.5 \). El rango intercuartílico es \( 19.5 - 14.5 = 5 \), así que los límites son:
Límite inferior: \( 14.5 - 1.5(5) = 7 \)
Límite superior: \( 19.5 + 1.5(5) = 27 \)
Como 45 es mayor que 27, se clasifica como un valor atípico. Observa cómo cambia el rango con y sin ese dato:
Rango sin el valor atípico: \( 20 - 12 = 8 \)
Rango con el valor atípico: \( 45 - 12 = 33 \)
Un solo dato extremo multiplicó el rango por más de cuatro veces. Esto muestra por qué el rango, aunque útil, puede ser engañoso cuando hay valores atípicos presentes en los datos.
La mayoría de los datos se agrupan entre 12 y 20, dentro de los límites del rango intercuartílico. El valor 45 queda fuera del límite superior de 27, por lo que se identifica como un valor atípico.
Por qué el rango y los valores atípicos importan juntos
Al reportar el rango de un conjunto de datos, siempre conviene revisar primero si hay valores atípicos. Si los hay, es buena práctica mencionar el rango con y sin esos datos extremos, o usar el rango intercuartílico como medida complementaria más estable. Esta idea se relaciona directamente con el estudio de la aplicación de promedios, donde también se analiza cómo los datos extremos afectan las medidas estadísticas.
En resumen: el rango es rápido de calcular y fácil de entender, pero es muy sensible a los valores atípicos. Reconocer esos datos extremos antes de interpretar el rango te permite describir la dispersión real de tus datos con mucha más precisión.