TOPIC

Dispersión de un conjunto de datos: Desviación estándar y varianza

MY PROGRESS

Pug Score

0%

Best Streak

0 in a row

Study Points

+0

Overview

Practice

Watch

Read

Next Steps


Get Started

Get unlimited access to all videos, practice problems, and study tools.

Unlimited practice
Full videos

Back to Menu

Topic Progress

Pug Score

0%

Videos Watched

0/0

Best Practice

No score

Read

Not viewed


Best Streak

0 in a row

Study Points

+0

Read

Dispersión de Datos: Desviación Estándar y Varianza

Esta lección explica cómo calcular la varianza y la desviación estándar para medir la dispersión de un conjunto de datos, incluyendo las fórmulas para población y muestra, un ejemplo numérico paso a paso y la interpretación práctica de los resultados en estadística.

¿Qué es la dispersión de un conjunto de datos?

La dispersión de un conjunto de datos indica qué tan alejados están los valores individuales respecto al valor central, generalmente la media. Dos conjuntos de datos pueden tener la misma media y, sin embargo, comportarse de manera muy distinta si uno está muy concentrado alrededor de ese valor y el otro muy disperso. Para cuantificar esa dispersión usamos dos herramientas fundamentales: la varianza y la desviación estándar.

La varianza

La varianza mide el promedio de las distancias al cuadrado entre cada dato y la media. Se eleva al cuadrado la diferencia para evitar que las desviaciones positivas y negativas se cancelen entre sí.

Cuando se trabaja con toda la población, la varianza poblacional se calcula como:

\( \sigma^2 = \dfrac{\sum (x_i - \mu)^2}{N} \)

donde \( \mu \) es la media de la población y \( N \) es el número total de datos. Cuando solo se dispone de una muestra, se usa la varianza muestral, que divide entre \( n - 1 \) en lugar de \( n \) para corregir el sesgo al estimar la variabilidad real de la población:

\( s^2 = \dfrac{\sum (x_i - \bar{x})^2}{n-1} \)

Aquí \( \bar{x} \) es la media de la muestra y \( n \) es el número de datos de esa muestra.

La desviación estándar

La varianza se expresa en unidades al cuadrado, lo cual dificulta su interpretación directa. La desviación estándar resuelve esto tomando la raíz cuadrada de la varianza, devolviendo el resultado a las unidades originales de los datos:

\( \sigma = \sqrt{\sigma^2} \) para una población, y \( s = \sqrt{s^2} \) para una muestra.

Cuanto mayor sea la desviación estándar, más dispersos están los datos respecto a la media; cuanto más pequeña sea, más agrupados están los valores.

Visualizando la dispersión

El siguiente esquema muestra cinco valores de un conjunto de datos ubicados sobre una recta numérica, junto con la media y la desviación de cada punto respecto a ella.

2 4 6 8 10 media = 6 desviacion = −4 desviacion = −2 desviacion = 0 desviacion = 2 desviacion = 4

Ejemplo resuelto

Consideremos el conjunto de datos \( 2, 4, 6, 8, 10 \), tratado como una población completa (\( N = 5 \)). Primero calculamos la media:

\( \mu = \dfrac{2+4+6+8+10}{5} = 6 \)

Luego calculamos la diferencia de cada dato respecto a la media y la elevamos al cuadrado:

\( x_i \)\( x_i - \mu \)\( (x_i - \mu)^2 \)
2-416
4-24
600
824
10416

La suma de las diferencias al cuadrado es \( 16+4+0+4+16 = 40 \). Con esto, la varianza poblacional es:

\( \sigma^2 = \dfrac{40}{5} = 8 \)

y la desviación estándar poblacional es:

\( \sigma = \sqrt{8} \approx 2.83 \)

Si en cambio estos cinco valores fueran solo una muestra de una población más grande, la varianza muestral sería \( s^2 = \dfrac{40}{4} = 10 \), y la desviación estándar muestral \( s = \sqrt{10} \approx 3.16 \). Nótese que dividir entre \( n - 1 \) produce un valor ligeramente mayor, lo cual compensa el hecho de trabajar con una muestra en lugar de la población completa.

Interpretando el resultado

Una desviación estándar cercana a cero indica que los datos están muy agrupados alrededor de la media, mientras que un valor grande indica una alta dispersión. Esta medida es especialmente útil para comparar la variabilidad entre distintos conjuntos de datos que podrían tener la misma media pero comportamientos muy diferentes. Una vez que conoces la dispersión de un conjunto de datos, puedes profundizar en cómo se ubica cada valor individual dentro de esa distribución usando las medidas de posición como la variable normalizada, los cuartiles y los percentiles.

Related lessons