TOPIC
Dispersión de un conjunto de datos: Desviación estándar y varianzaMY PROGRESS
Pug Score
0%
Getting Started
"Let's build your foundation!"
Best Streak
0 in a row
Study Points
+0
Overview
Practice
Watch
Read
Next Steps
Get Started
Get unlimited access to all videos, practice problems, and study tools.
Back to Menu
Topic Progress
Pug Score
0%
Getting Started
"Let's build your foundation!"
Videos Watched
0/0
Best Practice
No score
Read
Not viewed
Best Streak
0 in a row
Study Points
+0
Overview
Practice
Watch
Read
Next Steps
Read
Dispersión de Datos: Desviación Estándar y Varianza
Esta lección explica cómo calcular la varianza y la desviación estándar para medir la dispersión de un conjunto de datos, incluyendo las fórmulas para población y muestra, un ejemplo numérico paso a paso y la interpretación práctica de los resultados en estadística.
¿Qué es la dispersión de un conjunto de datos?
La dispersión de un conjunto de datos indica qué tan alejados están los valores individuales respecto al valor central, generalmente la media. Dos conjuntos de datos pueden tener la misma media y, sin embargo, comportarse de manera muy distinta si uno está muy concentrado alrededor de ese valor y el otro muy disperso. Para cuantificar esa dispersión usamos dos herramientas fundamentales: la varianza y la desviación estándar.
La varianza
La varianza mide el promedio de las distancias al cuadrado entre cada dato y la media. Se eleva al cuadrado la diferencia para evitar que las desviaciones positivas y negativas se cancelen entre sí.
Cuando se trabaja con toda la población, la varianza poblacional se calcula como:
\( \sigma^2 = \dfrac{\sum (x_i - \mu)^2}{N} \)
donde \( \mu \) es la media de la población y \( N \) es el número total de datos. Cuando solo se dispone de una muestra, se usa la varianza muestral, que divide entre \( n - 1 \) en lugar de \( n \) para corregir el sesgo al estimar la variabilidad real de la población:
\( s^2 = \dfrac{\sum (x_i - \bar{x})^2}{n-1} \)
Aquí \( \bar{x} \) es la media de la muestra y \( n \) es el número de datos de esa muestra.
La desviación estándar
La varianza se expresa en unidades al cuadrado, lo cual dificulta su interpretación directa. La desviación estándar resuelve esto tomando la raíz cuadrada de la varianza, devolviendo el resultado a las unidades originales de los datos:
\( \sigma = \sqrt{\sigma^2} \) para una población, y \( s = \sqrt{s^2} \) para una muestra.
Cuanto mayor sea la desviación estándar, más dispersos están los datos respecto a la media; cuanto más pequeña sea, más agrupados están los valores.
Visualizando la dispersión
El siguiente esquema muestra cinco valores de un conjunto de datos ubicados sobre una recta numérica, junto con la media y la desviación de cada punto respecto a ella.
Ejemplo resuelto
Consideremos el conjunto de datos \( 2, 4, 6, 8, 10 \), tratado como una población completa (\( N = 5 \)). Primero calculamos la media:
\( \mu = \dfrac{2+4+6+8+10}{5} = 6 \)
Luego calculamos la diferencia de cada dato respecto a la media y la elevamos al cuadrado:
| \( x_i \) | \( x_i - \mu \) | \( (x_i - \mu)^2 \) |
|---|---|---|
| 2 | -4 | 16 |
| 4 | -2 | 4 |
| 6 | 0 | 0 |
| 8 | 2 | 4 |
| 10 | 4 | 16 |
La suma de las diferencias al cuadrado es \( 16+4+0+4+16 = 40 \). Con esto, la varianza poblacional es:
\( \sigma^2 = \dfrac{40}{5} = 8 \)
y la desviación estándar poblacional es:
\( \sigma = \sqrt{8} \approx 2.83 \)
Si en cambio estos cinco valores fueran solo una muestra de una población más grande, la varianza muestral sería \( s^2 = \dfrac{40}{4} = 10 \), y la desviación estándar muestral \( s = \sqrt{10} \approx 3.16 \). Nótese que dividir entre \( n - 1 \) produce un valor ligeramente mayor, lo cual compensa el hecho de trabajar con una muestra en lugar de la población completa.
Interpretando el resultado
Una desviación estándar cercana a cero indica que los datos están muy agrupados alrededor de la media, mientras que un valor grande indica una alta dispersión. Esta medida es especialmente útil para comparar la variabilidad entre distintos conjuntos de datos que podrían tener la misma media pero comportamientos muy diferentes. Una vez que conoces la dispersión de un conjunto de datos, puedes profundizar en cómo se ubica cada valor individual dentro de esa distribución usando las medidas de posición como la variable normalizada, los cuartiles y los percentiles.