TOPIC
Análisis de la regresiónMY PROGRESS
Pug Score
0%
Getting Started
"Let's build your foundation!"
Study Points
+0
Overview
Watch
Read
Next Steps
Get Started
Get unlimited access to all videos, practice problems, and study tools.
Back to Menu
Topic Progress
Pug Score
0%
Getting Started
"Let's build your foundation!"
Videos Watched
0/0
Read
Not viewed
Study Points
+0
Overview
Watch
Read
Next Steps
Read
Análisis de Regresión
El análisis de regresión es una técnica estadística que estudia la relación entre una variable dependiente y una o más variables independientes, permitiendo ajustar una recta o curva a los datos y predecir valores futuros con base en el modelo obtenido, evaluando también qué tan bien se ajusta.
¿Qué es el análisis de regresión?
El análisis de regresión es un conjunto de métodos estadísticos que describen y cuantifican la relación entre una variable dependiente \( y \) y una o más variables independientes \( x \). En lugar de solo decir que dos variables están asociadas (como se hace con la correlación), el análisis de regresión construye un modelo matemático capaz de estimar o predecir el valor de \( y \) a partir de valores conocidos de \( x \).
Antes de ajustar cualquier modelo conviene observar los datos con un diagrama de dispersión y analizar la correlación entre las variables, ya que la regresión solo tiene sentido cuando existe una tendencia clara entre ellas.
Regresión lineal simple: el modelo básico
El caso más común es la regresión lineal simple, donde se busca la recta que mejor describe la nube de puntos. Esta recta tiene la forma:
\( \hat{y} = b_0 + b_1x \)
Aquí, \( \hat{y} \) es el valor predicho de la variable dependiente, \( b_1 \) es la pendiente (cuánto cambia \( y \) por cada unidad que aumenta \( x \)) y \( b_0 \) es el intercepto (el valor de \( \hat{y} \) cuando \( x = 0 \)). Cuando hay más de una variable independiente, el modelo se llama regresión lineal múltiple, y cuando la relación entre las variables no es una línea recta se habla de regresión no lineal (cuadrática, exponencial, logística, entre otras).
Cómo se calculan los coeficientes
Los coeficientes \( b_0 \) y \( b_1 \) se obtienen con el método de mínimos cuadrados, que elige la recta que minimiza la suma de los cuadrados de las distancias verticales entre cada punto observado y la recta. La pendiente se calcula comparando cómo varían conjuntamente \( x \) y \( y \) respecto a sus propios promedios, y el intercepto se obtiene despejando:
\( b_0 = \bar{y} - b_1\bar{x} \)
donde \( \bar{x} \) y \( \bar{y} \) son las medias de cada variable. El procedimiento completo, con la fórmula detallada de \( b_1 \), se explica paso a paso en la lección sobre la recta de mejor ajuste por mínimos cuadrados.
Ejemplo resuelto
Un estudiante registra sus horas de estudio semanales \( x \) y su puntaje en un examen \( y \):
(1, 55), (2, 60), (3, 65), (4, 70)
Al aplicar el método de mínimos cuadrados a estos datos se obtiene el modelo:
\( \hat{y} = 50 + 5x \)
Esto significa que, en promedio, cada hora adicional de estudio se asocia con 5 puntos más en el examen, y que un estudiante que no estudiara nada obtendría, según el modelo, un puntaje base de 50. Si un estudiante planea estudiar 6 horas, el modelo predice:
\( \hat{y} = 50 + 5(6) = 80 \)
La siguiente gráfica muestra la recta de regresión y la predicción para 6 horas de estudio.
Residuales y qué tan bueno es el ajuste
La diferencia entre el valor observado y el valor predicho por el modelo se llama residual:
\( e_i = y_i - \hat{y}_i \)
Residuales pequeños indican que la recta describe bien los datos; residuales grandes sugieren que el modelo lineal quizás no es el más adecuado. Para resumir en un solo número qué tan bien se ajusta el modelo se usa el coeficiente de determinación \( R^2 \), que va de 0 a 1: cuanto más cercano a 1, mayor proporción de la variación de \( y \) queda explicada por \( x \).
Errores comunes al interpretar la regresión
Un error frecuente es confundir correlación con causalidad: que el modelo prediga bien no significa que \( x \) cause \( y \). Otro error es extrapolar, es decir, usar el modelo para predecir fuera del rango de valores de \( x \) que realmente se observaron, donde la relación podría dejar de ser lineal. Finalmente, siempre conviene revisar el diagrama de dispersión y los residuales antes de confiar en las predicciones del modelo.