TOPIC

Análisis de la regresión

MY PROGRESS

Pug Score

0%

Study Points

+0

Overview

Watch

Read

Next Steps


Get Started

Get unlimited access to all videos, practice problems, and study tools.

Unlimited practice
Full videos

Back to Menu

Topic Progress

Pug Score

0%

Videos Watched

0/0

Read

Not viewed


Study Points

+0

Read

Análisis de Regresión

El análisis de regresión es una técnica estadística que estudia la relación entre una variable dependiente y una o más variables independientes, permitiendo ajustar una recta o curva a los datos y predecir valores futuros con base en el modelo obtenido, evaluando también qué tan bien se ajusta.

¿Qué es el análisis de regresión?

El análisis de regresión es un conjunto de métodos estadísticos que describen y cuantifican la relación entre una variable dependiente \( y \) y una o más variables independientes \( x \). En lugar de solo decir que dos variables están asociadas (como se hace con la correlación), el análisis de regresión construye un modelo matemático capaz de estimar o predecir el valor de \( y \) a partir de valores conocidos de \( x \).

Antes de ajustar cualquier modelo conviene observar los datos con un diagrama de dispersión y analizar la correlación entre las variables, ya que la regresión solo tiene sentido cuando existe una tendencia clara entre ellas.

Regresión lineal simple: el modelo básico

El caso más común es la regresión lineal simple, donde se busca la recta que mejor describe la nube de puntos. Esta recta tiene la forma:

\( \hat{y} = b_0 + b_1x \)

Aquí, \( \hat{y} \) es el valor predicho de la variable dependiente, \( b_1 \) es la pendiente (cuánto cambia \( y \) por cada unidad que aumenta \( x \)) y \( b_0 \) es el intercepto (el valor de \( \hat{y} \) cuando \( x = 0 \)). Cuando hay más de una variable independiente, el modelo se llama regresión lineal múltiple, y cuando la relación entre las variables no es una línea recta se habla de regresión no lineal (cuadrática, exponencial, logística, entre otras).

Cómo se calculan los coeficientes

Los coeficientes \( b_0 \) y \( b_1 \) se obtienen con el método de mínimos cuadrados, que elige la recta que minimiza la suma de los cuadrados de las distancias verticales entre cada punto observado y la recta. La pendiente se calcula comparando cómo varían conjuntamente \( x \) y \( y \) respecto a sus propios promedios, y el intercepto se obtiene despejando:

\( b_0 = \bar{y} - b_1\bar{x} \)

donde \( \bar{x} \) y \( \bar{y} \) son las medias de cada variable. El procedimiento completo, con la fórmula detallada de \( b_1 \), se explica paso a paso en la lección sobre la recta de mejor ajuste por mínimos cuadrados.

Ejemplo resuelto

Un estudiante registra sus horas de estudio semanales \( x \) y su puntaje en un examen \( y \):

(1, 55), (2, 60), (3, 65), (4, 70)

Al aplicar el método de mínimos cuadrados a estos datos se obtiene el modelo:

\( \hat{y} = 50 + 5x \)

Esto significa que, en promedio, cada hora adicional de estudio se asocia con 5 puntos más en el examen, y que un estudiante que no estudiara nada obtendría, según el modelo, un puntaje base de 50. Si un estudiante planea estudiar 6 horas, el modelo predice:

\( \hat{y} = 50 + 5(6) = 80 \)

La siguiente gráfica muestra la recta de regresión y la predicción para 6 horas de estudio.

Recta de regresión con ecuación y igual a 50 más 5x, con predicción marcada en x igual a 6 Plot of y = 50 + 5*x for x in [0, 10] 0 2 4 6 8 10 50 60 70 80 90 100 Horas de estudio (x) Puntaje del examen (y) Predicción: 6 horas
Recta de regresión ajustada a los datos de horas de estudio y puntaje del examen.

Residuales y qué tan bueno es el ajuste

La diferencia entre el valor observado y el valor predicho por el modelo se llama residual:

\( e_i = y_i - \hat{y}_i \)

Residuales pequeños indican que la recta describe bien los datos; residuales grandes sugieren que el modelo lineal quizás no es el más adecuado. Para resumir en un solo número qué tan bien se ajusta el modelo se usa el coeficiente de determinación \( R^2 \), que va de 0 a 1: cuanto más cercano a 1, mayor proporción de la variación de \( y \) queda explicada por \( x \).

Errores comunes al interpretar la regresión

Un error frecuente es confundir correlación con causalidad: que el modelo prediga bien no significa que \( x \) cause \( y \). Otro error es extrapolar, es decir, usar el modelo para predecir fuera del rango de valores de \( x \) que realmente se observaron, donde la relación podría dejar de ser lineal. Finalmente, siempre conviene revisar el diagrama de dispersión y los residuales antes de confiar en las predicciones del modelo.

Related lessons