Calculadora de Regresión Lineal Simple Online 2026: Mínimos Cuadrados, Correlación de Pearson, R² y Predicción
Calcula la recta de regresión ŷ = a + b·x mediante mínimos cuadrados ordinarios (MCO) con Big.js para máxima precisión. Obtiene pendiente, intercepto, coeficiente de correlación de Pearson r, R², error estándar del estimado y de la pendiente. Tabla de datos dinámica, gráfica scatter con recta y predicción con intervalo de confianza opcional.
Tabla de datos (x, y)
| # | X (var. independiente) | Y (var. dependiente) |
|---|
Resultado
Ingresa los datos y presiona Calcular
Qué es la regresión lineal simple y para qué sirve en negocios y ciencias
La regresión lineal simple es una técnica estadística que modela la relación entre dos variables cuantitativas: una variable independiente X (también llamada predictora, explicativa o regresora) y una variable dependiente Y (la variable que se quiere predecir o explicar). El modelo supone que esta relación es aproximadamente lineal: Y = α + β·X + ε, donde α es el intercepto (valor de Y cuando X=0), β es la pendiente (cuánto cambia Y por cada unidad que aumenta X) y ε es el error aleatorio. La regresión lineal es probablemente la herramienta de análisis cuantitativo más usada en el mundo empresarial y científico.
En América Latina, la regresión lineal aparece en contextos muy diversos. Un economista del Banco de México usa regresión lineal para estimar cómo la tasa de interés afecta la inflación. Un agrónomo en la pampa argentina modela cómo el nivel de fertilizante (X) predice el rendimiento del trigo (Y). Un gerente de ventas en Bogotá usa regresión para entender cuánto del gasto en publicidad se traduce en ventas. Un médico del IMSS en México analiza si el índice de masa corporal (X) predice el nivel de glucosa en sangre (Y). Esta calculadora realiza todos estos análisis de forma instantánea.
El modelo de regresión lineal simple: ecuación, parámetros y supuestos
El modelo de regresión lineal simple ajustado es ŷ = a + b·x, donde a (el estimador de α) es el intercepto estimado y b (estimador de β) es la pendiente estimada. La pendiente b es el parámetro más informativo: indica el cambio promedio en Y por cada unidad adicional de X. Si b = 5.2, significa que cada MXN adicional de publicidad (X) genera en promedio 5.2 unidades adicionales de ventas (Y). El intercepto a es el valor predicho de Y cuando X = 0: a veces tiene sentido físico (precio base), otras no (extrapolación). Los supuestos del modelo clásico son: linealidad de la relación, homocedasticidad (varianza constante de los errores), independencia de los errores y normalidad de los residuos.
El método de mínimos cuadrados ordinarios (MCO): cómo se estiman pendiente e intercepto
Los estimadores MCO minimizan la suma de los cuadrados de los residuos SSE = ∑(yᵢ – ŷᵢ)². Las fórmulas cerradas son: b = Sxy/Sxx y a = é – b·̄x, donde ̄x e é son las medias, Sxx = ∑(xᵢ-̄x)² y Sxy = ∑(xᵢ-̄x)(yᵢ-é). Esta calculadora usa Big.js para calcular todas las sumas con aritmética de precisión extendida, evitando los errores de cancelación catastrófica que ocurren en cálculos naívos con números de punto flotante cuando los datos tienen valores grandes o muy similares. El MCO tiene la propiedad MELI (Mejor Estimador Lineal Insesgado) bajo los supuestos clásicos, lo cual lo convierte en el método estándar en econometría, epidemiología y ciencias aplicadas en toda América Latina.
El coeficiente de correlación de Pearson (r) y el coeficiente de determinación R²
El coeficiente de correlación de Pearson r mide la fuerza y dirección de la relación lineal entre X e Y, con valores entre -1 y +1. r = +1: correlación lineal positiva perfecta (todos los puntos en una línea con pendiente positiva). r = -1: correlación lineal negativa perfecta. r = 0: sin correlación lineal (aunque puede haber relación no lineal). En la práctica: |r| ≥ 0.9 se considera muy fuerte, 0.7-0.9 fuerte, 0.5-0.7 moderada, y <0.5 débil. El coeficiente de determinación R² = r² mide la proporción de la varianza de Y explicada por el modelo lineal con X: R² = 0.85 significa que el 85% de la variación en Y se explica por X a través del modelo de regresión. Esta calculadora muestra r con su interpretación verbal y R² en porcentaje.
El error estándar del estimado y la inferencia sobre la pendiente
El error estándar del estimado Se = √(SSE/(n-2)) mide la dispersión promedio de los puntos alrededor de la línea de regresión: cuanto menor, mejor el ajuste. Se tiene las mismas unidades que Y. El error estándar de la pendiente Sb = Se/√Sxx se usa para hacer inferencia sobre β: el cociente t = b/Sb sigue una distribución t con n-2 grados de libertad y permite probar si la pendiente es significativamente diferente de cero (H₀: β=0). El intervalo de predicción al 95% para un nuevo valor x₀ es ŷ₀ ± t₉.₅Ζ · Se · √(1 + 1/n + (x₀-̄x)²/Sxx), que esta calculadora computa en el Modo 2 cuando se proporcionan Se, n, ̄x y Sxx.
Cómo funciona esta calculadora de regresión lineal
Esta herramienta opera en dos modos complementarios que cubren el flujo completo del análisis de regresión lineal, desde los datos crudos hasta la predicción con intervalos de confianza.
Modo 1: Análisis completo con tabla de datos
Ingresas tus pares (x, y) en la tabla dinámica. Puedes agregar filas con el botón «+ Agregar fila», eliminarlas con la X, borrar todo o cargar el ejemplo pre-cargado (publicidad vs ventas en miles de MXN). La tabla soporta hasta 50 filas y tiene scroll vertical. Al calcular, la herramienta computa con Big.js las sumas ∑x, ∑y, ∑xy, ∑x², ∑y², y de ahí extrae todos los parámetros: pendiente b, intercepto a, r de Pearson, R², SSE, MSE, Se y Sb. La gráfica muestra el scatter de los datos (puntos teal) con la recta de regresión superpuesta (línea dorada).
Modo 2: Predicción con intervalo de confianza
Ingresas la pendiente b y el intercepto a (del Modo 1 o de otro software), y el valor x₀ a predecir. Calcula ŷ₀ = a + b·x₀ instantáneamente. Si además ingresas el error estándar Se y n, calcula el intervalo de predicción al 95% con el valor t adecuado para n-2 grados de libertad (tabla t incorporada para df de 1 a 30+). Si también ingresas ̄x y Sxx, el intervalo incluye el término (x₀-̄x)²/Sxx que ensancha correctamente el intervalo para valores de x alejados de la media. La gráfica muestra la recta con el punto predicho marcado en oscuro.
3 Ejemplos Reales de Regresión Lineal en América Latina
Caso 1: Publicidad vs Ventas (México)
Una PYME en Guadalajara registra sus gastos mensuales en publicidad (X, miles MXN) y ventas (Y, miles MXN) durante 8 meses: X=[1,2,3,4,5,6,7,8], Y=[14,17,24,30,35,43,48,52].
MCO da: b=5.238, a=8.071. R²=0.9964 (99.6%). Cada MXN adicional de publicidad genera 5.238 MXN de ventas. Predicción para x=9: ŷ=55.2 miles MXN.
El análisis de retorno sobre inversión publicitaria (ROAS) mediante regresión lineal es fundamental para PYMEs y grandes empresas en México. La pendiente b=5.238 significa que cada peso invertido en publicidad genera 5.24 pesos de ventas. El IAB México y agencias de publicidad digital usan este análisis para optimizar presupuestos de marketing. Un R² del 99.6% indica que casi toda la variación en ventas se explica por el gasto publicitario, una relación inusualmente fuerte que justifica invertir más en publicidad.
Caso 2: Rendimiento de soya vs fertilizante (Argentina)
Un investigador del INTA en la pampa argentina mide el rendimiento de soya (Y, kg/ha) para diferentes dosis de nitrógeno (X, kg/ha): X=[0,20,40,60,80,100], Y=[1800,2200,2650,3100,3400,3700].
MCO: b=18.97, a=1811. R²=0.998. Cada kg/ha de N adicional aumenta el rendimiento en ~19 kg/ha. Para dosis de 120 kg/ha: ŷ = 4087 kg/ha.
La dosis-respuesta a fertilizantes es uno de los análisis de regresión más comunes en agronomia latinoamericana. El INTA Argentina, la EMBRAPA Brasil y el CIMMYT publican curvas de respuesta a fertilización que se estiman mediante regresión lineal (o cuadrática) sobre datos de ensayos de campo. La pendiente b representa la respuesta marginal al fertilizante: un valor alto justifica económicamente la fertilización intensiva si el precio del grano lo permite.
Caso 3: Estatura vs peso en niños (Colombia)
Un pediatra en Medellín analiza datos de 6 niños: Estatura X (cm)=[100,110,115,120,125,130], Peso Y (kg)=[17,21,23,25,28,31].
MCO: b=0.467, a=-29.95. R²=0.989. Para estatura de 135 cm: ŷ = 0.467×135 – 29.95 = 33.1 kg.
Las curvas de crecimiento infantil publicadas por la OPS/OMS para América Latina se basan en modelos de regresión donde la edad o la estatura predicen el peso ideal. Los pediatras del IMSS, EsSalud y sistemas de salud pública de toda la región usan estas referencias para diagnosticar desnutrición o sobrepeso. La regresión también se usa en medicina para crear nomogramas, que son gráficas de regresión que permiten leer predicciones directamente sin calcular.
3 Consejos de Expertos para Regresión Lineal
Siempre grafica el scatter ANTES de calcular la regresión
El famoso cuarteto de Anscombe (1973) demostró que cuatro conjuntos de datos completamente diferentes pueden tener idénticos valores de a, b, r² y Se, pero gráficas totalmente distintas: una relación curva, un outlier extremo, puntos colineales excepto uno. La moraleja es fundamental: nunca confies en los números de la regresión sin ver el diagrama de dispersión. Esta calculadora muestra el scatter con la recta superpuesta precisamente por este motivo. Si la relación parece curva, considera regresión cuadrática o logarítmica.
R² alto no significa que el modelo es correcto
Un R² = 0.95 parece impresionante, pero puede esconder problemas graves: puede haber un único outlier influyente que «estira» la correlación; puede haber autocorrelación en series de tiempo (claro en datos financieros); puede ser una correlación espúrea (helados y ahogamientos tienen alta correlación porque ambos dependen del calor). Corr. espuria es un problema común en datos de series de tiempo macroeconómicas en América Latina. Siempre verificar los residuos, la significancia estadística de la pendiente (t-test), y la validez del modelo en datos nuevos.
El intervalo de predicción es mayor que el de confianza para la media
Al predecir Y para un nuevo x₀ hay dos intervalos distintos: el intervalo de confianza para E(Y|x₀) (la media de Y en x₀) y el intervalo de predicción para un valor individual Y. El segundo es siempre más ancho porque incluye la variabilidad individual. El Modo 2 de esta calculadora calcula el intervalo de predicción (el más conservador y apropiado para predecir un valor individual). Para valores de x₀ muy alejados de ̄x, ambos intervalos se ensanchan notablemente, lo que limita la extrapolación fuera del rango de los datos.
16 Preguntas Frecuentes sobre Regresión Lineal
¿Qué es la regresión lineal simple?
Un método estadístico para modelar la relación lineal entre una variable dependiente Y y una independiente X mediante el modelo ŷ = a + b·x. Los parámetros a (intercepto) y b (pendiente) se estiman minimizando la suma de cuadrados de los residuos (método MCO). El objetivo es predecir Y para nuevos valores de X y cuantificar la fuerza de la relación lineal.
¿Qué es la pendiente b?
b = Sxy/Sxx = ∑(xᵢ-̄x)(yᵢ-é) / ∑(xᵢ-̄x)². Indica el cambio promedio en Y por cada unidad adicional de X. Si b = 3.5, cada unidad adicional de X produce en promedio 3.5 unidades más de Y. Si b < 0, la relación es inversa. La pendiente tiene las mismas unidades que Y/X.
¿Qué es el coeficiente de correlación de Pearson r?
r = Sxy/√(Sxx·Syy), va de -1 a +1. Mide la fuerza y dirección de la relación lineal. |r| ≥ 0.9 = muy fuerte, 0.7-0.9 = fuerte, 0.5-0.7 = moderada, 0.3-0.5 = débil, <0.3 = muy débil. r = 0 no implica independencia (puede haber relación no lineal perfecta). r² = R² = proporción de varianza de Y explicada por X.
¿Qué mide R²?
R² = 1 – SSE/Syy, el porcentaje de la varianza de Y explicado por el modelo de regresión lineal con X. R² = 0.85 significa que el 85% de la variabilidad en Y se explica por X; el 15% restante es variabilidad no explicada (residuos). R² va de 0 a 1. En ciencias sociales, R² = 0.5 puede ser bueno; en química analítica, se espera R² > 0.99.
¿Cuál es la diferencia entre correlación y regresión?
La correlación (r) mide la fuerza de la asociación lineal, es simétrica (r(X,Y) = r(Y,X)) y no distingue qué variable es la independiente. La regresión modela la predicción de Y dado X: la recta Y sobre X es diferente a X sobre Y, y cuantifica la magnitud del efecto (pendiente b). La correlación dice «qué tan relacionadas están»; la regresión dice «cuánto cambia Y cuando X cambia en 1 unidad».
¿Qué es el error estándar del estimado Se?
Se = √(SSE/(n-2)) mide la dispersión promedio de los puntos alrededor de la recta de regresión. Tiene las mismas unidades que Y. Aproximadamente 68% de los puntos caen dentro de ±Se de la recta, y 95% dentro de ±2Se. Se pequeño indica buen ajuste. Se usa para construir intervalos de confianza y predicción, y para probar la significancia estadística de la pendiente.
¿Cómo se interpreta el intercepto a?
a = é – b·̄x es el valor predicho de Y cuando X = 0. A veces tiene interpretación física (costo fijo cuando producción=0), pero frecuentemente no (peso de una persona con estatura=0 no tiene sentido). La precaución más importante: no extrapolar el modelo más allá del rango de los datos observados, especialmente para X=0 si este valor está lejos del rango de datos.
¿Cuántos datos necesito para regresión lineal?
Mínimo 2 puntos (pero con 2 puntos cualquier línea es perfecta, sin valor estadístico). Para inferencia válida se necesitan al menos n=5-10 puntos. La regla práctica en estadística aplicada es n ≥ 20-30 para obtener estimaciones estables y residuos que permitan verificar supuestos. Con n < 10, los intervalos de confianza son muy amplios y el poder estadístico es bajo.
¿Cómo se verifica la normalidad de los residuos?
Graficando el histograma de los residuos (errores = yᵢ – ŷᵢ) y comparando con una curva normal, o mediante una gráfica Q-Q de cuantiles. Si los puntos caen en línea recta en el Q-Q plot, los residuos son aproximadamente normales. Las pruebas formales (Shapiro-Wilk para n<50, Kolmogorov-Smirnov para n grande) dan una decisión formal. La normalidad es más importante para intervalos y pruebas de hipótesis que para la estimación MCO.
¿Qué es la homocedasticidad?
El supuesto de que la varianza de los errores es constante para todos los valores de X: Var(ε|X=x) = σ² (constante). Si la dispersión de los residuos aumenta o cambia con X (heterocedasticidad), los errores estándar de la regresión clásica MCO son incorrectos y los intervalos de confianza e hipotesis no son válidos. Se detecta graficando los residuos contra X: si el «embudo» se abre, hay heterocedasticidad. Solución: errores estándar robustos (HC) o transformar Y (log, raiz).
¿Qué es un outlier influyente y cómo afecta la regresión?
Un outlier influyente es un punto que, si se elimina, cambia sustancialmente la recta de regresión. Se detecta con la distancia de Cook o el leverage. Los puntos con X muy alejado de ̄x (alto leverage) tienen más influencia. Un solo outlier con alto leverage puede cambiar el signo de la pendiente b. Siempre verificar si los outliers son errores de datos (corregir) o valores reales (analizar por qué son distintos, puede ser información valiosa).
¿Cuándo debo usar regresión logarítmica en lugar de lineal?
Cuando la relación entre X e Y es proporcional o exponencial en lugar de lineal. Si el scatter muestra una curva que crece pero desacelera (como rendimiento de cultivos con fertilizante a altas dosis, o aprendizaje con práctica), prueba log(Y) vs X o Y vs log(X). Si ambas variables parecen multiplicarse (precios inflados, poblaciones), prueba log(Y) vs log(X) (regresión log-log). El R² de la regresión logarítmica (ajustado de vuelta a la escala original) mostrará si el modelo no lineal es mejor.
¿Qué es la regresión lineal múltiple?
La extensión con más de una variable independiente: Y = a + b₁X₁ + b₂X₂ + … + bₖXₖ + ε. Permite controlar varias variables simultáneamente: el efecto de la publicidad en ventas controlando por precio, estacionalidad y competidores. Es la base de la econometría moderna. Esta calculadora implementa la regresión lineal simple (una sola X); para regresión múltiple se recomienda usar R, Python (statsmodels), Excel o STATA, programas disponibles en universidades latinoamericanas.
¿Cómo se usa la regresión lineal en control de calidad?
En control de calidad y Six Sigma, la regresión lineal identifica relaciones causa-efecto en el diagrama SIPOC. Si una variable de proceso X (temperatura, velocidad) afecta una característica Y del producto (resistencia, dimensión), la regresión cuantifica la relación y permite fijar X para lograr el Y objetivo. El análisis Gauge R&R, el diseño de experimentos (DOE) y el análisis de capacidad de proceso usan regresión extensivamente en la industria manufacturera de México, Colombia y Chile.
¿Qué software usa regresión lineal en América Latina?
Los más usados: Excel (=PENDIENTE, =INTERSECCION.EJE, ESTIMACION.LINEAL), R (lm(Y~X)), Python (statsmodels.OLS, sklearn.LinearRegression), STATA (regress Y X), SPSS (Análisis > Regresión) y MINITAB (Stat > Regression). STATA y SPSS son comunes en ciencias sociales y epidemiología. R y Python dominan en ciencia de datos. Excel es el más accesible para PYMEs y estudiantes. Esta calculadora online no requiere instalación.
¿Correlación implica causalidad?
No. Una correlación alta o una regresión con pendiente significativa no prueban que X cause Y: ambas pueden ser causadas por una tercera variable Z (confusor), la causalidad puede ir en dirección opuesta, o puede ser coincidencia (correlación espúrea). El consumo de helados y las muertes por ahogamiento tienen alta correlación porque ambas aumentan en verano con el calor (variable confusora). Para establecer causalidad se necesitan experimentos controlados aleatorizados (RCT) o métodos econométricos de identificación causal.
Calculadoras Relacionadas
Aviso Legal y Transparencia Editorial
Metodología estadística
Esta calculadora implementa Mínimos Cuadrados Ordinarios (MCO) usando Big.js para las sumas acumuladas (eliminando errores de cancelación catastrófica en aritmética de punto flotante). El coeficiente de correlación de Pearson r = Sxy/√(Sxx·Syy). El intervalo de predicción usa una tabla t aproximada para grados de libertad enteros. Los resultados son precisos para datos con hasta ~15 dígitos significativos en los valores individuales de x e y.
Referencias académicas
Los conceptos corresponden a los programas de Estadística y Econometría de UNAM, Universidad Nacional de Colombia y metodologías publicadas por INEGI. PlanetaCalculadoras.com no asume responsabilidad por el uso de estos resultados en decisiones económicas o científicas sin la debida validación profesional.