Unidad 2 · Aprender una cantidad: regresiónClase 5 de 23
Clase 5 · Regresión: predecir una cantidad

Objetivo. Explicar el modelo lineal ŷ = θ₀ + θ₁x: qué es dato, qué aprende el modelo y qué significa cada símbolo.

Ficha Bloom · Comprender
  • Evidencia de aprendizaje: Explica θ₀ y θ₁ con sus unidades y predice un valor dentro del rango de los datos.
  • Actividad final: «Tu pregunta»: el árbol de 45 cm y el compañero que confunde θ₁ con el peso a radio cero.
  • Criterio de dominio: Nombra qué símbolo responde cada pregunta y declara cuándo una predicción es extrapolación.
Activación. El profesor quiere saber cuánto pesa un árbol sin cortarlo. ¿Qué medirías, y cómo lo usarías para predecir? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Clase 6 · Regresión

Modelo lineal · función de costo · minimizar el riesgo · R²
Fundamentos de Ciencia de Datos · UdeC · Clase del 31-jul

Limpieza de datos → Regresión → Sobreajuste → Generalización → Validación
Dónde estás. La regresión es el punto donde el curso se vuelve modelamiento. Tu profesor lo plantea al abrir la clase: hay conceptos fundamentales que se ven en regresión y que después se aplican en clasificación y, así sucesivamente, en distintos modelos de inteligencia artificial [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:00:53–0:01:05].

Se pregunta poco de forma directa en los certámenes — y es de donde sale todo lo demás. No lo estudies por puntaje.
Este documento es la clase completa. Si lo que quieres es experimentar con la función de coste —mover la recta y ver el error crecer—, abre regresion_y_costo.html, que es el laboratorio.

El ejemplo es de tu profesor

«me gustaría saber más menos cuál es el peso del árbol sin tener que cortarlo […] fíjense que hay ruido cierto porque no todos los árboles son iguales hay algunos árboles que tienen el mismo radio pero tienen distinto peso» Clase del 31-jul · 0:19:04–0:19:53 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]

Fíjate en la segunda mitad de la cita: el ruido. Dos árboles del mismo radio pesan distinto, así que ninguna recta puede pasar por todos. Eso que la recta no explica es la ε de la §7, y querer explicarlo igual es lo que lleva al sobreajuste.

Quédate con esa imagen, porque explica los cinco conceptos de golpe:

Cortaste 20 árboles. De cada uno mediste el radio del tronco y lo pesaste. Ahora llega un árbol nuevo, en pie. Puedes medir su radio, pero no lo quieres cortar para saber cuánto pesa.

Ese es el problema entero. Todo lo demás es cómo resolverlo.

1 · Regresión

Quieres predecir un número: kilos. No una categoría.

En regresión no existe «acertar». Si el árbol pesa 340 kg y predices 338, no acertaste ni fallaste: estuviste cerca. Por eso todo aquí mide distancia, nunca aciertos. Tenlo presente — es de donde nace la confusión más común con R².

2 · El modelo lineal

Tu apuesta más simple: «por cada centímetro más de radio, el árbol pesa tantos kilos más».

Eso es una recta. Y una recta son dos números:

NúmeroQué significa con los árboles
Dónde empiezaCuánto pesaría un árbol de radio cero. Sin sentido físico, pero la recta tiene que arrancar en algún lado
Cuánto subeLos kilos que gana por cada centímetro de radio
Entrenar un modelo lineal es encontrar esos dos números. Nada más.

La trampa que tu profesor deja caer

Después de la recta se pregunta por qué no una parábola, y por qué no una cúbica. Y aclara qué significa «lineal»:

«La complejidad del modelo tiene relación con el número de parámetros que tiene el modelo. […] la regresión lineal se llama regresión lineal porque es lineal en los ⟨θ⟩. No porque es lineal en los x.» Clase del 31-jul · 0:37:24–0:37:55 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]
«En realidad en este caso son p más 1 porque acá tengo el ⟨θ⟩ 0. […] Hay un solo ⟨θ⟩ o sea cada ⟨θ⟩ ⟨aparece⟩ una sola vez.» Clase del 31-jul · 0:38:35–0:39:17 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]
Lineal en los parámetros, no lineal en X. Un polinomio de grado 2 dibuja una curva, no una recta, y sigue siendo un modelo lineal. Lo que importa es cómo entran los parámetros, no la forma del dibujo.

La regla para reconocerlo: cada θ aparece una sola vez, multiplicando algo que depende solo de x. Nada de θ², log(θ) ni eθ.
La cuenta de parámetros: un polinomio de grado p tiene p + 1 (θ₀ a θp). Más grado, más parámetros, más complejidad.

Es exactamente el tipo de distinción que evalúa: curva ≠ no lineal.

Aplica: ¿cuáles de estos son regresión lineal? (1) ŷ = θ₀ + θ₁x + θ₂x² + θ₃x³ · (2) ŷ = θ₀ + θ₁·log(x) · (3) ŷ = θ₀ + θ₁²·x · (4) ŷ = θ₀ + log(θ₁)·x. Para los que sí lo son, ¿cuántos parámetros tienen?

Respuesta correcta y cómo se resuelve

Respuesta: son regresión lineal el (1), con 4 parámetros, y el (2), con 2; el (3) y el (4) no lo son.

Cómo se resuelve: revisa cada θ y pregúntate si aparece una sola vez, multiplicando algo que depende solo de x. (1) θ₀…θ₃ aparecen solos: cúbico en x, lineal en θ; p = 3, así que p + 1 = 4 parámetros. (2) log(x) es solo una función de x, y θ₁ la multiplica tal cual: 2 parámetros. (3) θ₁ aparece al cuadrado: no es lineal en θ. (4) θ₁ está dentro de un logaritmo: tampoco.

Error típico: mirar x en vez de θ, y descartar el (1) «porque es una curva» o el (2) «porque tiene un logaritmo».

De dónde sale: la regla de las dos citas de arriba (clase del 31-jul); casos casi idénticos aparecen en [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · lámina 11].

Aquí nace el sobreajuste. Al subir el grado, la lámina muestra un polinomio de grado 10 con oscilaciones violentas que pasa muy cerca de casi todos los puntos: es donde el curso introduce el sobreajuste [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · lámina 11, §6.5.4]. Muévelo tú mismo en overfitting_underfitting.html, y mira cómo lo preguntó el certamen en la ficha P7.

3 · La función de costo

Hay infinitas rectas candidatas. Necesitas un número que diga qué tan mala es cada una.

Como conoces el peso real de tus 20 árboles cortados, para cada uno puedes medir cuánto te equivocaste:

error = peso real − peso que predijo la recta

Un árbol pesaba 340 y predijiste 338 → error 2.
Otro pesaba 180 y predijiste 205 → error −25.

¿Por qué al cuadrado?

Si sumas los errores tal cual, se cancelan: el +2 y el −25 se restan, y una recta pésima puede dar suma cero. Elevar al cuadrado lo evita:

árbol 1: error 2 → 4 árbol 2: error −25 → 625 árbol 3: error 5 → 25 ───── promedio = 218 ← error cuadrático medio
Efecto de regalo: castiga más los errores grandes. El árbol donde te equivocaste 25 kg aporta 625; el de 2 kg aporta 4. Fallar feo una vez es peor que fallar poquito muchas veces.

4 · Minimizar el riesgo

Ahora el problema deja de ser vago: busca los dos números que hacen ese costo lo más pequeño posible.

Eso es todo lo que significa «minimizar el riesgo». Para una recta hay fórmula exacta — mínimos cuadrados. No hace falta tantear.

«esta es la solución analítica que es básicamente la covarianza para el ⟨θ⟩ 1 […] es la covarianza entre x ⟨e y⟩ partido por la varianza de x […] yo no se lo voy a pedir para ningún certamen» Clase del 31-jul · 0:31:06–0:31:40 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]
θ̂₁ = Cov(x, y) / Var(x)   ·   θ̂₀ = ȳ − θ̂₁·x̄

Léela así: la pendiente es cuánto varían juntos radio y peso, medido en unidades de cuánto varía el radio solo. Y la recta pasa por el punto promedio (x̄, ȳ). Con los 20 árboles simulados de esta página: Cov = 177,2 y Var = 18,24, así que θ̂₁ = 9,72 kg/cm y θ̂₀ = 144,65 − 9,72 · 15,6 ≈ −6,9 kg (cifras ilustrativas [DATITO]; el botón «Minimizar el riesgo» las lleva a la escala de los deslizadores, así que verás 9,8 y −6). No se pide en el certamen: se entiende, no se memoriza.

La duda que apareció en clase: ¿se derivan los datos?

Un compañero preguntó cómo se deriva la función de costo si lo que hay dentro son datos. El intercambio:

«no estaría como derivando los números […] como les decía la función de costo depende del modelo y el modelo depende de los parámetros» Clase del 31-jul · 0:34:34–0:34:49 · pregunta un compañero (primera frase), responde el profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]
Se deriva respecto a los parámetros, no a los datos. Una vez que cortaste los 20 árboles, cada xi y cada yi es un número fijo: una constante. Lo único que puede moverse son θ₀ y θ₁. El costo es una función de los θ, y derivar es preguntar «si muevo un poco θ₁, ¿el costo sube o baja?». Por eso se iguala a cero la derivada respecto a cada θ [DATITO].
La palabra que importa es empírico. Minimizas sobre los 20 árboles que cortaste, no sobre todos los árboles del mundo. De ahí sale el sobreajuste.

5 · Pruébalo

Antes de tocar nada: si aumentas «cuánto sube» y dejas «dónde empieza» fijo, ¿qué le pasa a la recta?
Respuesta correcta y cómo se resuelve

Respuesta: la recta gira y queda más inclinada, pivotando sobre el punto donde corta el eje vertical, que no se mueve.

  1. La recta es ŷ = θ₀ + θ₁·x. «Cuánto sube» es θ₁ (la pendiente) y «dónde empieza» es θ₀ (el corte con el eje vertical)
  2. En x = 0, ŷ = θ₀: si θ₀ no cambia, ese punto queda fijo
  3. Para cualquier otro x, ŷ cambia en (cambio de θ₁)·x: poco cerca de 0, mucho lejos. Eso es girar. Ejemplo con θ₀ = 0: pasar θ₁ de 10 a 12 deja x = 0 en 0 kg, lleva x = 10 de 100 a 120 kg y x = 20 de 200 a 240 kg [DATITO]

Error típico: atribuirle a θ₁ lo que hace θ₀ (desplazar la recta entera, paralela a sí misma).

De dónde sale: «m es la pendiente y b es el punto de intersección en la ordenada», con θ₁ = m y θ₀ = b [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.47–55 y l.181–185].

10,0 0
–
Costo
–
R²
–
Radio 18 cm
–
Radio 45 cm

6 · R²: comparado con no pensar

El costo está en kilos al cuadrado. Eso no significa nada para nadie. R² responde otra pregunta, y esa sí se entiende:

¿Cuánto mejor lo hago que si dijera siempre el peso promedio?

Ese es el rival: un modelo tonto que ignora el radio y responde «todos los árboles pesan lo mismo». Es la línea gris punteada del gráfico, y no se mueve: depende solo de los datos.

R²Qué significa
1,00Clavaste los 20 árboles
0,90Tu error es el 10 % del que tendrías diciendo el promedio
0,00Igual de bueno que decir siempre el promedio
−0,08Peor que el promedio. Es tu baseline de Melbourne
R² = 0 no es «no acertó nada». Es «no aportó nada sobre decir el promedio». Y puede ser negativo, porque siempre se puede hacer peor que no pensar.

R² es de regresión

En la clase de clasificación un compañero preguntó si las tasas de falsos positivos venían a reemplazar al R². La respuesta:

«el ⟨R cuadrado⟩ es una métrica que uno usa para medir lo errores o el porcentaje de la varianza que representa un modelo de regresión el ⟨R cuadrado⟩ uno lo usa para regresión en este caso estamos en clasificación» Clase del 7-ago · 1:12:03–1:12:18 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]

Verdadero o falso, en caso de ser falso justifique. En la ayudantía se dijo, al presentar las métricas:

«R cuadrado está en 0 y 1 y entre más cercano a uno mejor» Ayudantía del 31-jul · 0:50:47–0:50:49 · la ayudantía · [FUENTE · Repo: 05_CLASES/transcripciones/06Ayudantia_Fundamentos_en_Ciencia_de_Datos_31_Julio.md]
Respuesta correcta y cómo se resuelve

Respuesta: Falso: R² nunca pasa de 1, pero sí puede ser negativo.

Cómo se resuelve: R² = 1 − SSres / SStot. Si tu modelo se equivoca más que responder siempre el promedio, SSres > SStot, el cociente pasa de 1 y la resta queda negativa. Ejemplo a mano [DATITO]: SStot = 100 y SSres = 150 → R² = 1 − 1,5 = −0,5. Tus propios datos lo prueban: el baseline de Melbourne dio −0,080 en 2017, y Ridge sobre log1p(Price) dio −17,0 al deshacer expm1 sobre valores extremos [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md].

Error típico: la frase de la ayudantía tiene una parte de verdad que confunde. Sobre los mismos datos con que se ajustó una recta de mínimos cuadrados con intercepto, R² no baja de 0, porque la recta siempre puede imitar al promedio [INFERENCIA]. Sobre datos nuevos esa garantía desaparece, y es justo donde se evalúa un modelo.

De dónde sale: la fórmula de la §8 de esta página; cifras de [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] vía material.md.

7 · La notación, desarmada

Y = θ₀ + θ₁·X + ε
SímboloQué es con los árbolesRol
YEl peso que quieres predecires el target
XEl radio del tronco, que sí puedes medires un dato
θ₀Dónde empieza la rectalo aprende el modelo
θ₁Kilos que gana por cada centímetrolo aprende el modelo
εLo que la recta no logra explicarno se controla

Con los 20 árboles simulados de esta página, esos dos números salen θ₁ ≈ 9,72 kg por cm y θ₀ ≈ −6,9 kg (cifras ilustrativas [DATITO]). Eso es todo el modelo.

Ojo con los números del P4. En tu Práctica 4 aparecen θ₁ = 82,13 y θ₀ = 0,2588, pero no son de árboles: vienen de datos sintéticos generados con make_regression (1.000 muestras, 1 atributo, ruido 10), sin unidades de kilos ni centímetros [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.57–67 y l.175–185]. Sirven para ver qué es un coeficiente, no para interpretar pesos.
MSE = (1/n) · Σ (yᵢ − ŷᵢ)²
SímboloQué esRol
yᵢEl peso real del árbol ies un dato
ŷᵢEl peso que predijo la rectasale del modelo
yᵢ − ŷᵢEl error en ese árboles lo que se minimiza
( )²Elevar al cuadradolo decides tú
Σ y 1/nSumar los n errores y promediarlo decides tú

El sombrero de ŷ es la convención de todo el curso: con sombrero es lo predicho, sin sombrero es lo real. Y el cuadrado no viene de la naturaleza — es una elección, que podría haber sido el valor absoluto, y entonces tendrías MAE.

8 · Camino inverso: te dan la fórmula

En la prueba no te van a contar lo de los árboles: te van a escribir esto. Haz el recorrido al revés.

R² = 1 − SSres / SStot
1 · ¿Qué hay en el numerador?

SSres es la suma de los errores de tu modelo, al cuadrado. Son las líneas rojas del gráfico de arriba, elevadas y sumadas.

Es lo único de esta fórmula que tu modelo puede mover.

2 · ¿Y en el denominador?

SStot es lo mismo, pero para un modelo que ignora el radio y responde siempre el peso promedio. Es la línea gris punteada.

No depende de tu modelo. Está fijado por los datos antes de que entrenes nada.

3 · Entonces, ¿qué es el cociente?

Qué fracción del error del modelo tonto conservas. Si vale 0,1, tu error es el 10 % del suyo.

Y el 1 − lo da vuelta para que más alto sea mejor: R² = 0,90 significa «mi error es el 10 % del que tendría sin pensar».

4 · ¿Por qué puede ser negativo?

Si SSres supera a SStot, el cociente pasa de 1 y la resta se vuelve negativa. Significa que lo haces peor que responder el promedio.

Tu baseline de Melbourne dio −0,080: predecir siempre la mediana de 2016 sobre datos de 2017 fue peor que no pensar.

5 · ¿Y por qué no se entrena minimizando R²?

Porque SStot es una constante. Lo único variable es SSres, que es exactamente lo que el MSE ya minimiza.

Minimizar R² y minimizar el MSE son la misma operación, escrita distinto.

Tu pregunta

Cortaste 20 árboles y ajustaste la recta. Sale R² = 0,93.

Tu jefe te pide predecir el peso de un árbol de radio 45 cm.

Revisas tus datos: los 20 árboles que cortaste tenían radios entre 8 y 22 cm.

¿Le entregas la predicción? Justifica.

Pulsa «Mostrar zona sin datos» en el gráfico antes de responder.

Y explícaselo a alguien: un compañero dice «si θ₁ es 9,72, entonces un árbol de radio cero pesaría 9,72 kilos». ¿Tiene razón? Justifícalo nombrando qué símbolo responde esa pregunta, y qué te dice que ese símbolo salga negativo. Escríbelo y llévalo a Datito.

Respuesta correcta y cómo se resuelve

Respuesta a «Tu pregunta»: no se entrega como predicción confiable: 45 cm está fuera del rango observado (8 a 22 cm), así que es una extrapolación, y el R² = 0,93 no dice nada sobre ese tramo.

  1. Ubica el pedido respecto a los datos. 45 cm es más del doble del radio más grande que mediste (22 cm): no hay ni un árbol de ese tamaño en tu entrenamiento
  2. Lee bien el R². El 0,93 mide qué tan bien la recta describe los 20 árboles que ya cortaste, dentro de 8–22 cm. Es un número de entrenamiento y de ese rango; no certifica nada fuera de él
  3. El modelo igual devuelve un número. Con los θ de esta página: ŷ = θ₀ + θ₁·45 = −6,9 + 9,72·45 ≈ 430 kg (el panel muestra 435 kg porque redondea los deslizadores). Tener un número no es tener evidencia. Si alguien usara los números del P4, saldría 0,2588 + 82,13·45 ≈ 3.696 kg: un número todavía más vacío, porque esos θ vienen de make_regression, no de árboles
  4. Contrasta con la física. El peso crece más o menos con el volumen (≈ radio² × altura), no en línea recta, así que la recta probablemente subestima los árboles grandes [INFERENCIA]. Por ejemplo, si el peso escalara con el radio al cuadrado, pasar de 22 a 45 cm lo multiplicaría por (45/22)² ≈ 4,2: de unos 207 kg a unos 865, no a 430 [DATITO]
  5. Qué hacer. O entregas el número con una advertencia explícita («extrapolación: el modelo se entrenó con radios de 8 a 22 cm»), o, mejor, mides y cortas algunos árboles grandes para ampliar el rango. Más en generalizacion.html

Respuesta a «explícaselo a alguien»: el compañero se equivoca de símbolo. Respuesta modelo: «θ₁ es la pendiente: cuántos kilos gana el árbol por cada centímetro más de radio, no el peso de nada. El peso en radio cero lo da θ₀, el punto donde la recta corta el eje, y aquí vale unos −6,9 kg. Que salga negativo te avisa que radio 0 también está fuera de los datos (8 a 22 cm): θ₀ es solo donde la recta cruza el eje, sin sentido físico.»

Errores típicos: creer que un R² alto vale para cualquier radio; confundir «el modelo da un número» con «el modelo sabe»; y confundir la pendiente θ₁ con el intercepto θ₀.

De dónde sale: datos y coeficientes ilustrativos de esta página [DATITO]; pendiente e intercepto [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.47–55]; origen sintético de 82,13 y 0,2588 [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.57–67]; razonamiento físico [INFERENCIA].

A dónde seguir.

Cierre de la Clase 5 · Regresión: predecir una cantidad

Qué aprendiste

  • Regresión: predecir un valor real, una cantidad.
  • θ₁ es cuánto cambia ŷ por unidad de x; θ₀ es ŷ cuando x = 0.
  • La regresión se llama lineal por ser lineal en los θ, no en x.
  • La complejidad del modelo es su número de parámetros.

Qué no debes confundir

  • Pendiente (θ₁) ≠ intercepto (θ₀).
  • Lineal en θ ≠ lineal en x: la polinomial sigue siendo regresión lineal.
  • Predecir dentro del rango ≠ extrapolar.

Procedimiento para el papel

  1. Identifica x (dato), y (target) y los θ (lo que aprende el modelo).
  2. Interpreta θ₁ en unidades de y por unidad de x.
  3. Antes de predecir, revisa el rango de x observado.

Viene de: Clase 4 · Calidad, limpieza y preparación de datos · Sigue: Clase 6 · Función de costo, error y R²

Vuelve a tu activación: El profesor quiere saber cuánto pesa un árbol sin cortarlo. ¿Qué medirías, y cómo lo usarías para predecir? ¿Cambiarías tu respuesta?

Pregunta final. ¿Es ŷ = θ₀ + θ₁x + θ₂x² una regresión lineal?
Respuesta correcta y cómo se resuelve

Sí: es lineal en los parámetros, porque cada θ aparece una vez multiplicando un término; x² es solo una columna nueva. [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:37:49]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 6 · Función de costo, error y R²

Dudas resueltas con Datito, en orden

Lo que se trabajó en las sesiones sobre este tema, para volver a leerlo y re-intentarlo. Primero responde tú; después abre la respuesta. Fuente: 07_DATITO/dudas.yaml.

21-sep · resuelta en la sesión · Regresion, Generalizacion · también en 07_generalizacion.html

Pregunta. Cortaste 20 árboles y ajustaste la recta: R² = 0,93. Tu jefe te pide predecir el peso de un árbol de radio 45 cm. Los 20 árboles tenían radios entre 8 y 22 cm. ¿Le entregas la predicción? Justifica.

Respuesta correcta y cómo se resuelve

Respuesta. No como una predicción confiable: 45 cm está fuera del rango observado (8–22 cm), es una extrapolación; si se entrega, va con esa advertencia explícita, y lo correcto es medir árboles de ese tamaño.

  1. El rango de tus datos es 8–22 cm. 45 cm es más del doble del máximo: el modelo nunca vio un árbol así.
  2. R² = 0,93 mide el ajuste a los 20 árboles con que ajustaste la recta, todos dentro de 8–22 cm. No dice nada fuera de ese rango.
  3. El modelo igual devuelve un número. Con la recta de la página (θ₁ ≈ 9,72 kg por cm, θ₀ ≈ −6,9 kg): ŷ = −6,9 + 9,72·45 ≈ 430 kg. Tener un número no es tener evidencia.
  4. El peso crece con el volumen (aprox. radio² × altura), más rápido que una recta: con árboles grandes la recta probablemente se queda corta.
  5. Qué haces: entregas el número declarando la extrapolación y por qué no es confiable, o mides árboles grandes y vuelves a ajustar.
  6. Frase para la prueba: «No la entrego como confiable: 45 cm está fuera del rango observado (8–22 cm), así que es extrapolación. El R² de 0,93 mide el ajuste solo dentro de ese rango.»

Error típico. Creer que un R² alto autoriza a predecir en cualquier parte; el R² se calculó solo donde había datos.

[FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:42:10] generalizar: funcionar para datos que no ha visto antes
[FUENTE · Repo: 07_DATITO/02_REFERENCIA/clase6_regresion.html] los 20 árboles y la recta de mínimos cuadrados
[INFERENCIA] «extrapolación»: el profesor no usa esa palabra en las 14 transcripciones
[DATITO] el argumento físico del volumen
Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-21-regresion_generalizacion.md

21-sep · resuelta en la sesión · Regresion

Pregunta. Un compañero dice: «si θ₁ es 82,13, entonces un árbol de radio cero pesaría 82 kilos». ¿Tiene razón? Justifícalo nombrando qué símbolo responde esa pregunta.

Respuesta correcta y cómo se resuelve

Respuesta. No: el peso con radio cero lo da θ₀ (el intercepto), no θ₁; θ₁ es la pendiente, cuántos kilos sube el peso por cada centímetro más de radio.

  1. En ŷ = θ₀ + θ₁·x, con x = 0 queda ŷ = θ₀. El símbolo que responde es θ₀.
  2. θ₁ no es un peso: es kilos POR centímetro. Leerlo como peso confunde pendiente con intercepto.
  3. Con la recta de la página, θ₀ ≈ −6,9 kg: un peso negativo, imposible. Eso muestra lo segundo: radio 0 también está fuera de los datos (8–22 cm), así que ni siquiera θ₀ tiene interpretación física aquí.
  4. Ojo con las cifras: 82,13 y 0,2588 son los coeficientes del P4 sobre datos sintéticos (make_regression), no de árboles. Con esas cifras, radio 0 daría 0,26 kg; el razonamiento es el mismo.
  5. Frase para la prueba: «No. "Cuánto pesa con radio cero" lo responde θ₀, no θ₁; θ₁ es cuánto aumenta el peso por centímetro. Y radio 0 está fuera de los datos, así que θ₀ no se interpreta físicamente.»

Error típico. Leer la pendiente como si fuera el valor de ŷ; interpretar θ₀ fuera del rango de los datos.

[FUENTE · Repo: 07_DATITO/02_REFERENCIA/clase6_regresion.html §7] la notación desarmada
[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md] 82,13 y 0,2588 vienen de make_regression
[INFERENCIA] la lectura de θ₀ negativo como señal de extrapolación
Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-21-regresion_generalizacion.md