Unidad 3 · Medir si el modelo sirveClase 10 de 23
Clase 10 · Overfitting y underfitting

Objetivo. Diagnosticar sobreajuste y subajuste calculando la brecha, y proponer remedios del curso.

Ficha Bloom · Analizar
  • Evidencia de aprendizaje: Clasifica tres modelos con la brecha, nombra el mecanismo y propone un remedio coherente.
  • Actividad final: La tabla A/B/C en el formato del profesor, y la versión con MAE.
  • Criterio de dominio: Calcula la brecha antes de etiquetar y lee bien una métrica de error, donde menos es mejor.
Activación. El modelo B tiene R² 0,98 en entrenamiento y 0,54 en prueba. ¿Es el mejor de la tabla? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Sobreajuste y subajuste

Overfitting y underfitting: cuándo un modelo memorizó y cuándo no alcanzó a aprender.
Fundamentos de Ciencia de Datos · UdeC · Clase del 31-jul (regresión) y Clase del 7-ago (clasificación)

Generalización + Validación cruzada → Overfitting y underfitting → Árboles de decisión → …y 7 conceptos más por cadena
Dónde estás, y por qué este va primero. Viene de generalización y de validación cruzada, y habilita los árboles de decisión (y por cadena random forest, boosting, ensambles, redes, LLM y agentes).

Es el concepto con más peso del Certamen 2: la P2 (V/F de sobreajuste), la P3 (afirmaciones sobre sobreajuste) y la P7 (regresión polinomial) suman 2,0 de los 7 puntos [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §5].

Y tienes un error abierto que conviene nombrar desde ya: ante la tabla A 0,62/0,59 · B 0,98/0,54 · C 0,41/0,39 asignaste los diagnósticos a las filas equivocadas sin calcular las brechas [FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml · diagnostica_sin_calcular_la_brecha]. No es un problema de concepto: es un paso del procedimiento que te saltaste. Aquí se entrena ese paso.

1 · La situación: el árbol que no quieres cortar

El ejemplo es de tu profesor. Quiere saber cuánto pesa un árbol sin cortarlo, midiendo solo el radio del tronco. Tiene árboles ya cortados, ajusta una recta… y luego se pregunta por qué no una parábola, y por qué no una cúbica. Cada vez el error sobre esos datos baja. Y ahí dice:

«por qué entonces no un modelo cúbico. […] estamos complejizando el modelo. La complejidad del modelo tiene relación con el número de parámetros que tiene el modelo. Un modelo con menos parámetros es más simple.» Clase del 31-jul · 0:37:06–0:37:35 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]

En la lámina que acompaña ese tramo se ven los mismos datos con tres polinomios: grado 1, una recta que deja muchos puntos lejos; grado 2, una parábola que sigue la forma; grado 10, una curva con oscilaciones violentas que pasa muy cerca de casi todos los puntos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · lámina 11, §6.5.4 (describe la slide 22 oficial)]. Luego pregunta cuál es mejor, y resuelve:

«a medida que se complejiza el modelo tiende a sobreajustarse más. […] el modelo muy simple no va a ser capaz de predecir bien, […] hay un balance entre tener un modelo muy complejo y un modelo muy simple.» Clase del 31-jul · 0:43:01–0:43:28 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]
La pregunta que este concepto responde: ¿este modelo aprendió la tendencia, o memorizó estos datos en particular?

Sobreajuste = el modelo le va muy bien con los datos con que aprendió y mal con datos que no vio: memorizó, incluido el ruido.
Subajuste = el modelo es tan simple que le va mal en los dos: no alcanza ni a describir los datos que ya tenía.
Entre ambos hay un balance, y la complejidad se mide en número de parámetros.

2 · Pruébalo: la curva de complejidad

Abajo hay pinos inventados: la altura de cada uno según su edad. Son cifras ilustrativas [DATITO], generadas con semilla fija para que siempre salgan iguales. 13 pinos sirven para entrenar (ajustar los θ) y otros 12, que el modelo nunca ve al ajustar, sirven para validar. El deslizador cambia el grado del polinomio: más grado, más parámetros, más complejidad.

Antes de mover el deslizador, predice: al subir el grado de 1 a 12, ¿qué le pasa al error de entrenamiento? ¿y al de validación?
Respuesta correcta y cómo se resuelve

Respuesta: el error de entrenamiento baja (o se queda igual) en cada grado hasta llegar a 0 en el grado 12; el de validación baja hasta un mínimo (grado 4 en estos datos) y después sube, primero de a poco y al final se dispara.

Cómo se resuelve:

  1. Un polinomio de grado p puede imitar al de grado p − 1 poniendo su θ nuevo en cero. Mínimos cuadrados nunca elige algo peor que eso, así que el error de entrenamiento no puede subir al agregar grado [INFERENCIA]
  2. Con 13 pinos, el grado 12 tiene 13 parámetros: pasa exacto por los 13 → ECM de entrenamiento 0
  3. La validación mide pinos que el modelo no vio. Al principio más grado captura la forma (baja); pasado el mínimo, captura el ruido de esos 13 pinos (sube)
  4. Lo lees en la tabla del simulador: grado 1 → 5,62 / 7,14 · grado 4 → 1,90 / 1,64 · grado 12 → 0,00 / 84,47 (entrenamiento / validación, m²)

Error típico: creer que los dos bajan siempre y elegir el grado mirando el entrenamiento. Con ese criterio siempre ganaría el grado más alto, que es justo el que peor generaliza.

De dónde sale: simulador con cifras ilustrativas [DATITO]; el balance entre modelo complejo y simple es la cita del profesor en §1; elegir el orden del polinomio en validación [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].

1
–
Parámetros (p + 1)
–
ECM entrenamiento [m²]
–
ECM validación [m²]
–
Brecha (val − entr.)
–
Lectura
Curva de complejidad: los dos errores para los 12 grados

La «lectura» es una regla didáctica de este visual [DATITO]: subajuste si los dos errores superan el doble del mejor error de validación; sobreajuste si la brecha supera ese mejor error. En el certamen no hay umbral fijo: se argumenta con la brecha y el nivel.

Ver la tabla completa de errores
Lo que acabas de ver, en tres líneas.
1 · El error de entrenamiento nunca sube al agregar grado: cada polinomio contiene al anterior, así que siempre puede ajustar igual o mejor [INFERENCIA]. Con 13 pinos, el grado 12 tiene 13 parámetros y pasa exacto por todos: error 0.
2 · El de validación dibuja una U: baja mientras el modelo aprende la forma, y sube cuando empieza a perseguir el ruido.
3 · Por eso el grado no se elige mirando el entrenamiento: se elige en validación. La lámina lo dice con este mismo ejemplo: el conjunto de validación «se utiliza para ajustar hiperparámetros (por ej, el orden del polinomio)» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].
Aprieta «Más filas» con el grado en 12. Con 39 pinos el mismo grado 12 ya no puede pasar por todos: tiene 13 parámetros para 39 datos, y la brecha casi desaparece. Esa es la P3. Y fíjate en lo que es subir el grado: PolynomialFeatures del P4 fabrica x², x³, … como columnas nuevas, y cada columna trae su θ («Si tenemos k variables explícitas, necesitamos k + 1 parámetros») [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.42 y l.830]. Subir el grado es agregar columnas. Más filas bajan el sobreajuste; más columnas lo suben.

2.5 · Visualización: los tres escenarios

Las tres situaciones en gráficos:

Curva train vs test loss: error de entrenamiento baja siempre; validación baja y sube
Underfitting: modelo simple (recta) no captura la tendencia real (puntos + línea pobre)
Overfitting: modelo complejo oscila para pasar por todos los puntos, incluyendo ruido

3 · El criterio es la brecha, no un número

Un número solo no diagnostica nada. 0,98 de R² en entrenamiento puede ser memoria; 0,41 puede ser un problema difícil. Lo que diagnostica es la distancia entre dentro y fuera, y después el nivel.

brecha = Evalid − Eentren   ·   brecha = R²entren − R²valid
EentrenError medido sobre los datos con que se ajustaron los θ. No mide calidad: mide cuánto memorizó dato del ajuste
EvalidError sobre datos que el modelo no vio al ajustar. Esto sí estima generalización el que importa
brechaCuánto empeora al salir del entrenamiento. Con errores (ECM, MAE: más bajo es mejor) se resta al revés que con puntajes (R², exactitud: más alto es mejor) el diagnóstico
nivelQué tan buenos son los dos números. Separa subajuste de ajuste razonable, que tienen ambos brecha chica

El procedimiento, en cinco pasos

  1. Localiza el par: rendimiento dentro y fuera del entrenamiento
  2. Calcula la brecha, fila por fila. Por escrito
  3. Clasifica: bueno dentro y malo fuera → sobreajuste · malo en ambos → subajuste · parecidos y aceptables → ajuste razonable
  4. Nombra el mecanismo, no la etiqueta: «memorizó el ruido de 13 pinos», no «sobreajuste»
  5. Propón el remedio según la causa: simplificar, más filas, elegir con validación (cruzada). Ver §8

[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7 «Diagnóstico de sobreajuste / subajuste»]. Ese paso 5 incluye además «regularizar»; en §8 verás por qué aquí no se trata como materia del profesor.

Ejercicio de cálculo · la tabla que ya intentaste

ModeloR² entrenamientoR² validaciónBrechaDiagnóstico
A0,620,59??
B0,980,54??
C0,410,39??

Cifras ilustrativas [DATITO], las mismas del ejercicio del 19-sep.

Primero calcula las tres brechas en papel. Después responde en el formato del profesor: «B aprende mucho mejor los datos, así que conviene descartar A.» Verdadero o falso; en caso de ser falso, justifique.

Respuesta correcta y cómo se resuelve

Respuesta: B está sobreajustado, C está subajustado y A es el ajuste razonable; la afirmación es falsa, porque fuera del entrenamiento A (0,59) le gana a B (0,54).

Cómo se resuelve: R² es un puntaje (más alto es mejor), así que brecha = entrenamiento − validación.

ModeloBrechaNivelDiagnóstico
A0,62 − 0,59 = 0,03aceptable en ambosAjuste razonable
B0,98 − 0,54 = 0,44excelente dentro, el peor fueraSobreajuste
C0,41 − 0,39 = 0,02malo en ambosSubajuste

Respuesta en formato del profesor: «Falso. B tiene el mejor R² de entrenamiento porque memorizó: su brecha es 0,44. Sobre datos que no vio obtiene 0,54, menos que el 0,59 de A. Aprender mejor los datos de entrenamiento no es ser mejor modelo; se elige por el rendimiento fuera del entrenamiento.»

Fíjate en A y C: casi la misma brecha. Lo que los separa es el nivel. Por eso la brecha va primero, pero no sola.

Error típico: el tuyo del 19-sep, asignar los diagnósticos sin hacer las tres restas (terminaste llamando sobreajuste a A y subajuste a B). El otro: quedarse con B por su 0,98.

De dónde sale: cifras ilustrativas [DATITO]; procedimiento [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7]; tu respuesta anterior [FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml · diagnostica_sin_calcular_la_brecha].

4 · «El error me da 0»: lo que se dijo en clase

Mientras el curso discutía para qué sirven validación y test, un compañero argumentó así:

«si tengo todos los puntos en el entrenamiento y tengo un polinomio de grado muy alto, el error me ⟨da⟩ 0. Y no tengo cómo compararlo, porque no tengo otros puntos aparte.» Clase del 31-jul · 0:48:00–0:48:11 · un compañero · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]
Predice: un modelo tiene error de entrenamiento exactamente 0. ¿Qué prueba ese 0?
Respuesta correcta y cómo se resuelve

Respuesta: un error de entrenamiento 0 no prueba nada por sí solo: ni que el modelo sea bueno ni que esté sobreajustado. Hay que medir el error en datos que no vio y calcular la brecha.

  1. Cuenta parámetros contra datos: con n puntos, un polinomio de grado n − 1 tiene n parámetros y pasa exacto por todos. El 0 está garantizado, sea cual sea la forma real
  2. Como está garantizado, el 0 no distingue un modelo que aprendió de uno que memorizó
  3. Lo que distingue es la validación: en el simulador, el grado 12 da 0 en entrenamiento y 84,47 en validación → sobreajuste. En el P4 un grado que también da 0 gana en validación (la paradoja de abajo)

Error típico: tomar el 0 como prueba de calidad (lo que castiga la P7) o, al revés, como prueba automática de sobreajuste. Es una señal de alarma que obliga a mirar la validación, no un veredicto.

De dónde sale: distinción P7 [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1]; simulador [DATITO]; cuenta de parámetros contra datos [INFERENCIA].

Distinción de certamen · P7: error de entrenamiento ≠ calidad del modelo. En la P7, 5 árboles y una curva que pasa exacta por los 5: el error cuadrático medio de entrenamiento es 0 y eso no demuestra nada. Ver la ficha P7.
La paradoja de la ayudantía: el grado que pasa perfecto… y gana
Aviso: contiene el resultado del P4; intenta antes 06_LABORATORIOS/2026_[P4]Regresión(vacio).ipynb. Esto es ayudantía, no clase del profesor: sirve para entender, no es materia de certamen por sí misma.
«el polinomio de grado 7 pasa perfectamente por todos los puntos […] pero qué me pasa que el de grado 10 hace locuras entre los puntos en cambio el de grado 7 sigue el comportamiento que yo esperaría» Ayudantía del 31-jul · 1:20:34–1:21:00 · la ayudantía · [FUENTE · Repo: 05_CLASES/transcripciones/06Ayudantia_Fundamentos_en_Ciencia_de_Datos_31_Julio.md]

En el P4 hay 8 puntos de entrenamiento (x = [1, 3, 6, 10, 20, 22, 26, 28]). Un polinomio de grado 7 tiene 8 parámetros: los interpola exacto, error de entrenamiento 0. Según la P7, eso «debería» ser sobreajuste. Y sin embargo, en validación el ECM queda: grado 4 → 1,660 · grado 7 → 0,601 · grado 10 → 477,9 · grado 13 → 25.882 [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.884–887; el score es el ECM con signo negativo].

Cómo se resuelve la paradoja:

  1. El 0 de entrenamiento no distingue al grado 7 del grado 10: los dos pasan por los puntos. La validación sí los distingue. Esa es exactamente la P7: el entrenamiento no es evidencia, ni a favor ni en contra
  2. «Gana» es relativo a la grilla: solo se probaron 4, 7, 10 y 13. Un grado 2 o 3 nunca fue candidato [INFERENCIA]
  3. Con 6 puntos de validación, el ganador puede tener algo de suerte: justo lo que resuelve la validación cruzada [INFERENCIA]

5 · Segundo nivel: también se puede sobreajustar la validación

Si eliges el grado mirando la validación, la validación deja de ser neutral. Tu profesor lo dice con el mismo polinomio:

«el problema que tenemos ahí es que se podría sobreajustar el conjunto de ⟨validación⟩. ¿Me entienden? Porque yo estoy tomando una decisión sobre el modelo, utilizando el conjunto de ⟨validación⟩.» Clase del 31-jul · 0:49:50–0:50:05 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]
Dos niveles, dos defensas:
· Los θ se sobreajustan al entrenamiento → lo detecta la validación.
· Las decisiones (el grado, el modelo) se sobreajustan a la validación → por eso existe el test, que se guarda «en el bolsillo» y se usa una sola vez al final.
Y para no depender de una sola partición afortunada: rotarla con validación cruzada. El esquema completo de tres conjuntos está en train_validation_test.html.

6 · Aplica e interpreta: tu proyecto de Melbourne

Modelos sobre log1p(Price), entrenados con 6.336 propiedades de 2016 y evaluados con 7.244 de 2017 [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json, vía 07_DATITO/02_REFERENCIA/material.md]. Aquí el «fuera» es el test 2017.

Modelo (log)R² train 2016R² test 2017Brecha
Árbol de decisión0,75230,61230,1400
Random Forest0,94230,71090,2314
Gradient Boosting0,88580,74660,1392
HistGradientBoosting0,92740,75710,1703

Ejercicio de interpretación. (a) ¿Cuál sobreajusta más? (b) ¿El modelo con mejor R² de entrenamiento es el mejor en 2017? (c) Traduce la brecha de Random Forest a una frase que entienda alguien que no sabe qué es R². (d) Gradient Boosting tiene casi la misma brecha que el árbol. ¿Significa que son igual de buenos?

Respuesta correcta y cómo se resuelve

Respuesta: Random Forest es el que más sobreajusta (brecha 0,2314) y, pese a tener el mejor R² de entrenamiento, no es el mejor en 2017: el mejor en test es HistGradientBoosting (0,7571).

(a) Se ordenan las brechas: 0,2314 (RF) > 0,1703 (HGB) > 0,1400 (árbol) > 0,1392 (GB). Random Forest explica el 94 % de la variación de 2016 y solo el 71 % de la de 2017.

(b) No. Ordenados por entrenamiento: RF 0,9423 > HGB 0,9274 > GB 0,8858 > árbol 0,7523. Ordenados por test: HGB 0,7571 > GB 0,7466 > RF 0,7109 > árbol 0,6123. RF baja del primer al tercer lugar. Gradient Boosting aprende menos que RF (0,8858) y generaliza mejor (0,7466): el patrón de B frente a A, con tus números.

(c) Respuesta modelo: «Casi un cuarto de lo que el modelo parecía saber sobre los precios de 2016 no se repitió en 2017: eran particularidades de ese año, no reglas del mercado.»

(d) No. Misma brecha (0,14), distinto nivel: 0,6123 frente a 0,7466 en test. Es la lección de A y C: la brecha va primero, pero no decide sola.

Error típico: elegir Random Forest por su 0,94, o declarar equivalentes al árbol y a Gradient Boosting porque sus brechas se parecen.

De dónde sale: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] vía [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]; la frase de (c) es [DATITO].

Lo que dijo el profesor de tu presentación

En la presentación del Hito 2 el profesor miró otra caída: la del error de validación cruzada en 2016 al error de test en 2017. Y la explicó así:

«ustedes validaron con un subconjunto de datos, pero también tomaron decisiones con ese subconjunto de datos. […] los datos cambian un poco entre el 2016 y el 2017. Entonces el modelo está un poquito sobreajustado a los datos del 2016» Sesión del 4-sep (presentaciones Hito 2) · 2:08:49–2:09:16 · profesor, comentando la presentación de tu grupo · [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md]
Léelo con cuidado. Aquí «sobreajustado» no es la brecha entrenamiento → validación de §3: validación cruzada 2016 y test 2017 son ambos datos no vistos. El profesor nombra dos mecanismos en la misma frase: (1) las decisiones se tomaron mirando 2016 (el segundo nivel de §5) y (2) los datos cambiaron entre años. Esa descomposición, con cifras, está en generalizacion.html.

Es la lección de tu error ya resuelto sobreajuste_como_etiqueta_de_toda_degradacion: si usas la palabra, di el mecanismo, como lo hizo él.
Trampa con tus propios números. Ridge sobre log da R² de test −17,0 [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]. ¿Sobreajuste monstruoso? El material lo explica por otra vía: al deshacer expm1 sobre valores extremos, las predicciones se disparan. Es una recta que extrapola, no un modelo que memorizó [INFERENCIA]. La brecha es necesaria, no suficiente: el paso 4 (nombrar el mecanismo) es el que evita el error.

7 · No es solo regresión: clasificación y árboles

En el bloque de clasificación aparece la lámina «Modelos más complejos» y, repetida tal cual desde el bloque de regresión, la de «¿Cómo evaluar si estoy sobreajustado? VALIDACIÓN CRUZADA!» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 8, 20 y 21]. El profesor muestra una frontera que se tuerce para no dejar ningún punto mal clasificado:

«tenemos dos triángulos que están en la zona de los círculos y un círculo que está en la zona de los triángulos […] yo iría a hacer algo como así […] pero hay un problema acá […] no generaliza no generaliza exacto» Clase del 7-ago · 0:44:32–0:45:09 · profesor (el primer «no generaliza» parece venir de un compañero [INFERENCIA]) · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Es el mismo fenómeno: una frontera que envuelve cada punto es el polinomio de grado 12 en dos dimensiones. Por eso la opción 5 de la P3 es verdadera: el sobreajuste «puede ocurrir tanto en problemas de clasificación como de regresión» (ficha P3).

Y en los árboles de decisión aparece como regla de parada. La lámina de convergencia lista: el nodo tiene una sola clase, tiene menos objetos que un mínimo, se alcanzó una altura máxima, la pureza es suficiente, o «Se comienza a sobreajustar (validación cruzada)» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 33]. En clase:

«el algoritmo para cuando el ⟨nodo⟩ contiene solamente una clase, […] cuando se alcanza una altura máxima, cuando la pureza es suficiente o cuando se comienza a sobreajustar.» Clase del 7-ago · 1:28:08–1:28:22 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA]

Un árbol que se deja crecer hasta que cada hoja tiene un solo objeto es el equivalente del grado 12: error de entrenamiento 0. Sigue en arboles_y_ensambles.html.

8 · Remedios: los que dio el curso

RemedioMecanismoDónde está en el curso
Bajar el grado / simplificarMenos parámetros → menos capacidad de memorizar ruido«La complejidad del modelo tiene relación con el número de parámetros» (§1); P7
Elegir la complejidad en validación (mejor: validación cruzada)No reduce el sobreajuste: lo detecta antes de decidir y permite elegir el grado con datos no vistosLámina 8: validación para «el orden del polinomio»; lámina 21; P3 opción 3
Más filas (más observaciones)Más evidencia por parámetro: el ruido deja de ser ajustable. Lo viste con el botón de §2P3: la opción 1 («aumentando el número de atributos») es la falsa, porque son columnas, no filas
Detener el árbolAltura máxima, mínimo de objetos por nodo, o parar cuando la validación empeoraLámina 33
Conocimiento del dominioDescarta curvas imposibles: un volumen no es negativo y crece con el diámetroArgumento de la P7 (ficha P7) [INFERENCIA]
Para el subajuste el remedio va al revés: más complejidad (subir el grado, un modelo más flexible). Más filas no lo cura: si el modelo no tiene capacidad para la forma, más datos solo confirman que no la alcanza. En §2: con 39 pinos el grado 1 sigue malo en ambos conjuntos [DATITO].
¿Y la regularización? En las 14 transcripciones disponibles al 2026-09-21, la palabra aparece una sola vez, y la dice un compañero en su presentación (el hiperparámetro C de una SVM) [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:51:47]. No aparece en ninguna clase del profesor, ni en el P4, ni en las láminas de 05_CLASES/11_PRESENTACIÓN/_markdown/.

La distinción «bajar el grado elimina términos; regularizar (Ridge, Lasso) los amortigua encogiendo sus coeficientes» viene de tu propia reconstrucción del certamen, no del profesor [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/01_ANALISIS_RECONSTRUCCION_CERTAMEN.md · l.456 y l.497]. Es una [INFERENCIA] útil si te la preguntan en un oral. En el papel, si la usas, que sea después de los remedios del curso y sin presentarla como materia de clase.

9 · Palabras que se cruzan: «sesgo y varianza»

La sección del P4 donde se comparan los grados 4, 7, 10 y 13 se titula «Sesgo y Varianza», pero su contenido es exactamente este concepto: «Mientras escogemos el grado del polinomio nos vamos a encontrar con los problemas de underfitting y overfitting» [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.738–740]. En la ayudantía del 7-ago se nombran «los conceptos de sesgo y varianza» sin desarrollarlos [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:08:17–0:08:26].

Qué hacer con eso: en el curso, «sesgo y varianza» funciona como nombre del problema subajuste/sobreajuste. En las 14 transcripciones disponibles al 2026-09-21 no se desarrolla una descomposición formal del error en sesgo y varianza: no la escribas en el certamen como si fuera materia.

Y ojo con un tercer sentido: en la ayudantía del 31-jul, «me puedo sesgar por el conjunto de validación» significa elegir un modelo que calza con esa partición por azar [FUENTE · Repo: 05_CLASES/transcripciones/06Ayudantia_Fundamentos_en_Ciencia_de_Datos_31_Julio.md · 1:25:47]. Eso es el segundo nivel de §5, no el sesgo de un modelo simple.

10 · Las tres distinciones que el certamen pone a prueba

P2 · Sobreajuste ≠ subajuste ≠ error alto. Sobreajuste exige las dos mitades: bien en entrenamiento y mal fuera. Error alto en ambos es subajuste. «Error alto» sin decir dónde no es diagnóstico. Ver la ficha P2.
P3 · Más filas ≠ más columnas. Más observaciones reducen el sobreajuste; más atributos (o más grado, que es lo mismo: más columnas x², x³…) lo aumentan. Ver la ficha P3.
P7 · Error de entrenamiento ≠ calidad del modelo. Un error de entrenamiento 0 con tantos parámetros como datos no prueba nada. Lo que juzga es la validación, y en la P7 también la física (volumen negativo). Ver la ficha P7.

11 · Ejercicios

Verdadero o falso, en caso de ser falso justifique

1 · «Si un modelo tiene error de entrenamiento igual a cero, está bien ajustado.»

Respuesta correcta y cómo se resuelve

Respuesta: Falso: un error de entrenamiento 0 no dice si el modelo generaliza.

Resolución: con tantos parámetros como datos, cualquier polinomio pasa por todos los puntos, tenga o no la forma correcta, así que el 0 está garantizado. Para saber si está bien ajustado hay que mirar el error en validación y la brecha. En el simulador, el grado 12 tiene 0 en entrenamiento y 84,47 en validación.

Error típico: leer «ajusta perfecto» como «es el mejor modelo». Es exactamente la trampa de la P7.

De dónde sale: [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P7]; simulador [DATITO].

2 · «Un modelo con error alto en entrenamiento y en validación está sobreajustado.»

Respuesta correcta y cómo se resuelve

Respuesta: Falso: eso es subajuste.

Resolución: el sobreajuste exige las dos mitades: error bajo en entrenamiento y alto fuera (brecha grande). Si el error es alto en ambos, la brecha es chica y el nivel es malo: el modelo es demasiado simple para describir incluso los datos con que aprendió. En el simulador es el grado 1: 5,62 y 7,14.

Error típico: usar «sobreajuste» como sinónimo de «error alto». El remedio sería el opuesto: al subajuste se le sube la complejidad.

De dónde sale: [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P2]; el balance simple/complejo es la cita del profesor en §1.

3 · «El sobreajuste se puede evitar aumentando el número de atributos de cada objeto.»

Respuesta correcta y cómo se resuelve

Respuesta: Falso: más atributos lo empeoran; lo que ayuda es tener más observaciones.

Resolución: cada atributo es una columna nueva y trae su propio θ (con k variables hay k + 1 parámetros). Más parámetros es más complejidad, y más complejidad es más sobreajuste. Más filas, en cambio, dan más evidencia por parámetro: en el simulador, pasar de 13 a 39 pinos baja la validación del grado 12 de 84,47 a 1,33.

Error típico: leer «atributos» como «más datos» y marcarla verdadera. Es la opción 1 de la P3, la única falsa.

De dónde sale: [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.42]; [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P3]; simulador [DATITO].

4 · «Como el conjunto de validación no se usa para ajustar los θ, es imposible sobreajustarlo.»

Respuesta correcta y cómo se resuelve

Respuesta: Falso: la validación también se puede sobreajustar, porque con ella se toman decisiones.

Resolución: es cierto que los θ se ajustan solo con el entrenamiento. Pero el grado del polinomio (o el modelo) se elige mirando la validación. Si por azar un grado calza con esa partición, la elección queda ajustada a ella. Por eso la métrica final se mide en el test, que no participó en ninguna decisión.

Error típico: pensar que «no ajustar θ» equivale a «no influir en el modelo». Elegir también es aprender de esos datos.

De dónde sale: la cita del profesor en §5 (clase del 31-jul); [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].

5 · «El sobreajuste puede ocurrir tanto en clasificación como en regresión.»

Respuesta correcta y cómo se resuelve

Respuesta: Verdadero.

Resolución: en regresión es el polinomio de grado alto que pasa por todos los puntos; en clasificación es la frontera que se tuerce para envolver cada punto de entrenamiento, o el árbol que crece hasta tener una hoja por objeto. En los tres casos: bien dentro, mal fuera. La lámina de «¿Cómo evaluar si estoy sobreajustado?» se repite en el bloque de clasificación.

Error típico: asociar el sobreajuste solo a la regresión polinomial porque ahí se introdujo.

De dónde sale: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 8, 21 y 33]; P3, opción 5 (ficha P3).

Transferencia · otro dominio [DATITO]

Una empresa de buses interurbanos predice el retraso de cada viaje, en minutos. Tres analistas entregan esto (cifras ilustrativas [DATITO]; la métrica es MAE, más bajo es mejor):

AnalistaModeloMAE entrenamientoMAE validación
1Árbol sin límite de altura0,0 min11,4 min
2Árbol con altura máxima 45,1 min5,8 min
3Siempre predice el retraso promedio9,7 min9,9 min

(a) Calcula la brecha de cada uno (ojo con el sentido de la resta) y diagnostica. (b) ¿Cuál llevas a producción y por qué? (c) El analista 1 propone agregar 30 columnas de clima por hora «para que el modelo tenga más información». ¿Qué esperas que pase? (d) Da dos remedios del curso para el analista 1, con su mecanismo.

Respuesta correcta y cómo se resuelve

Respuesta: el analista 1 sobreajusta, el 3 subajusta y el 2 tiene un ajuste razonable; a producción va el 2, porque tiene el menor error sobre viajes que no vio (5,8 min) con una brecha chica.

(a) MAE es un error (más bajo es mejor), así que brecha = validación − entrenamiento. 1: 11,4 − 0,0 = 11,4 min → sobreajuste (memorizó cada viaje). 2: 5,8 − 5,1 = 0,7 min y nivel bajo → ajuste razonable. 3: 9,9 − 9,7 = 0,2 min, pero malo en ambos → subajuste.

(b) Se compara la columna de validación: 5,8 < 9,9 < 11,4. Gana el 2, y su brecha de 0,7 min dice que ese 5,8 es estable. El 0,0 del analista 1 no sirve para decidir.

(c) Más columnas = más parámetros = más oportunidades de calzar con el ruido: la brecha tiende a crecer, no a bajar. Solo ayudarían si traen señal real, y eso lo diría la validación, no el entrenamiento (P3).

(d) Detener el árbol (altura máxima o mínimo de objetos por hoja: menos capacidad de memorizar), eligiendo esa altura en validación cruzada (lo detecta antes de decidir). Y más filas, o sea más viajes: más evidencia por parámetro.

Error típico: restar al revés con MAE (0,0 − 11,4 = −11,4) y concluir «brecha negativa, no hay sobreajuste»; o elegir al analista 1 por su 0,0.

De dónde sale: caso y cifras ilustrativas [DATITO]; reglas de parada del árbol [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 33]; filas frente a columnas [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P3].

Producción: explícaselo a alguien.

Un compañero te dice: «mi polinomio de grado 12 tiene error cero en entrenamiento, así que es el mejor modelo que probé».

En cinco líneas o menos: dile por qué ese cero no prueba lo que cree, qué número tendría que mirar, cómo elegiría el grado, y qué haría si el mejor grado sigue sobreajustando. Escríbelo sin mirar esta página y llévalo a Datito para que lo revise.
Respuesta correcta y cómo se resuelve

Respuesta: el compañero está equivocado: el cero de entrenamiento no prueba que su modelo sea el mejor, y tiene que decidir por el error de validación.

Respuesta modelo (cinco líneas):

«Ese cero no prueba nada: con 13 datos, un polinomio de grado 12 tiene 13 parámetros y pasa exacto por todos los puntos, incluido el ruido, sea cual sea la forma real. Lo que hay que mirar es el error en datos que el modelo no vio y la brecha con el de entrenamiento: aquí es 0 contra 84,5, o sea sobreajuste. El grado es un hiperparámetro: me quedo con el que minimiza el error de validación, idealmente con validación cruzada, y el test lo uso una sola vez al final. Si el mejor grado igual sobreajusta, bajo la complejidad o consigo más filas; agregar columnas lo empeoraría.»

Criterios con que se corrige:

Error típico: responder «está sobreajustado» sin decir por qué ni con qué número, o proponer regularización como si fuera materia del profesor.

De dónde sale: cifras del simulador [DATITO]; validación para el orden del polinomio [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8]; procedimiento [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7].

12 · Procedimiento para el papel

1. MÉTRICA              ¿error (más bajo mejor) o puntaje (más alto mejor)?
2. EL PAR               dentro (entrenamiento) y fuera (validación / test)
3. BRECHA               calcularla por escrito, fila por fila
4. CLASIFICAR           brecha grande                  → sobreajuste
                        brecha chica + malo en ambos   → subajuste
                        brecha chica + aceptable       → ajuste razonable
5. MECANISMO            «memorizó el ruido de n datos con p+1 parámetros»
6. REMEDIO SEGÚN CAUSA  sobre: bajar grado · más filas · elegir en validación
                               cruzada · detener el árbol · dominio
                        sub:   más complejidad (más filas no lo cura)
7. ¿PRODUCCIÓN?         se decide por el error fuera, nunca por el de dentro

13 · Errores que el formato castiga

ErrorPor qué está mal
Llamar sobreajuste a toda degradación sin calcular la brechaSin la resta no hay diagnóstico. Y una caída entre dos conjuntos no vistos (CV → test) tiene otros mecanismos: selección y cambio de distribución
Diagnosticar con un solo número0,98 puede ser memoria; 0,41 puede ser un problema difícil. Hace falta el par
Restar de memoria sin mirar la métricaCon MAE o ECM la brecha es validación − entrenamiento; con R², al revés
Tratar el error de entrenamiento como evidencia de calidadEs la P7: el 0 de entrenamiento no distingue al grado 7 del grado 10
Confundir más filas con más columnasEs la P3: efectos opuestos
Llamar sobreajuste a un modelo malo en ambos conjuntosEs la P2: eso es subajuste
Presentar regularización o «sesgo-varianza» como materia del profesorNo aparecen desarrolladas en sus clases (§8 y §9). Si las usas, etiquétalas
A dónde seguir.

Cierre de la Clase 10 · Overfitting y underfitting

Qué aprendiste

  • Brecha grande entre entrenamiento y prueba: sobreajuste. Malo en ambos: subajuste.
  • La complejidad (número de parámetros) mueve el balance entre ambos.
  • Un error de entrenamiento igual a cero no prueba calidad.
  • También se puede sobreajustar la validación: por eso existe el test.

Qué no debes confundir

  • Sobreajuste ≠ subajuste ≠ error alto (C2 P2).
  • Más filas (reduce el sobreajuste) ≠ más columnas (lo aumenta) (C2 P3).
  • Error de entrenamiento ≠ calidad del modelo (C2 P7).

Procedimiento para el papel

  1. Localiza el par de números: dentro y fuera del entrenamiento.
  2. Calcula la brecha.
  3. Clasifica: brecha grande → sobreajuste; malo en ambos → subajuste.
  4. Nombra el mecanismo, no solo la etiqueta.
  5. Remedio según la causa: simplificar, más filas, elegir con validación cruzada.

Viene de: Clase 9 · Generalización, extrapolación y datos no vistos · Sigue: Clase 11 · Clasificación: cuando la etiqueta no es un número

Vuelve a tu activación: El modelo B tiene R² 0,98 en entrenamiento y 0,54 en prueba. ¿Es el mejor de la tabla? ¿Cambiarías tu respuesta?

Pregunta final. Con MAE (menos es mejor): P 0,15 / 0,92 y Q 0,71 / 0,78. ¿Cuál sobreajusta?
Respuesta correcta y cómo se resuelve

P: error muy bajo en entrenamiento y alto en prueba, con brecha 0,77. [FUENTE · Repo: 07_DATITO/dudas.yaml · 2026-09-19-mae-pqr]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 11 · Clasificación: cuando la etiqueta no es un número

Dudas resueltas con Datito, en orden

Lo que se trabajó en las sesiones sobre este tema, para volver a leerlo y re-intentarlo. Primero responde tú; después abre la respuesta. Fuente: 07_DATITO/dudas.yaml.

19-sep · resuelta en la sesión · Overfitting y underfitting

Pregunta. Tres modelos con R² de entrenamiento / prueba: A 0,62 / 0,59 · B 0,98 / 0,54 · C 0,41 / 0,39. a) ¿Cuál sobreajusta, cuál subajusta y cuál está bien? b) Un compañero dice que B es el mejor porque aprendió mejor los datos. ¿Tiene razón? c) ¿Qué harías para mejorar B?

Lo que respondiste en la sesión: a) Primer intento: «A sobreajusta, B subajusta, C está bien». Segundo intento, tras calcular las brechas: B sobreajusta, C subajusta «porque ambos valores son bajos», A está bien. b) «Mi compañero no tiene razón, B memoriza pero generaliza peor que el modelo A». c) Regularizar y podar el árbol.

Respuesta correcta y cómo se resuelve

Respuesta. B sobreajusta (brecha 0,44), C subajusta (bajo en ambos, brecha 0,02), A está bien (bueno en ambos, brecha 0,03); el compañero se equivoca porque lo que importa es la prueba (A 0,59 > B 0,54).

  1. Paso 1, la brecha de cada uno: A 0,62−0,59 = 0,03 · B 0,98−0,54 = 0,44 · C 0,41−0,39 = 0,02.
  2. Paso 2, la brecha grande aísla el sobreajuste: B.
  3. Paso 3, entre los de brecha chica, el nivel separa: C es bajo en ambos → subajuste; A es aceptable en ambos → ajuste razonable.
  4. b) No: B memoriza el entrenamiento, pero en datos nuevos rinde menos que A. Ancla la respuesta con la cifra: 0,54 < 0,59.
  5. c) Remedios del curso: simplificar (menos grado, podar o limitar el árbol), más filas, y elegir la complejidad con validación cruzada. «Podar» supone que B es un árbol, y el enunciado no lo dice: declara el supuesto (P11). «Regularizar» no aparece en las clases del profesor ni en el P4: úsalo solo como [INFERENCIA].

Error típico. Clasificar mirando un solo número por modelo en vez de calcular la brecha primero; y dar remedios que suponen un tipo de modelo no declarado.

[FUENTE · Repo: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md] problema y respuestas
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §7] procedimiento de diagnóstico
[FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml] error diagnostica_sin_calcular_la_brecha
Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md

19-sep · resuelta en la sesión · Overfitting y underfitting

Pregunta. Tres modelos de tiempo de entrega, métrica MAE (menos es mejor), entrenamiento / prueba: P 0,15 / 0,92 · Q 0,71 / 0,78 · R 1,84 / 1,90. a) ¿Cuál sobreajusta, cuál subajusta y cuál está bien?

Lo que respondiste en la sesión: a) «P sobreajusta, Q está bien, R subajusta», sin ayuda.

Respuesta correcta y cómo se resuelve

Respuesta. P sobreajusta (error muy bajo en entrenamiento y alto en prueba), R subajusta (error alto en ambos), Q está bien.

  1. Antes de restar, lee qué significa el número: con MAE, MENOS es mejor (al revés que R²).
  2. Brechas: P 0,92−0,15 = 0,77 · Q 0,78−0,71 = 0,07 · R 1,90−1,84 = 0,06.
  3. P tiene la brecha grande: sobreajuste. Entre Q y R, R tiene error alto en ambos: subajuste. Q: bajo y parecido en ambos.

Error típico. Aplicar de memoria la regla de R² («más alto es mejor») a una métrica de error e invertir el diagnóstico.

[FUENTE · Repo: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md] problema y respuesta
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §7] procedimiento de diagnóstico
Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md