Evidencia de aprendizaje: Clasifica tres modelos con la brecha, nombra el mecanismo y propone un remedio coherente.
Actividad final: La tabla A/B/C en el formato del profesor, y la versión con MAE.
Criterio de dominio: Calcula la brecha antes de etiquetar y lee bien una métrica de error, donde menos es mejor.
Activación. El modelo B tiene R² 0,98 en entrenamiento y 0,54 en prueba. ¿Es el mejor de la tabla? Escribe tu respuesta antes de seguir: la retomas en el cierre.
Sobreajuste y subajuste
Overfitting y underfitting: cuándo un modelo memorizó y cuándo no alcanzó a aprender.
Fundamentos de Ciencia de Datos · UdeC · Clase del 31-jul (regresión) y Clase del 7-ago (clasificación)
Generalización +
Validación cruzada →
Overfitting y underfitting →
Árboles de decisión →
…y 7 conceptos más por cadena
Dónde estás, y por qué este va primero.
Viene de generalización y de
validación cruzada, y habilita los árboles de
decisión (y por cadena random forest, boosting, ensambles, redes, LLM y agentes).
Es el concepto con más peso del Certamen 2: la P2 (V/F de
sobreajuste), la P3 (afirmaciones sobre sobreajuste) y la P7 (regresión polinomial)
suman 2,0 de los 7 puntos
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §5].
Y tienes un error abierto que conviene nombrar desde ya: ante la tabla
A 0,62/0,59 · B 0,98/0,54 · C 0,41/0,39 asignaste los diagnósticos a las
filas equivocadas sin calcular las brechas
[FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml · diagnostica_sin_calcular_la_brecha].
No es un problema de concepto: es un paso del procedimiento que te saltaste. Aquí se
entrena ese paso.
1 · La situación: el árbol que no quieres cortar
El ejemplo es de tu profesor. Quiere saber cuánto pesa un árbol sin
cortarlo, midiendo solo el radio del tronco. Tiene árboles ya cortados, ajusta
una recta… y luego se pregunta por qué no una parábola, y por qué no una cúbica. Cada
vez el error sobre esos datos baja. Y ahí dice:
«por qué entonces no un modelo cúbico. […] estamos complejizando el
modelo. La complejidad del modelo tiene relación con el número de parámetros que
tiene el modelo. Un modelo con menos parámetros es más simple.»
Clase del 31-jul · 0:37:06–0:37:35 · profesor ·
[FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]
En la lámina que acompaña ese tramo se ven los mismos datos con tres polinomios:
grado 1, una recta que deja muchos puntos lejos; grado 2,
una parábola que sigue la forma; grado 10, una curva con oscilaciones
violentas que pasa muy cerca de casi todos los puntos
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · lámina 11, §6.5.4 (describe la slide 22 oficial)].
Luego pregunta cuál es mejor, y resuelve:
«a medida que se complejiza el modelo tiende a sobreajustarse más. […] el
modelo muy simple no va a ser capaz de predecir bien, […] hay un balance entre tener
un modelo muy complejo y un modelo muy simple.»
Clase del 31-jul · 0:43:01–0:43:28 · profesor ·
[FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md]
La pregunta que este concepto responde:¿este modelo aprendió la
tendencia, o memorizó estos datos en particular?
Sobreajuste = el modelo le va muy bien con los datos con que aprendió
y mal con datos que no vio: memorizó, incluido el ruido. Subajuste = el modelo es tan simple que le va mal en los dos:
no alcanza ni a describir los datos que ya tenía.
Entre ambos hay un balance, y la complejidad se mide en número de
parámetros.
2 · Pruébalo: la curva de complejidad
Abajo hay pinos inventados: la altura de cada uno según su edad. Son cifras
ilustrativas [DATITO], generadas con semilla fija para que siempre salgan
iguales. 13 pinos sirven para entrenar (ajustar los θ) y otros 12,
que el modelo nunca ve al ajustar, sirven para validar. El
deslizador cambia el grado del polinomio: más grado, más parámetros, más
complejidad.
Antes de mover el deslizador, predice: al subir el grado de 1 a 12,
¿qué le pasa al error de entrenamiento? ¿y al de validación?
Respuesta correcta y cómo se resuelve
Respuesta: el error de entrenamiento baja (o se queda igual) en cada
grado hasta llegar a 0 en el grado 12; el de validación baja hasta un mínimo (grado 4 en
estos datos) y después sube, primero de a poco y al final se dispara.
Cómo se resuelve:
Un polinomio de grado p puede imitar al de grado p − 1 poniendo su θ nuevo en cero.
Mínimos cuadrados nunca elige algo peor que eso, así que el error de
entrenamiento no puede subir al agregar grado [INFERENCIA]
Con 13 pinos, el grado 12 tiene 13 parámetros: pasa exacto por los 13 → ECM de
entrenamiento 0
La validación mide pinos que el modelo no vio. Al principio más grado captura la
forma (baja); pasado el mínimo, captura el ruido de esos 13 pinos (sube)
Lo lees en la tabla del simulador: grado 1 → 5,62 / 7,14 · grado 4 → 1,90 /
1,64 · grado 12 → 0,00 / 84,47 (entrenamiento / validación, m²)
Error típico: creer que los dos bajan siempre y elegir el grado
mirando el entrenamiento. Con ese criterio siempre ganaría el grado más alto, que es
justo el que peor generaliza.
De dónde sale: simulador con cifras
ilustrativas [DATITO]; el balance entre modelo complejo y simple es la cita del
profesor en §1; elegir el orden del polinomio en validación
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].
–
Parámetros (p + 1)
–
ECM entrenamiento [m²]
–
ECM validación [m²]
–
Brecha (val − entr.)
–
Lectura
Curva de complejidad: los dos errores para los 12 grados
La «lectura» es una regla didáctica de este visual [DATITO]: subajuste si los dos
errores superan el doble del mejor error de validación; sobreajuste si la brecha
supera ese mejor error. En el certamen no hay umbral fijo: se argumenta con la
brecha y el nivel.
Ver la tabla completa de errores
Lo que acabas de ver, en tres líneas.
1 · El error de entrenamiento nunca sube al agregar grado: cada
polinomio contiene al anterior, así que siempre puede ajustar igual o mejor
[INFERENCIA]. Con 13 pinos, el grado 12 tiene 13 parámetros y pasa exacto por todos:
error 0.
2 · El de validación dibuja una U: baja mientras el modelo aprende la
forma, y sube cuando empieza a perseguir el ruido.
3 · Por eso el grado no se elige mirando el entrenamiento: se elige
en validación. La lámina lo dice con este mismo ejemplo: el conjunto de validación
«se utiliza para ajustar hiperparámetros (por ej, el orden del polinomio)»
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].
Aprieta «Más filas» con el grado en 12. Con 39 pinos el mismo grado
12 ya no puede pasar por todos: tiene 13 parámetros para 39 datos, y la brecha casi
desaparece. Esa es la P3. Y fíjate en lo que es subir el grado:
PolynomialFeatures del P4 fabrica x², x³, … como
columnas nuevas, y cada columna trae su θ («Si tenemos k variables
explícitas, necesitamos k + 1 parámetros»)
[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.42 y l.830].
Subir el grado es agregar columnas. Más filas bajan el sobreajuste; más
columnas lo suben.
2.5 · Visualización: los tres escenarios
Las tres situaciones en gráficos:
Curva train vs test loss: error de entrenamiento baja siempre; validación baja y sube
Underfitting: modelo simple (recta) no captura la tendencia real (puntos + línea pobre)
Overfitting: modelo complejo oscila para pasar por todos los puntos, incluyendo ruido
3 · El criterio es la brecha, no un número
Un número solo no diagnostica nada. 0,98 de R² en entrenamiento
puede ser memoria; 0,41 puede ser un problema difícil. Lo que
diagnostica es la distancia entre dentro y fuera, y después el
nivel.
Error medido sobre los datos con que se ajustaron los θ. No mide calidad: mide cuánto memorizó dato del ajuste
Evalid
Error sobre datos que el modelo no vio al ajustar. Esto sí estima generalizaciónel que importa
brecha
Cuánto empeora al salir del entrenamiento. Con errores (ECM, MAE: más bajo es mejor) se resta al revés que con puntajes (R², exactitud: más alto es mejor) el diagnóstico
nivel
Qué tan buenos son los dos números. Separa subajuste de ajuste razonable, que tienen ambos brecha chica
El procedimiento, en cinco pasos
Localiza el par: rendimiento dentro y fuera del entrenamiento
Calcula la brecha, fila por fila. Por escrito
Clasifica: bueno dentro y malo fuera → sobreajuste · malo en ambos → subajuste · parecidos y aceptables → ajuste razonable
Nombra el mecanismo, no la etiqueta: «memorizó el ruido de 13 pinos», no «sobreajuste»
Propón el remedio según la causa: simplificar, más filas, elegir con validación (cruzada). Ver §8
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7 «Diagnóstico de sobreajuste / subajuste»].
Ese paso 5 incluye además «regularizar»; en §8 verás por qué aquí no se trata como materia del profesor.
Ejercicio de cálculo · la tabla que ya intentaste
Modelo
R² entrenamiento
R² validación
Brecha
Diagnóstico
A
0,62
0,59
?
?
B
0,98
0,54
?
?
C
0,41
0,39
?
?
Cifras ilustrativas [DATITO], las mismas del ejercicio del 19-sep.
Primero calcula las tres brechas en papel. Después responde en el
formato del profesor: «B aprende mucho mejor los datos, así que conviene descartar
A.» Verdadero o falso; en caso de ser falso, justifique.
Respuesta correcta y cómo se resuelve
Respuesta: B está sobreajustado, C está subajustado y A es el
ajuste razonable; la afirmación es falsa, porque fuera del
entrenamiento A (0,59) le gana a B (0,54).
Cómo se resuelve: R² es un puntaje (más alto es mejor), así que
brecha = entrenamiento − validación.
Modelo
Brecha
Nivel
Diagnóstico
A
0,62 − 0,59 = 0,03
aceptable en ambos
Ajuste razonable
B
0,98 − 0,54 = 0,44
excelente dentro, el peor fuera
Sobreajuste
C
0,41 − 0,39 = 0,02
malo en ambos
Subajuste
Respuesta en formato del profesor: «Falso. B tiene el mejor R² de
entrenamiento porque memorizó: su brecha es 0,44. Sobre datos que no vio obtiene 0,54,
menos que el 0,59 de A. Aprender mejor los datos de entrenamiento no es ser mejor
modelo; se elige por el rendimiento fuera del entrenamiento.»
Fíjate en A y C: casi la misma brecha. Lo que los separa es el
nivel. Por eso la brecha va primero, pero no sola.
Error típico: el tuyo del 19-sep, asignar los diagnósticos sin
hacer las tres restas (terminaste llamando sobreajuste a A y subajuste a B). El otro:
quedarse con B por su 0,98.
Mientras el curso discutía para qué sirven validación y test, un compañero
argumentó así:
«si tengo todos los puntos en el entrenamiento y tengo un polinomio de
grado muy alto, el error me ⟨da⟩ 0. Y no tengo cómo compararlo, porque no tengo otros
puntos aparte.»
Clase del 31-jul · 0:48:00–0:48:11 · un compañero ·
[FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] ·
⟨⟩ = corrección de transcripción [INFERENCIA]
Predice: un modelo tiene error de entrenamiento exactamente 0. ¿Qué
prueba ese 0?
Respuesta correcta y cómo se resuelve
Respuesta: un error de entrenamiento 0 no prueba nada por sí solo:
ni que el modelo sea bueno ni que esté sobreajustado. Hay que medir el error en datos
que no vio y calcular la brecha.
Cuenta parámetros contra datos: con n puntos, un polinomio de grado n − 1 tiene n
parámetros y pasa exacto por todos. El 0 está garantizado, sea cual sea la forma
real
Como está garantizado, el 0 no distingue un modelo que aprendió
de uno que memorizó
Lo que distingue es la validación: en el simulador, el grado 12 da 0 en
entrenamiento y 84,47 en validación → sobreajuste. En el P4 un grado que también da 0
gana en validación (la paradoja de abajo)
Error típico: tomar el 0 como prueba de calidad (lo que castiga la
P7) o, al revés, como prueba automática de sobreajuste. Es una señal de alarma que
obliga a mirar la validación, no un veredicto.
De dónde sale: distinción P7
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1]; simulador [DATITO]; cuenta de
parámetros contra datos [INFERENCIA].
Distinción de certamen · P7: error de entrenamiento
≠ calidad del modelo. En la P7, 5 árboles y una curva que pasa exacta
por los 5: el error cuadrático medio de entrenamiento es 0 y eso no demuestra nada.
Ver la ficha P7.
La paradoja de la ayudantía: el grado que pasa perfecto… y gana
Aviso: contiene el resultado del P4; intenta
antes 06_LABORATORIOS/2026_[P4]Regresión(vacio).ipynb. Esto es
ayudantía, no clase del profesor: sirve para entender, no es materia
de certamen por sí misma.
«el polinomio de grado 7 pasa perfectamente por todos los puntos […]
pero qué me pasa que el de grado 10 hace locuras entre los puntos en cambio el de
grado 7 sigue el comportamiento que yo esperaría»
Ayudantía del 31-jul · 1:20:34–1:21:00 · la ayudantía ·
[FUENTE · Repo: 05_CLASES/transcripciones/06Ayudantia_Fundamentos_en_Ciencia_de_Datos_31_Julio.md]
En el P4 hay 8 puntos de entrenamiento
(x = [1, 3, 6, 10, 20, 22, 26, 28]). Un polinomio de grado 7 tiene 8
parámetros: los interpola exacto, error de entrenamiento 0. Según la P7, eso
«debería» ser sobreajuste. Y sin embargo, en validación el ECM queda:
grado 4 → 1,660 · grado 7 → 0,601 · grado 10 → 477,9 ·
grado 13 → 25.882
[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.884–887; el
score es el ECM con signo negativo].
Cómo se resuelve la paradoja:
El 0 de entrenamiento no distingue al grado 7 del grado 10:
los dos pasan por los puntos. La validación sí los distingue. Esa es exactamente la
P7: el entrenamiento no es evidencia, ni a favor ni en contra
«Gana» es relativo a la grilla: solo se probaron 4, 7, 10 y 13. Un grado 2 o 3
nunca fue candidato [INFERENCIA]
Con 6 puntos de validación, el ganador puede tener algo de suerte: justo lo
que resuelve la validación cruzada [INFERENCIA]
5 · Segundo nivel: también se puede sobreajustar la validación
Si eliges el grado mirando la validación, la validación deja de ser neutral. Tu
profesor lo dice con el mismo polinomio:
«el problema que tenemos ahí es que se podría sobreajustar el conjunto
de ⟨validación⟩. ¿Me entienden? Porque yo estoy tomando una decisión sobre el modelo,
utilizando el conjunto de ⟨validación⟩.»
Clase del 31-jul · 0:49:50–0:50:05 · profesor ·
[FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md] ·
⟨⟩ = corrección de transcripción [INFERENCIA]
Dos niveles, dos defensas:
· Los θ se sobreajustan al entrenamiento → lo detecta la validación.
· Las decisiones (el grado, el modelo) se sobreajustan a la
validación → por eso existe el test, que se guarda
«en el bolsillo» y se usa una sola vez al final.
Y para no depender de una sola partición afortunada: rotarla con
validación cruzada. El esquema completo de tres
conjuntos está en train_validation_test.html.
6 · Aplica e interpreta: tu proyecto de Melbourne
Modelos sobre log1p(Price), entrenados con 6.336 propiedades de 2016 y
evaluados con 7.244 de 2017
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json, vía 07_DATITO/02_REFERENCIA/material.md].
Aquí el «fuera» es el test 2017.
Modelo (log)
R² train 2016
R² test 2017
Brecha
Árbol de decisión
0,7523
0,6123
0,1400
Random Forest
0,9423
0,7109
0,2314
Gradient Boosting
0,8858
0,7466
0,1392
HistGradientBoosting
0,9274
0,7571
0,1703
Ejercicio de interpretación. (a) ¿Cuál sobreajusta más? (b) ¿El
modelo con mejor R² de entrenamiento es el mejor en 2017? (c) Traduce la brecha de
Random Forest a una frase que entienda alguien que no sabe qué es R². (d) Gradient
Boosting tiene casi la misma brecha que el árbol. ¿Significa que son igual de buenos?
Respuesta correcta y cómo se resuelve
Respuesta: Random Forest es el que más sobreajusta (brecha
0,2314) y, pese a tener el mejor R² de entrenamiento, no es el mejor en 2017: el
mejor en test es HistGradientBoosting (0,7571).
(a) Se ordenan las brechas: 0,2314 (RF) > 0,1703 (HGB) > 0,1400 (árbol)
> 0,1392 (GB). Random Forest explica el 94 % de la variación de
2016 y solo el 71 % de la de 2017.
(b) No. Ordenados por entrenamiento: RF 0,9423 > HGB 0,9274
> GB 0,8858 > árbol 0,7523. Ordenados por test: HGB 0,7571 > GB 0,7466 >
RF 0,7109 > árbol 0,6123. RF baja del primer al tercer lugar. Gradient Boosting
aprende menos que RF (0,8858) y generaliza mejor (0,7466): el patrón
de B frente a A, con tus números.
(c) Respuesta modelo: «Casi un cuarto de lo que el modelo parecía saber sobre los
precios de 2016 no se repitió en 2017: eran particularidades de ese año, no reglas del
mercado.»
(d) No. Misma brecha (0,14), distinto nivel:
0,6123 frente a 0,7466 en test. Es la lección de A y C: la brecha va primero, pero no
decide sola.
Error típico: elegir Random Forest por su 0,94, o declarar
equivalentes al árbol y a Gradient Boosting porque sus brechas se parecen.
De dónde sale:
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] vía
[FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]; la frase de (c) es [DATITO].
Lo que dijo el profesor de tu presentación
En la presentación del Hito 2 el profesor miró otra caída: la del error de
validación cruzada en 2016 al error de test en 2017. Y la explicó así:
«ustedes validaron con un subconjunto de datos, pero también tomaron
decisiones con ese subconjunto de datos. […] los datos cambian un poco entre el 2016 y
el 2017. Entonces el modelo está un poquito sobreajustado a los datos del 2016»
Sesión del 4-sep (presentaciones Hito 2) · 2:08:49–2:09:16 · profesor, comentando la presentación de tu grupo ·
[FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md]
Léelo con cuidado. Aquí «sobreajustado» no es la brecha
entrenamiento → validación de §3: validación cruzada 2016 y test 2017 son
ambos datos no vistos. El profesor nombra dos mecanismos en la misma frase:
(1) las decisiones se tomaron mirando 2016 (el segundo nivel de §5) y
(2) los datos cambiaron entre años. Esa descomposición, con cifras,
está en generalizacion.html.
Es la lección de tu error ya resuelto sobreajuste_como_etiqueta_de_toda_degradacion:
si usas la palabra, di el mecanismo, como lo hizo él.
Trampa con tus propios números. Ridge sobre log da R² de test
−17,0 [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]. ¿Sobreajuste
monstruoso? El material lo explica por otra vía: al deshacer expm1 sobre
valores extremos, las predicciones se disparan. Es una recta que extrapola, no un
modelo que memorizó [INFERENCIA]. La brecha es necesaria, no
suficiente: el paso 4 (nombrar el mecanismo) es el que evita el error.
7 · No es solo regresión: clasificación y árboles
En el bloque de clasificación aparece la lámina «Modelos más complejos» y, repetida
tal cual desde el bloque de regresión, la de «¿Cómo evaluar si estoy sobreajustado?
VALIDACIÓN CRUZADA!»
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 8, 20 y 21].
El profesor muestra una frontera que se tuerce para no dejar ningún punto mal
clasificado:
«tenemos dos triángulos que están en la zona de los círculos y un
círculo que está en la zona de los triángulos […] yo iría a hacer algo como así […]
pero hay un problema acá […] no generaliza no generaliza exacto»
Clase del 7-ago · 0:44:32–0:45:09 · profesor (el primer «no generaliza» parece venir de un compañero [INFERENCIA]) ·
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]
Es el mismo fenómeno: una frontera que envuelve cada punto es el polinomio de
grado 12 en dos dimensiones. Por eso la opción 5 de la P3 es verdadera: el sobreajuste
«puede ocurrir tanto en problemas de clasificación como de regresión»
(ficha P3).
Y en los árboles de decisión aparece como regla de parada. La
lámina de convergencia lista: el nodo tiene una sola clase, tiene menos objetos que un
mínimo, se alcanzó una altura máxima, la pureza es suficiente, o
«Se comienza a sobreajustar (validación cruzada)»
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 33]. En
clase:
«el algoritmo para cuando el ⟨nodo⟩ contiene solamente una clase, […]
cuando se alcanza una altura máxima, cuando la pureza es suficiente o cuando se comienza
a sobreajustar.»
Clase del 7-ago · 1:28:08–1:28:22 · profesor ·
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md] ·
⟨⟩ = corrección de transcripción [INFERENCIA]
Un árbol que se deja crecer hasta que cada hoja tiene un solo objeto es el
equivalente del grado 12: error de entrenamiento 0. Sigue en
arboles_y_ensambles.html.
8 · Remedios: los que dio el curso
Remedio
Mecanismo
Dónde está en el curso
Bajar el grado / simplificar
Menos parámetros → menos capacidad de memorizar ruido
«La complejidad del modelo tiene relación con el número de parámetros» (§1); P7
Elegir la complejidad en validación (mejor: validación cruzada)
No reduce el sobreajuste: lo detecta antes de decidir y permite elegir el grado con datos no vistos
Lámina 8: validación para «el orden del polinomio»; lámina 21; P3 opción 3
Más filas (más observaciones)
Más evidencia por parámetro: el ruido deja de ser ajustable. Lo viste con el botón de §2
P3: la opción 1 («aumentando el número de atributos») es la falsa, porque son columnas, no filas
Detener el árbol
Altura máxima, mínimo de objetos por nodo, o parar cuando la validación empeora
Lámina 33
Conocimiento del dominio
Descarta curvas imposibles: un volumen no es negativo y crece con el diámetro
Para el subajuste el remedio va al revés: más complejidad (subir el
grado, un modelo más flexible). Más filas no lo cura: si el modelo no tiene
capacidad para la forma, más datos solo confirman que no la alcanza. En §2: con 39
pinos el grado 1 sigue malo en ambos conjuntos [DATITO].
¿Y la regularización? En las 14 transcripciones disponibles al
2026-09-21, la palabra aparece una sola vez, y la dice un compañero en
su presentación (el hiperparámetro C de una SVM)
[FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:51:47].
No aparece en ninguna clase del profesor, ni en el P4, ni en las láminas de
05_CLASES/11_PRESENTACIÓN/_markdown/.
La distinción «bajar el grado elimina términos; regularizar (Ridge, Lasso) los
amortigua encogiendo sus coeficientes» viene de tu propia reconstrucción del
certamen, no del profesor
[FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/01_ANALISIS_RECONSTRUCCION_CERTAMEN.md · l.456 y l.497].
Es una [INFERENCIA] útil si te la preguntan en un oral. En el papel,
si la usas, que sea después de los remedios del curso y sin presentarla como
materia de clase.
9 · Palabras que se cruzan: «sesgo y varianza»
La sección del P4 donde se comparan los grados 4, 7, 10 y 13 se titula
«Sesgo y Varianza», pero su contenido es exactamente este concepto:
«Mientras escogemos el grado del polinomio nos vamos a encontrar con los problemas de
underfitting y overfitting»
[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l.738–740]. En la
ayudantía del 7-ago se nombran «los conceptos de sesgo y varianza» sin desarrollarlos
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:08:17–0:08:26].
Qué hacer con eso: en el curso, «sesgo y varianza» funciona como
nombre del problema subajuste/sobreajuste. En las 14 transcripciones
disponibles al 2026-09-21 no se desarrolla una descomposición formal del error en sesgo
y varianza: no la escribas en el certamen como si fuera materia.
Y ojo con un tercer sentido: en la ayudantía del 31-jul, «me puedo sesgar por el
conjunto de validación» significa elegir un modelo que calza con esa partición por azar
[FUENTE · Repo: 05_CLASES/transcripciones/06Ayudantia_Fundamentos_en_Ciencia_de_Datos_31_Julio.md · 1:25:47].
Eso es el segundo nivel de §5, no el sesgo de un modelo simple.
10 · Las tres distinciones que el certamen pone a prueba
P2 · Sobreajuste ≠ subajuste ≠ error alto.
Sobreajuste exige las dos mitades: bien en entrenamiento y mal fuera.
Error alto en ambos es subajuste. «Error alto» sin decir dónde no es diagnóstico.
Ver la ficha P2.
P3 · Más filas ≠ más columnas.
Más observaciones reducen el sobreajuste; más atributos (o más grado, que es lo mismo:
más columnas x², x³…) lo aumentan.
Ver la ficha P3.
P7 · Error de entrenamiento ≠ calidad del modelo.
Un error de entrenamiento 0 con tantos parámetros como datos no prueba nada. Lo que
juzga es la validación, y en la P7 también la física (volumen negativo).
Ver la ficha P7.
11 · Ejercicios
Verdadero o falso, en caso de ser falso justifique
1 · «Si un modelo tiene error de entrenamiento igual a cero, está bien ajustado.»
Respuesta correcta y cómo se resuelve
Respuesta: Falso: un error de entrenamiento 0 no dice si el modelo
generaliza.
Resolución: con tantos parámetros como datos, cualquier polinomio
pasa por todos los puntos, tenga o no la forma correcta, así que el 0 está garantizado.
Para saber si está bien ajustado hay que mirar el error en validación y la brecha. En el
simulador, el grado 12 tiene 0 en entrenamiento y 84,47 en validación.
Error típico: leer «ajusta perfecto» como «es el mejor modelo». Es
exactamente la trampa de la P7.
2 · «Un modelo con error alto en entrenamiento y en validación está sobreajustado.»
Respuesta correcta y cómo se resuelve
Respuesta: Falso: eso es subajuste.
Resolución: el sobreajuste exige las dos mitades: error
bajo en entrenamiento y alto fuera (brecha grande). Si el error es alto en
ambos, la brecha es chica y el nivel es malo: el modelo es demasiado simple para
describir incluso los datos con que aprendió. En el simulador es el grado 1: 5,62 y
7,14.
Error típico: usar «sobreajuste» como sinónimo de «error alto». El
remedio sería el opuesto: al subajuste se le sube la complejidad.
De dónde sale:
[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P2]; el balance simple/complejo es
la cita del profesor en §1.
3 · «El sobreajuste se puede evitar aumentando el número de atributos de cada objeto.»
Respuesta correcta y cómo se resuelve
Respuesta: Falso: más atributos lo empeoran; lo que ayuda es tener
más observaciones.
Resolución: cada atributo es una columna nueva y trae su propio θ
(con k variables hay k + 1 parámetros). Más parámetros es más complejidad, y más
complejidad es más sobreajuste. Más filas, en cambio, dan más evidencia por
parámetro: en el simulador, pasar de 13 a 39 pinos baja la validación del grado 12 de
84,47 a 1,33.
Error típico: leer «atributos» como «más datos» y marcarla
verdadera. Es la opción 1 de la P3, la única falsa.
4 · «Como el conjunto de validación no se usa para ajustar los θ, es imposible sobreajustarlo.»
Respuesta correcta y cómo se resuelve
Respuesta: Falso: la validación también se puede sobreajustar,
porque con ella se toman decisiones.
Resolución: es cierto que los θ se ajustan solo con el
entrenamiento. Pero el grado del polinomio (o el modelo) se elige mirando la
validación. Si por azar un grado calza con esa partición, la elección queda ajustada a
ella. Por eso la métrica final se mide en el test, que no participó en ninguna
decisión.
Error típico: pensar que «no ajustar θ» equivale a «no influir en
el modelo». Elegir también es aprender de esos datos.
De dónde sale: la cita del profesor en §5
(clase del 31-jul); [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8].
5 · «El sobreajuste puede ocurrir tanto en clasificación como en regresión.»
Respuesta correcta y cómo se resuelve
Respuesta: Verdadero.
Resolución: en regresión es el polinomio de grado alto que pasa
por todos los puntos; en clasificación es la frontera que se tuerce para envolver cada
punto de entrenamiento, o el árbol que crece hasta tener una hoja por objeto. En los
tres casos: bien dentro, mal fuera. La lámina de «¿Cómo evaluar si estoy
sobreajustado?» se repite en el bloque de clasificación.
Error típico: asociar el sobreajuste solo a la regresión polinomial
porque ahí se introdujo.
De dónde sale:
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 8, 21 y 33];
P3, opción 5 (ficha P3).
Transferencia · otro dominio [DATITO]
Una empresa de buses interurbanos predice el retraso de cada viaje,
en minutos. Tres analistas entregan esto (cifras ilustrativas [DATITO]; la métrica es
MAE, más bajo es mejor):
Analista
Modelo
MAE entrenamiento
MAE validación
1
Árbol sin límite de altura
0,0 min
11,4 min
2
Árbol con altura máxima 4
5,1 min
5,8 min
3
Siempre predice el retraso promedio
9,7 min
9,9 min
(a) Calcula la brecha de cada uno (ojo con el sentido de la resta) y diagnostica.
(b) ¿Cuál llevas a producción y por qué? (c) El analista 1 propone agregar 30 columnas
de clima por hora «para que el modelo tenga más información». ¿Qué esperas que pase? (d)
Da dos remedios del curso para el analista 1, con su mecanismo.
Respuesta correcta y cómo se resuelve
Respuesta: el analista 1 sobreajusta, el 3 subajusta y el 2 tiene
un ajuste razonable; a producción va el 2, porque tiene el menor
error sobre viajes que no vio (5,8 min) con una brecha chica.
(a) MAE es un error (más bajo es mejor), así que brecha = validación −
entrenamiento. 1: 11,4 − 0,0 = 11,4 min → sobreajuste (memorizó cada
viaje). 2: 5,8 − 5,1 = 0,7 min y nivel bajo → ajuste razonable. 3:
9,9 − 9,7 = 0,2 min, pero malo en ambos → subajuste.
(b) Se compara la columna de validación: 5,8 < 9,9 < 11,4. Gana el 2, y su
brecha de 0,7 min dice que ese 5,8 es estable. El 0,0 del analista 1 no sirve para
decidir.
(c) Más columnas = más parámetros = más oportunidades de calzar con el ruido: la
brecha tiende a crecer, no a bajar. Solo ayudarían si traen señal
real, y eso lo diría la validación, no el entrenamiento (P3).
(d) Detener el árbol (altura máxima o mínimo de objetos por hoja: menos capacidad
de memorizar), eligiendo esa altura en validación cruzada (lo detecta antes de
decidir). Y más filas, o sea más viajes: más evidencia por parámetro.
Error típico: restar al revés con MAE (0,0 − 11,4 = −11,4) y
concluir «brecha negativa, no hay sobreajuste»; o elegir al analista 1 por su 0,0.
De dónde sale: caso y cifras
ilustrativas [DATITO]; reglas de parada del árbol
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 33];
filas frente a columnas [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P3].
Producción: explícaselo a alguien.
Un compañero te dice: «mi polinomio de grado 12 tiene error cero en entrenamiento,
así que es el mejor modelo que probé».
En cinco líneas o menos: dile por qué ese cero no prueba lo que cree,
qué número tendría que mirar, cómo elegiría el grado, y qué haría si el mejor grado
sigue sobreajustando. Escríbelo sin mirar esta página y llévalo a
Datito para que lo revise.
Respuesta correcta y cómo se resuelve
Respuesta: el compañero está equivocado: el cero de entrenamiento
no prueba que su modelo sea el mejor, y tiene que decidir por el error de validación.
Respuesta modelo (cinco líneas):
«Ese cero no prueba nada: con 13 datos, un polinomio de
grado 12 tiene 13 parámetros y pasa exacto por todos los puntos, incluido el ruido,
sea cual sea la forma real. Lo que hay que mirar es el error en datos que el modelo no
vio y la brecha con el de entrenamiento: aquí es 0 contra 84,5, o sea sobreajuste. El
grado es un hiperparámetro: me quedo con el que minimiza el error de validación,
idealmente con validación cruzada, y el test lo uso una sola vez al final. Si el mejor
grado igual sobreajusta, bajo la complejidad o consigo más filas; agregar columnas lo
empeoraría.»
Criterios con que se corrige:
Nombra el mecanismo: con tantos parámetros como puntos, la curva pasa por todos, incluido el ruido
Dice qué mirar: el error en datos no vistos (validación) y la brecha, no un número suelto
El grado se elige en validación (idealmente cruzada), y el test se usa al final
Remedios del curso con su mecanismo: bajar el grado, más filas. Si menciona regularizar, lo presenta como algo que no vino de clase
No confunde subajuste con sobreajuste ni «error alto» con cualquiera de los dos
Error típico: responder «está sobreajustado» sin decir por qué ni
con qué número, o proponer regularización como si fuera materia del profesor.
De dónde sale: cifras del simulador
[DATITO]; validación para el orden del polinomio
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8];
procedimiento [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7].
12 · Procedimiento para el papel
1. MÉTRICA ¿error (más bajo mejor) o puntaje (más alto mejor)?
2. EL PAR dentro (entrenamiento) y fuera (validación / test)
3. BRECHA calcularla por escrito, fila por fila
4. CLASIFICAR brecha grande → sobreajuste
brecha chica + malo en ambos → subajuste
brecha chica + aceptable → ajuste razonable
5. MECANISMO «memorizó el ruido de n datos con p+1 parámetros»
6. REMEDIO SEGÚN CAUSA sobre: bajar grado · más filas · elegir en validación
cruzada · detener el árbol · dominio
sub: más complejidad (más filas no lo cura)
7. ¿PRODUCCIÓN? se decide por el error fuera, nunca por el de dentro
13 · Errores que el formato castiga
Error
Por qué está mal
Llamar sobreajuste a toda degradación sin calcular la brecha
Sin la resta no hay diagnóstico. Y una caída entre dos conjuntos no vistos (CV → test) tiene otros mecanismos: selección y cambio de distribución
Diagnosticar con un solo número
0,98 puede ser memoria; 0,41 puede ser un problema difícil. Hace falta el par
Restar de memoria sin mirar la métrica
Con MAE o ECM la brecha es validación − entrenamiento; con R², al revés
Tratar el error de entrenamiento como evidencia de calidad
Es la P7: el 0 de entrenamiento no distingue al grado 7 del grado 10
Confundir más filas con más columnas
Es la P3: efectos opuestos
Llamar sobreajuste a un modelo malo en ambos conjuntos
Es la P2: eso es subajuste
Presentar regularización o «sesgo-varianza» como materia del profesor
No aparecen desarrolladas en sus clases (§8 y §9). Si las usas, etiquétalas
A dónde seguir.
generalizacion.html — la caída de Melbourne descompuesta: optimismo por selección y cambio de distribución
Lo que se trabajó en las sesiones sobre este tema, para volver a leerlo y re-intentarlo. Primero responde tú; después abre la respuesta. Fuente: 07_DATITO/dudas.yaml.
19-sep · resuelta en la sesión · Overfitting y underfitting
Pregunta. Tres modelos con R² de entrenamiento / prueba: A 0,62 / 0,59 · B 0,98 / 0,54 · C 0,41 / 0,39. a) ¿Cuál sobreajusta, cuál subajusta y cuál está bien? b) Un compañero dice que B es el mejor porque aprendió mejor los datos. ¿Tiene razón? c) ¿Qué harías para mejorar B?
Lo que respondiste en la sesión: a) Primer intento: «A sobreajusta, B subajusta, C está bien». Segundo intento, tras calcular las brechas: B sobreajusta, C subajusta «porque ambos valores son bajos», A está bien. b) «Mi compañero no tiene razón, B memoriza pero generaliza peor que el modelo A». c) Regularizar y podar el árbol.
Respuesta correcta y cómo se resuelve
Respuesta. B sobreajusta (brecha 0,44), C subajusta (bajo en ambos, brecha 0,02), A está bien (bueno en ambos, brecha 0,03); el compañero se equivoca porque lo que importa es la prueba (A 0,59 > B 0,54).
Paso 1, la brecha de cada uno: A 0,62−0,59 = 0,03 · B 0,98−0,54 = 0,44 · C 0,41−0,39 = 0,02.
Paso 2, la brecha grande aísla el sobreajuste: B.
Paso 3, entre los de brecha chica, el nivel separa: C es bajo en ambos → subajuste; A es aceptable en ambos → ajuste razonable.
b) No: B memoriza el entrenamiento, pero en datos nuevos rinde menos que A. Ancla la respuesta con la cifra: 0,54 < 0,59.
c) Remedios del curso: simplificar (menos grado, podar o limitar el árbol), más filas, y elegir la complejidad con validación cruzada. «Podar» supone que B es un árbol, y el enunciado no lo dice: declara el supuesto (P11). «Regularizar» no aparece en las clases del profesor ni en el P4: úsalo solo como [INFERENCIA].
Error típico. Clasificar mirando un solo número por modelo en vez de calcular la brecha primero; y dar remedios que suponen un tipo de modelo no declarado.
[FUENTE · Repo: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md] problema y respuestas [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §7] procedimiento de diagnóstico [FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml] error diagnostica_sin_calcular_la_brecha Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md
19-sep · resuelta en la sesión · Overfitting y underfitting
Pregunta. Tres modelos de tiempo de entrega, métrica MAE (menos es mejor), entrenamiento / prueba: P 0,15 / 0,92 · Q 0,71 / 0,78 · R 1,84 / 1,90. a) ¿Cuál sobreajusta, cuál subajusta y cuál está bien?
Lo que respondiste en la sesión: a) «P sobreajusta, Q está bien, R subajusta», sin ayuda.
Respuesta correcta y cómo se resuelve
Respuesta. P sobreajusta (error muy bajo en entrenamiento y alto en prueba), R subajusta (error alto en ambos), Q está bien.
Antes de restar, lee qué significa el número: con MAE, MENOS es mejor (al revés que R²).
Brechas: P 0,92−0,15 = 0,77 · Q 0,78−0,71 = 0,07 · R 1,90−1,84 = 0,06.
P tiene la brecha grande: sobreajuste. Entre Q y R, R tiene error alto en ambos: subajuste. Q: bajo y parecido en ambos.
Error típico. Aplicar de memoria la regla de R² («más alto es mejor») a una métrica de error e invertir el diagnóstico.
[FUENTE · Repo: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md] problema y respuesta [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §7] procedimiento de diagnóstico Contexto de la sesión: 07_DATITO/07_BITACORA/2026-09-19-overfitting_underfitting.md