Objetivo. Elegir una estrategia de validación y justificar por qué una sola partición puede engañar.
- Evidencia de aprendizaje: Explica K-Fold, bootstrap y submuestreo, y elige uno según la cantidad de datos y su orden.
- Actividad final: Interpretar la distribución del error de validación y decir si el error de test cae dentro de ella.
- Criterio de dominio: Justifica la estrategia y compara todos los modelos con la misma partición.
Validación cruzada
Por qué una sola partición no basta, y qué cambia al rotarla.
Fundamentos de Ciencia de Datos · UdeC · Clase del 31 de julio
COMPRENDIDO. Habilita el sobreajuste y, por cadena, los árboles, los
ensambles y el boosting: 9 conceptos quedan bloqueados si este no se
entiende.Y sin embargo su peso en la evaluación es bajo: aparece como remedio, no como pregunta propia — la respuesta a «¿y cómo arreglas el sobreajuste?», casi nunca el enunciado. Si decides cuánto estudiar mirando el certamen, esta es exactamente la que vas a subestimar.
La valoración del profesor es de otra naturaleza. No la dijo al cerrar el tema: la anunció al inicio de la clase, y con reserva («yo creo», «quizás»):
1 · La frase que define el concepto
En la Clase del 31-jul el profesor explica el esquema de tres conjuntos —entrenamiento, validación, test— y elige el grado del polinomio con el de validación. Un compañero le pregunta qué hacer si justo con esa validación «dio el polinomio perfecto» por suerte. Y responde esto:
Validación («validación nomás», el holdout) = con el test ya guardado, partir una vez en entrenamiento / validación y decidir con ese único número.
Validación cruzada = una familia de estrategias que re-particionan varias veces los datos que no son test, entrenan y validan en cada partición, y miran la distribución de los errores de validación (media o mediana, y su dispersión). K-Fold es una de ellas: la que además garantiza que cada dato valide exactamente una vez. Submuestreo aleatorio (shuffle split) y bootstrap son otras.
El profesor las separa explícitamente. Decir «hice validación cruzada» cuando solo se partió una vez es justo la confusión que esa respuesta corrige. [DATITO]
Un matiz de vocabulario que conviene conocer antes del certamen. Tres minutos después, al presentar las estrategias, el profesor parte por el mismo esquema de una partición:
Lectura coherente [INFERENCIA]: el holdout es el caso base de la lista (una partición, un solo valor, «validación nomás»); las otras tres lo repiten con particiones distintas, y eso es lo que las vuelve validación cruzada propiamente tal. Shuffle split es el nombre en scikit-learn del submuestreo aleatorio [INFERENCIA]. En el papel: nombra las cuatro y marca que el holdout entrega un solo valor. Es el mismo vocabulario de train_validation_test.html.
Antes, en el mismo bloque, había dicho algo que conviene tener a mano:
2 · El problema: el conjunto de validación puede tener suerte
Él mismo lo plantea, y es la razón de existir de todo lo que sigue:
Fíjate en la reserva: «no necesariamente ocurre siempre». No dice que la validación simple mienta; dice que puede tener suerte, y que con un solo número no tienes cómo saberlo.
Abajo hay 20 árboles. Voy a apartar 5 al azar como validación, ajustar polinomios de grado 1 a 6 con los otros 15, y quedarme con el grado que menor error dé en esos 5. Si repito el sorteo 10 veces, ¿cuántos grados distintos crees que van a ganar?
Respuesta correcta y cómo se resuelve
Respuesta: casi siempre cuatro o más grados distintos; «siempre el mismo» no ocurre con estos datos.
Cómo se resuelve: 1) con 20 árboles y 5 en validación, cada sorteo deja fuera un grupo distinto de árboles; 2) el grado ganador es el que mejor calza con esos 5, así que hereda su azar; 3) al repetir el sorteo 10 veces, el ganador salta. En 2.000 simulaciones de 10 sorteos con este mismo lienzo, salieron 4 o más ganadores distintos en ~84 % de los casos, 2 o 3 en ~16 %, y nunca uno solo [DATITO: simulación con los datos ilustrativos de esta página].
Error típico: pensar que, como los datos no cambian, la decisión tampoco cambia. Lo que cambia es la partición, y con un solo número de validación la decisión depende de ella.
De dónde sale: la advertencia de que «por azar» la validación puede favorecer un hiperparámetro es del profesor (cita del §2) [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:49:13–0:50:05]; los porcentajes son [DATITO].
3 · La lotería de una sola partición
Los datos no cambian entre sorteos. Lo único que cambia es
qué 5 árboles caen en validación. Si el grado ganador salta, es que
tu decisión depende del sorteo, no de los datos.
Los 20 árboles son cifras ilustrativas [DATITO] y representan
lo que queda después de guardar el test: el test no aparece porque no
participa en ningún sorteo.
4 · K-Fold: que cada dato sea validación exactamente una vez
En vez de apartar 5 y rezar, se parte el conjunto en k bloques disjuntos —aquí k = 4, de 5 árboles cada uno, el mismo k que usó el profesor en su dibujo [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:10:33–1:10:40]— y se rota cuál hace de validación. El test sigue guardado en todas las rondas: él dibuja primero «guardo siempre mi test» y recién después arma los k bloques [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:10:25].
Vuelve a correrlo varias veces. Compara cuánto salta este historial contra el de arriba.
5 · La distribución del error: dónde debería caer el test
Repetir la partición no solo da un promedio. Da una nube de errores por cada candidato, y con ella una regla para revisar el test:
Fue el punto que más costó en esa clase: al pedir que levantaran la mano quienes no habían entendido, hubo varias, y el profesor lo rehízo con un dibujo [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:00:44]. El dibujo: en el eje horizontal el grado del polinomio, en el vertical el error de validación, varios puntos por grado; se elige el grado cuya nube está más cerca de cero y recién ahí se mira el test [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:03:08–1:06:22]. Abajo está ese dibujo, con cifras ilustrativas [DATITO].
Con la partición bien hecha, ¿dónde debería caer el error de test del grado elegido?
Respuesta correcta y cómo se resuelve
Respuesta: dentro de la nube de errores de validación del grado elegido; no en un punto exacto.
Cómo se resuelve: 1) cada repetición de la partición da un error de validación: la nube es su distribución; 2) el test es otra muestra de datos no vistos, del mismo tipo si la partición está bien hecha; 3) por eso su error debe parecerse a uno más de la nube: cerca de la media, con la misma variabilidad; 4) si cae fuera, se investiga antes de reportar.
Error típico: exigir que el test coincida con la media (es una muestra, varía), o esperar que salga mejor que todo porque el modelo final ya estaría listo (no ha visto más datos que en las repeticiones).
De dónde sale: «el error debiese caer dentro […] de la distribución de los errores del conjunto de ⟨validación⟩» [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:59:31–0:59:38] (⟨⟩ = corrección de transcripción [INFERENCIA]).
Cada punto es el error de validación de una repetición (submuestreo o bootstrap). Cifras ilustrativas [DATITO]; el criterio «dentro = entre el mínimo y el máximo de la nube» es una simplificación [DATITO]: el profesor habló de media o mediana, desviación estándar o percentiles.
6 · La ecuación, desarmada
| CV(k) | La estimación del error por validación cruzada. Es un número que resume k números. lo calculas |
| k | Cuántos bloques. Lo decides tú: el profesor dibujó k = 4; 5 y 10 son habituales en la práctica [DATITO] decisión |
| Di | El bloque i, el que hace de validación en esa ronda dato |
| f−i | El modelo entrenado con todo menos Di. El subíndice negativo es «sin el bloque i» lo aprende el modelo |
| L | La función de pérdida: MAE, MSE, error de clasificación… La eliges tú decisión |
| Σ | «Suma sobre las k rondas» |
Dos de los cinco símbolos
son decisiones tuyas, no verdades del problema: k y
L. Cambiarlas cambia el número. Por eso una respuesta que dice
«hice validación cruzada» sin decir cuál y con qué métrica
está incompleta.
El camino inverso: te dan la fórmula en el papel
En una prueba escrita la ecuación llega primero. Esto es lo que hay que poder reconstruir, en orden:
- ¿Qué compara? Nada: no compara, promedia. Es una media de k errores, no una diferencia entre dos cosas
- ¿Por qué el subíndice −i? Porque el modelo de la ronda i nunca vio el bloque i. Si lo hubiera visto, el error no mediría generalización
- ¿Cuántas veces se entrena el modelo? k veces, una por ronda. Ese es el costo: validación cruzada es k veces más cara que validación simple
- ¿Cuántas veces se usa cada dato? k−1 veces para entrenar y exactamente una para validar. Esa es la propiedad que define K-Fold
- ¿Qué pasa si k = n? Cada bloque tiene un solo dato. Se llama leave-one-out: máximo aprovechamiento, máximo costo
7 · Las estrategias: cuatro en la lámina, holdout es el caso base
En todas, el test ya está guardado y no cambia entre una iteración y otra [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:09:06–1:09:10]. Lo que cambia es cómo se reparte el resto.
| Estrategia | Cómo parte (sin tocar el test) | Qué dijo el profesor |
|---|---|---|
| Holdout (método de retención) | Una sola vez; generalmente 2/3 entrenamiento y 1/3 validación | Entrega un solo valor: es el caso de una sola partición del §1 [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:55:39–0:55:49] |
| Submuestreo aleatorio (random subsampling; shuffle split) | Repite el holdout con particiones al azar sin reemplazo y promedia | «básicamente la misma idea» que bootstrap, pero sin reemplazo: el entrenamiento no repite datos [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:08:43–1:09:26] |
| K-Fold | k bloques disjuntos; cada uno valida una vez | Cada dato queda validado exactamente una vez; sirve para comparar muchos modelos sobre la misma partición [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:12:44–1:13:48] |
| Bootstrap | Muestrea con reemplazo; lo que no salió pasa a validación | El entrenamiento puede tener repetidos, la validación no; se usa cuando hay pocos datos [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:07:55–1:08:36] |
Bootstrap y el 63,2 %
[INFERENCIA] En cada una de las n extracciones, un dato fijo no sale con probabilidad 1 − 1/n. Que no salga en ninguna de las n: (1 − 1/n)n, que para n grande tiende a 1/e ≈ 0,368. Por eso el entrenamiento contiene, en promedio, ~63,2 % de los datos distintos y la validación el ~36,8 % restante. El número coincide con la lámina según el Resumen de la Clase 6 [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · lámina 14].
¿Y si tengo pocos datos? Primero lo oficial
El práctico oficial P4 pone K-Fold justo bajo el título «¿Y si tengo pocos datos de entrenamiento?» [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l. 808–810]. En la ayudantía del 7-ago se presentó K-Fold en ese mismo contexto (tramo confuso en la transcripción; ayudantía, no materia de certamen) [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:11:55–0:12:06].
Cómo leer las dos fuentes [INFERENCIA]: el P4 compara K-Fold contra partir una sola vez (con pocos datos, K-Fold aprovecha mejor cada fila); el profesor compara K-Fold contra bootstrap cuando los datos son muy pocos y cada bloque quedaría diminuto. Como el certamen lo escribe él, conviene preguntarle cuál criterio espera. Mientras tanto, en el papel declara el supuesto: «con muy pocos datos, bootstrap, como se dijo en clase; frente a un holdout, K-Fold, como en el P4».
Tres cosas más que dijo y que se preguntan bien
- Todas convergen si hubiera datos infinitos, pero «nadie tiene datos infinitos»: por eso la elección depende de la tarea [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:11:56–1:12:21].
- Misma partición para todos los candidatos. Si vas a probar 20 modelos, puedes usar «exactamente la misma partición para estos 20 modelos»; se suele hacer con K-Fold, pero también con los otros si muestreas primero [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:13:30–1:14:06].
- Cuánto es «mucho» depende del problema [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:14:18–1:14:43]: se mide por lo que cae en cada bloque, no por el total.
8 · Por qué esto te importa a ti en particular
A 0,62/0,59 · B 0,98/0,54 · C 0,41/0,39
dijiste «A sobreajusta, B subajusta, C está bien» sin calcular las
diferencias.La validación cruzada es la herramienta que convierte esa intuición en un número. No solo te da el error de validación: te da k de ellos, y con eso una desviación. Una brecha de 0,44 entre entrenamiento y validación significa una cosa si los folds varían ±0,02, y otra muy distinta si varían ±0,20.
9 · Ejercicios
En el P4, la búsqueda de hiperparámetros usa
scoring='neg_mean_squared_error'
[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l. 874].
Dos grados obtienen −120 y −45 [DATITO].
¿Cuál es mejor?
Respuesta correcta y cómo se resuelve
Respuesta: −45 es mejor: es un MSE de 45, menor que 120.
Cómo se resuelve: 1) el score es −MSE; 2) quítale el signo: −120 → MSE 120, −45 → MSE 45; 3) el MSE es un error, así que menor es mejor; 4) por lo tanto, en el score, más cercano a cero es mejor.
Error típico: leer «más negativo, mejor», como si fuera una pérdida que se minimiza sin mirar el signo. Esa fue justamente la duda de la ayudantía.
De dónde sale: ayudantía del 7-ago, no materia de certamen: «entre más cercano a cero mejor» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:29:51]; el scoring del P4 [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l. 874].
Cálculo a mano
K-Fold con k = 4, error de validación (MSE) de cada ronda, cifras ilustrativas [DATITO]:
| ronda 1 | ronda 2 | ronda 3 | ronda 4 | |
|---|---|---|---|---|
| Grado 2 | 0,20 | 0,22 | 0,19 | 0,23 |
| Grado 5 | 0,12 | 0,31 | 0,15 | 0,34 |
(a) Calcula CV(4) de cada grado y elige. (b) ¿Qué habría elegido un holdout que solo hubiera visto la ronda 1? (c) Con bootstrap sobre n = 5 datos, ¿qué fracción de datos distintos esperas en el entrenamiento? (d) Si pruebas 6 grados con k = 4, ¿cuántas veces entrenas para decidir?
Respuesta correcta y cómo se resuelve
Respuesta: (a) CV grado 2 = 0,21 y grado 5 = 0,23: se elige el grado 2; (b) el holdout de la ronda 1 habría elegido el grado 5; (c) ~67,2 %; (d) 24 entrenamientos.
(a) Grado 2: (0,20 + 0,22 + 0,19 + 0,23) / 4 = 0,84 / 4 = 0,21. Grado 5: (0,12 + 0,31 + 0,15 + 0,34) / 4 = 0,92 / 4 = 0,23. Se elige el grado 2, y además su dispersión es mucho menor.
(b) En la ronda 1 el grado 5 gana (0,12 contra 0,20). Un holdout con esa partición habría elegido el grado 5: es la lotería del §3 con números.
(c) 1 − (4/5)5 = 1 − 0,32768 ≈ 0,672, es decir ~67,2 %. Con n pequeño la fracción es algo mayor que 63,2 %; se acerca a 63,2 % a medida que n crece [INFERENCIA].
(d) 6 × 4 = 24 entrenamientos. Ese es el costo de la validación cruzada: k veces más que un holdout por candidato.
Error típico: elegir el grado 5 porque tiene el error más bajo de la tabla (0,12). Ese valor es una sola ronda; lo que se compara es el promedio de las k rondas, mirando además cuánto varían. Otro error: en (c), responder 63,2 % sin fijarse en que n = 5 es pequeño.
De dónde sale: K-Fold y el promedio de los errores, Clase del 31-jul [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:09:52–1:11:12]; la fórmula de (c) es [INFERENCIA]; los números de la tabla son [DATITO].
Interpretación
Repetiste 50 veces el submuestreo con el grado elegido: error de validación con mediana 0,15 y rango 0,11–0,20. El test da 0,34. Cifras ilustrativas [DATITO]. ¿Qué le dices a quien pidió el modelo?
Respuesta correcta y cómo se resuelve
Respuesta: «El modelo va a rendir peor de lo que prometía la validación; antes de usarlo hay que averiguar por qué el test se comporta distinto».
Cómo se resuelve: 1) ubica el test respecto de la nube: 0,34 está muy por encima del máximo 0,20; 2) aplica la regla del profesor: debería caer dentro; 3) como no cae, algo raro pasa; 4) traduce al problema, sin jerga.
El test cae fuera de la distribución de los errores de validación, así que no se reporta como si nada. Según el profesor, algo raro pasa: el test tiene alguna anomalía o no es representativo del resto de los datos (§5). La traducción al problema: «el error que medimos al elegir no es el que vamos a tener; antes de usarlo hay que entender en qué se diferencia el test». Candidatos a revisar: si el test es de otro período, si hay datos anómalos, o si la validación se usó para tomar tantas decisiones que quedó optimista [INFERENCIA].
Error típico: reportar 0,34 como «el error del modelo» sin comentar la discrepancia, o reportar 0,15 porque «el test tuvo mala suerte». Ni lo uno ni lo otro: la diferencia es información y hay que explicarla.
De dónde sale: la regla y las causas son del profesor [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:06:22–1:06:47]; las cifras son [DATITO].
Transferencia: minería
Una planta concentradora tiene 60 ensayos de laboratorio [DATITO] para predecir la recuperación de cobre desde la granulometría, y quiere comparar 3 modelos. Los ensayos no tienen orden temporal relevante. ¿Qué haces, paso a paso?
Respuesta correcta y cómo se resuelve
Respuesta: guardar primero un test, comparar los 3 modelos con validación cruzada sobre la misma partición del resto (bootstrap según el profesor por ser muy pocos datos, o K-Fold como en el P4, declarando cuál) y evaluar una sola vez en el test.
1) Guardar el test primero, por ejemplo 12 ensayos, y no tocarlo. 2) Quedan 48: son pocos. Según el profesor, con muy pocos datos, bootstrap; según el P4, K-Fold antes que un holdout. Con k = 4 cada bloque tendría 12 ensayos: pregúntate si 12 bastan para que la métrica sea precisa. 3) Usar la misma partición para los 3 modelos. 4) Elegir por la distribución del error (media y dispersión), no por una ronda. 5) Evaluar una vez en el test y comprobar que cae dentro de la nube. [DATITO]
Si los ensayos vinieran por campañas en el tiempo y el modelo fuera a usarse en la campaña siguiente, el orden temporal manda por sobre todo lo anterior.
Error típico: usar los 60 ensayos para comparar y reportar el mejor promedio de validación como desempeño final (no queda nada guardado), o evaluar cada modelo sobre particiones distintas (la comparación deja de ser justa).
De dónde sale: guardar el test, misma partición para todos y bootstrap con pocos datos: Clase del 31-jul [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:13:30–1:14:59]; K-Fold con pocos datos: P4 [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P4_Regresión_res.md · l. 808–810]; el caso minero es [DATITO].
10 · Distinción de certamen y errores que el formato castiga
Validación (una partición, un número) ≠ validación cruzada (re-particionar y mirar la distribución).
Estimar el error ≠ mejorar el modelo: la validación cruzada mejora tu estimación; el modelo mejora solo si con ella eliges mejor.
Dónde se pregunta: en la P3 del Certamen 2 la afirmación «se puede medir el nivel de sobreajuste utilizando validación cruzada» es correcta. Y la brecha que mide está en overfitting_underfitting.html.
| Error | Por qué se castiga |
|---|---|
| Llamar validación cruzada a una sola partición | Es «validación nomás» (§1): un solo valor, puede ser suerte |
| Meter el test en los folds, o cambiarlo entre repeticiones | El test se guarda antes de todo y no cambia entre iteraciones (§7) |
| Decir que la validación cruzada mejora el modelo | Mejora la estimación del error; el modelo no cambia por medirlo mejor |
| Reportar solo el promedio | Sin la dispersión no sabes si el promedio es confiable, ni si el test cae dentro (§5) |
| Decir que en bootstrap la validación tiene repetidos | Repite el entrenamiento; la validación no tiene repetidos (§7) |
| Usar el 63,2 % sin decir el tamaño de la muestra | Vale para muestras de tamaño n, no n' < n (§7) |
| Leer el score negativo de scikit-learn al revés | Más cercano a cero es mejor (ayudantía; ver la predicción del §9) |
11 · Procedimiento para el papel
1. ¿HAY ORDEN TEMPORAL? sí → corte temporal, NO k-fold con mezcla
2. APARTAR EL TEST antes de todo. No cambia entre repeticiones
3. ELEGIR LA ESTRATEGIA holdout (1 valor) · submuestreo · K-Fold · bootstrap
pocos datos: declarar el criterio (clase vs P4)
4. ELEGIR k O REPETICIONES el profesor dibujó k = 4. Declararlo
5. ELEGIR LA PÉRDIDA L MAE, MSE, F1… Declararla
6. PARA CADA CANDIDATO la MISMA partición: entrenar, medir en validación
7. RESUMIR media o mediana + dispersión (la nube)
8. DECIDIR el hiperparámetro con menor error de validación
9. TEST, UNA VEZ ¿cae dentro de la nube? si no, investigar
10. REPORTAR la métrica del test, sin volver atrás
Un compañero te dice: «hice validación cruzada: separé mis datos en entrenamiento, validación y test, y elegí el modelo con el de validación».
¿Hizo validación cruzada? Responde verdadero o falso con justificación, y nombra qué le falta exactamente.
Pista: es lo que el profesor respondió a un compañero en la Clase del 31-jul (la cita del §1). Escríbelo con tus palabras y llévalo a Datito.
Respuesta correcta y cómo se resuelve
Respuesta: falso: lo que hizo es validación simple (holdout), no validación cruzada.
Respuesta modelo: «Falso. Separar una vez en entrenamiento, validación y test y elegir con la validación es validación, o holdout: da un solo número de error, y ese número puede favorecer por azar a un modelo que calzó bien con esas filas en particular. La validación cruzada repite la partición de los datos que no son test —con K-Fold, submuestreo aleatorio o bootstrap—, entrena y valida cada vez, y elige mirando la distribución de esos errores: su media y su dispersión. Le falta eso: repetir la partición con el test guardado y decidir con el resumen de las repeticiones, no con una sola.»
Cómo se resuelve: 1) identifica cuántas particiones hizo: una; 2) nombra eso como holdout; 3) di el riesgo: suerte de la partición; 4) di lo que falta: repetir y resumir la distribución.
Criterios de corrección: dice falso; nombra el holdout; explica el riesgo del azar; nombra al menos una estrategia de validación cruzada; mantiene el test guardado; no dice que la validación cruzada «mejora el modelo».
Error típico: responder «verdadero, porque usó un conjunto de validación». Tener un conjunto de validación no es lo mismo que validación cruzada.
De dónde sale: «no es validación cruzada, esto es validación nomás» [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:51:38].
train_validation_test.html— de dónde viene esto, y las cuatro estrategias dibujadas con el test apartegeneralizacion.html— qué es exactamente la brecha que la validación cruzada mide, y por qué el test de 2017 de Melbourne quedó por encima de la validación de 2016overfitting_underfitting.html— el concepto que este habilita directamentecertamen_2.html#p3— dónde se pregunta: la P3 dice «se puede medir el nivel de sobreajuste utilizando validación cruzada», y es verdadera
Cierre de la Clase 8 · Validación cruzada y selección de modelos
Qué aprendiste
- Re-particionar varias veces evita depender de una partición con suerte.
- En K-Fold cada dato valida exactamente una vez.
- El bootstrap muestrea con reemplazo; con muestras de tamaño n contiene cerca del 63,2 % de los datos distintos.
- Los modelos se comparan con la misma partición.
Qué no debes confundir
- Una sola partición («validación nomás») ≠ validación cruzada.
- Error promedio ≠ distribución del error.
- Con orden temporal no se desordena al azar.
Procedimiento para el papel
- ¿Cuántos datos hay? ¿Tienen orden temporal?
- Elige la estrategia y fija la partición.
- Compara por el promedio y por la dispersión del error.
- El test sigue aparte.
Viene de: Clase 7 · Train, validation y test · Sigue: Clase 9 · Generalización, extrapolación y datos no vistos
Vuelve a tu activación: Con una partición gana el polinomio de grado 7; con otra, el de grado 4. ¿Cuál eliges? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
El de −0,8: más cercano a cero significa menor error. Lo explicó la ayudantía, que no entra al certamen. [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:29:51]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.