Unidad 6 · Integrar y rendirClase 21 de 23
Clase 21 · Distinciones del Certamen 2

Objetivo. Resolver el Certamen 2 nombrando en cada pregunta la distinción que la decide.

Ficha Bloom · Evaluar
  • Evidencia de aprendizaje: Resuelve las once fichas y acierta la distinción de cada una.
  • Actividad final: La P8 completa con la matriz oficial de la lámina 19, en papel.
  • Criterio de dominio: Nombra las once distinciones sin mirar la tabla y resuelve la P8 y la P9 a mano.
Activación. Antes de abrir cada ficha: escribe la distinción que crees que decide la pregunta. Escribe tu respuesta antes de seguir: la retomas en el cierre.

Certamen 2 · pregunta por pregunta

Modelamiento, evaluación y panorama de IA · Fundamentos de Ciencia de Datos · UdeC · 28 de agosto de 2026

Cómo usar esta página. Lee el enunciado, responde en papel y recién después abre Respuesta y análisis. Cada análisis da la respuesta, revisa cada alternativa, nombra la distinción que decide la pregunta y el error típico.
Fuentes. Los enunciados son los del certamen, palabra por palabra. Cada respuesta se apoya en las láminas y clases del curso que se citan en ella.
#TemaFormatoPuntos
1Ensambles y diversidadVerdadero o falso0,5
2Definición de sobreajusteVerdadero o falso0,5
3Afirmaciones sobre sobreajusteVarias correctas0,5
4Métricas de clasificaciónVarias correctas0,5
5LLMs y agentesVarias correctas0,5
6Revoluciones de la IAVarias correctas0,5
7Regresión polinomialDesarrollo1,0
8Matriz de confusión desde una figuraCálculose respondió en la 11
9TPR, FPR y curva ROCDesarrollo1,0
10«Punto base»Sin contenido—
11Comentarios y supuestosTexto libre0

Las dos preguntas de 1,0 punto (polinomial y ROC) valen el doble que cualquier cerrada, y una de ellas es de evaluación de clasificadores.

Las preguntas

1
Ensambles y diversidad
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«Utilizar un modelo compuesto por varios modelos (por ejemplo, árboles de decisión) exactamente iguales y que predicen exactamente lo mismo, suele predecir mejor que cada modelo por separado.»
Respuesta y análisis
Respuesta
Falso. Un ensamble mejora porque sus modelos se equivocan en casos distintos y, al combinarlos, esos errores se compensan. Si los modelos son idénticos, cometen los mismos errores: promediar valores iguales devuelve el mismo valor. El ensamble equivale a un solo modelo.
Análisis
  1. Modelos idénticos → predicciones idénticas → errores idénticos.
  2. Promediar n valores iguales da ese mismo valor: no hay nada que compensar.
  3. La reducción de varianza del promedio, Var(x̄) = σ² / n, exige errores independientes. Con errores idénticos la varianza se queda en σ², por muchos modelos que se sumen.
  4. Por eso Random Forest fuerza la diversidad: cada árbol ve una muestra distinta de filas (bagging) y un subconjunto distinto de columnas.
Qué decide la pregunta: número de modelos ≠ diversidad de modelos.

Error típico: responder «verdadero, más modelos siempre ayudan». La cantidad no aporta nada sin diversidad.

Fuente: bloque de árboles y ensambles [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 25–38]. Repasar: Clase 16 · ensambles
Practica: combinas dos modelos que aciertan 80 % cada uno. Describe un caso donde el ensamble supere el 80 % y otro donde no gane nada.
Respuesta correcta y cómo se resuelve

Respuesta: no gana nada si los dos fallan en las mismas filas; puede superar el 80 % si fallan en filas distintas y la combinación se queda con el que acierta.

  1. Sin ganancia: A y B fallan las filas 1 a 20. El ensamble también: 80 %.
  2. Con ganancia: A falla las filas 1 a 20 y B las 21 a 40. En cada fila donde discrepan hay un modelo correcto; si la combinación lo elige, el ensamble llega hasta 100 %.
  3. Con tres modelos de 80 % y errores independientes, la mayoría acierta con probabilidad 0,8³ + 3 · 0,8² · 0,2 = 0,512 + 0,384 = 0,896.

Error típico: «siempre mejora porque son dos opiniones». Sin errores distintos y una buena regla de combinación, no mejora. Las filas del ejemplo son ilustrativas [DATITO].

2
Definición de sobreajuste
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«El sobreajuste de un modelo ocurre cuando el modelo predice correctamente sobre el conjunto de entrenamiento, pero no es capaz de generalizar para datos que no ha visto antes.»
Respuesta y análisis
Respuesta
Verdadero. Es la definición. Como el enunciado pide justificar solo si es falso, basta con «Verdadero».
Análisis
  1. Sobreajuste = error bajo en entrenamiento y alto en datos no vistos: el modelo aprendió ruido del entrenamiento como si fuera señal.
  2. La mitad que hace precisa la definición es «predice correctamente sobre el entrenamiento». Si el error fuera alto en ambos conjuntos, sería subajuste.
  3. Ejemplo del proyecto Melbourne: HistGradientBoosting tiene R² 0,927 en entrenamiento (2016) y 0,757 en test (2017). La brecha es lo que se vigila.
Qué decide la pregunta: sobreajuste (bajo en entrenamiento, alto fuera) ≠ subajuste (alto en ambos) ≠ simple error alto.

Error típico: agregar una justificación que no se pide y cometer una imprecisión en ella.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 7 y 20]; [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · §6.5]; cifras de Melbourne: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json · «HistGradientBoosting | log»]. Repasar: Clase 10 · Overfitting y underfitting
Practica: un modelo tiene error alto en entrenamiento y error alto en test. ¿Está sobreajustado? ¿Qué harías?
Respuesta correcta y cómo se resuelve

Respuesta: no; está subajustado (demasiado simple). Hay que darle más capacidad (más grado, un modelo más flexible, mejores atributos) y elegir cuánta con validación.

Frente a un sobreajuste se hace lo contrario: bajar la complejidad o conseguir más filas.

Error típico: llamar «sobreajuste» a cualquier error alto. [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · §6.6.3]

3
Afirmaciones sobre sobreajuste
0,5Analizar
Enunciado Respecto al sobreajuste, ¿cuáles de las siguientes afirmaciones son correctas?
  1. Se puede evitar aumentando el número de atributos de cada objeto.
  2. Un modelo más complejo tiende a sobreajustarse más que uno más simple.
  3. Se puede medir el nivel de sobreajuste utilizando validación cruzada.
  4. Puede generar un problema al poner el modelo en producción.
  5. Puede ocurrir tanto en problemas de clasificación como de regresión.
Respuesta y análisis
Respuesta
Correctas: 2, 3, 4 y 5. Solo la 1 es falsa.
Análisis
#VeredictoPor qué
1FalsaMás atributos es más complejidad: aumenta el sobreajuste. Lo que lo reduce es tener más filas, no más columnas
2CorrectaLámina 20, «Modelos más complejos»; subir el grado del polinomio «conduce al sobreajuste»
3CorrectaLámina 8: «¿Cómo evaluar si estoy sobreajustado? · VALIDACIÓN CRUZADA!»
4CorrectaUn modelo que no generaliza falla con datos nuevos, que es justo lo que recibe en producción
5CorrectaLa lámina 8 se usa en el bloque de regresión y se repite en el de clasificación (lámina 21)
Qué decide la pregunta: más filas (observaciones) reduce el sobreajuste; más columnas (atributos) lo aumenta.

Error típico: marcar la 1 porque «más datos» suena bien, sin mirar en qué dirección crecen los datos.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 8, 20 y 21]; [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · §6.5]. Repasar: Clase 10 · Clase 8 · validación cruzada
Practica: tienes 100 filas y 5 columnas, y se proponen 50 columnas derivadas de las 5 originales. ¿Qué pasa con el error de entrenamiento y con el de validación?
Respuesta correcta y cómo se resuelve

Respuesta: el de entrenamiento baja (o no sube); el de validación tiende a subir. Solo medirlo en validación lo confirma.

  1. El modelo de 55 columnas contiene al de 5 (basta anular los coeficientes nuevos), así que en entrenamiento nunca queda peor.
  2. Las columnas derivadas no traen información nueva: traen libertad para acomodar el ruido de esas 100 filas. Eso sube el error en datos no vistos.
  3. Excepción: si una derivada captura una forma real (x² cuando la relación es curva), la validación puede mejorar. Por eso se decide con validación.

Error típico: dar una sola respuesta para los dos errores.

4
Métricas de clasificación
0,5Analizar
Enunciado ¿Cuál(es) de las siguientes son utilizadas para evaluar un modelo de clasificación?
  1. Área bajo la curva ROC
  2. Varianza
  3. Ganancia de pureza
  4. Tasa de falsos positivos
  5. Exactitud
Respuesta y análisis
Respuesta
Correctas: 1, 4 y 5. Las dos falsas lo son por razones distintas.
Análisis
#VeredictoPor qué
1CorrectaLáminas 22–24: curva ROC y su área
2FalsaLa varianza describe la dispersión de una variable, no el desempeño de un clasificador
3FalsaLámina 31: la ganancia de pureza compara la impureza del nodo padre con la de sus hijos. Sirve para construir el árbol (decidir dónde dividir), no para evaluarlo
4CorrectaLámina 18: TFP = FP / (FP + VN)
5CorrectaLámina 18: exactitud = (VP + VN) / (P + N)
Las fórmulas de la lámina 18: cambia el denominador
Exactitud(VP + VN) / (P + N) — sobre el total
Error(FP + FN) / (P + N) = 1 − exactitud
TVP (recall)VP / (VP + FN) = VP / P — sobre los positivos reales
PrecisiónVP / (VP + FP) — sobre los predichos positivos
TFPFP / (FP + VN) = FP / N — sobre los negativos reales
Qué decide la pregunta: métrica de un clasificador ≠ descriptor de una variable (descarta la varianza) · criterio para entrenar ≠ métrica para evaluar (descarta la ganancia de pureza).

Error típico: marcar la ganancia de pureza porque aparece en la unidad de clasificación.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 17, 18, 22–24 y 31]. Repasar: Clase 13 · métricas · Clase 12 · matriz de confusión
Practica: un modelo tiene precisión 0,9 y TFP 0,4. ¿Es contradictorio?
Respuesta correcta y cómo se resuelve

Respuesta: no. Comparten el numerador (FP) pero dividen entre universos distintos.

Ejemplo [DATITO]: 100 positivos y 25 negativos reales; VP = 90, FN = 10, FP = 10, VN = 15.

  1. Precisión = 90 / (90 + 10) = 0,9.
  2. TFP = 10 / (10 + 15) = 0,4.
  3. Los mismos 10 FP pesan 10 de 100 en un caso y 10 de 25 en el otro.

Error típico: suponer TFP = 1 − precisión. Solo se restan de 1 métricas con el mismo denominador.

5
LLMs y agentes
0,5Analizar
Enunciado ¿Cuál(es) de las siguientes afirmaciones es(son) correcta(s) según la descripción sobre LLMs y agentes?
  1. Los LLMs son excelentes para obtener respuestas basadas en hechos recientes y planificar a largo plazo.
  2. Un agente puede usar herramientas, almacenar conocimiento y actuar de forma autónoma, mientras que un LLM se limita principalmente al procesamiento de información y generación de texto.
  3. Los agentes no pueden colaborar con otros agentes ni con humanos.
  4. Los LLMs no requieren grandes cantidades de datos ni poder de cómputo para entrenarse.
Respuesta y análisis
Respuesta
Correcta: solo la 2. Las láminas 45 y 46 contradicen las otras tres de forma explícita.
Análisis
#VeredictoLo que dice la lámina
1FalsaLámina 45: los LLMs son «muy malos para» respuestas basadas en hechos (alucinan), información posterior a su entrenamiento y razonar y planificar
2CorrectaLámina 46: los agentes realizan acciones autónomas, tienen memoria y almacenan conocimiento, y usan herramientas (internet, intérpretes de código, llamadas API)
3FalsaLámina 46: «Los agentes también pueden colaborar con otros agentes o con humanos»
4FalsaLámina 45: con miles de millones de parámetros (GPT-3: 175B), «necesitan muchos datos y poder de cómputo»
Qué decide la pregunta: generar texto ≠ ejecutar acciones y observar su resultado. Dentro del agente hay un LLM, pero el agente cierra un bucle: el LLM llama a una herramienta, la herramienta se ejecuta y su resultado vuelve y condiciona lo que el agente hace después.
«empiezan a generar el siguiente ⟨token⟩ […] y generan una palabra especial con la cual se conectan a la herramienta ejecutan la herramienta después le devuelve ⟨al agente⟩ recibe la respuesta de la herramienta […] y de nuevo siguen ⟨prediciendo⟩ la siguiente palabra» Clase del 21-ago · 2:50:44–2:51:08 · profesor · ⟨⟩ = corrección de la transcripción automática · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Error típico: responder desde lo que uno sabe de LLMs y no desde lo visto en clase. El enunciado dice «según la descripción».

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 45–48]. Repasar: Clase 18 · agentes
Practica: si un LLM se conecta a internet para buscar un dato, ¿ya es un agente?
Respuesta correcta y cómo se resuelve

Respuesta: todavía no. Tiene uso de herramientas (internet es el ejemplo de la lámina 46), pero le faltan la acción autónoma, la memoria para almacenar conocimiento y la colaboración con otros agentes o humanos.

Cómo se resuelve: revisa los atributos de la lámina 46 uno por uno y marca cuáles cumple.

Error típico: tomar un solo atributo como definición («usa internet, entonces es agente»).

6
Revoluciones de la IA
0,5Analizar
Enunciado Durante este siglo, la inteligencia artificial mediante el uso de redes neuronales ha experimentado avances significativos que han impulsado aplicaciones prácticas en diversas áreas. ¿Cuál(es) de las siguientes tecnologías se considera(n) entre las revoluciones recientes más destacadas?
  1. Procesamiento del lenguaje natural.
  2. Computación en la nube.
  3. Bases de datos relacionales.
  4. Detección de objetos en imágenes.
Respuesta y análisis
Respuesta
Correctas: 1 y 4. Son los dos casos centrales de la clase del 21-ago.
Análisis
#VeredictoPor qué
1CorrectaLáminas 33–34: transformers en NLP y el benchmark GLUE
2FalsaLa nube hizo posible entrenar modelos grandes, pero no es una tecnología que avance «mediante redes neuronales»
3FalsaTecnología de los años 70, anterior al periodo y ajena a las redes neuronales
4CorrectaLáminas 6–7: ImageNet, 1,2 millones de imágenes de entrenamiento y 1.000 categorías de objetos
Qué decide la pregunta: la cláusula «mediante el uso de redes neuronales». Causa ≠ condición habilitante: la nube y las GPU habilitaron el avance, pero la revolución es de las redes neuronales. La lámina 65 nombra tres factores del boom: redes neuronales, abundancia de datos y GPU.

Error típico: marcar la nube porque es históricamente importante. Es verdadera como historia y falsa como respuesta a esta pregunta.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6–8, 33–34 y 65]. Repasar: Clase 18 · deep learning
Practica: según la lámina 8, ¿cuándo conviene deep learning en vez de un algoritmo clásico? ¿Qué implica para Melbourne?
Respuesta correcta y cómo se resuelve

Respuesta: con muchos datos; con pocos, los algoritmos clásicos rinden igual o mejor. Melbourne tiene 6.336 filas de entrenamiento y 12 columnas: corresponde un algoritmo clásico, y el mejor medido fue HistGradientBoosting (R² 0,757 en 2017).

«si tu tienes pocos datos los algoritmos clásicos funcionan mejor que deep learning […] pero si tu tienes muchos datos deep learning funciona mucho mejor» Clase del 21-ago · 1:45:25–1:45:37 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Error típico: elegir deep learning por ser más moderno. Con miles de filas de tabla, la lámina 8 indica un algoritmo clásico. Cifras: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json · «HistGradientBoosting | log»]

7
Regresión polinomial
1,0Evaluar
Enunciado Considere el cálculo del volumen de un árbol en pie en función de su diámetro a la altura de pecho (DAP). Ud. ha leído que esta relación puede ser aproximada mediante un modelo de regresión polinomial. Para estimar los parámetros de su modelo, Ud. toma datos de 5 árboles. […] Ud. entrega los datos a su compañero, quien ajusta un modelo polinomial minimizando el error cuadrático medio. El modelo ajustado se representa mediante la curva naranja.

a) ¿Considera Ud. que el ajuste de su compañero fue realizado correctamente? ¿Por qué?
b) En caso de responder «no», ¿qué haría para mejorar el ajuste?

La figura: cinco puntos aproximadamente en (15; 0,38) · (20; 0,51) · (25; 0,53) · (30; 0,99) · (35; 1,41), con DAP en cm y volumen en m³. La curva naranja pasa exactamente por los cinco, alcanza un máximo cerca de DAP 34 y cruza a volumen negativo cerca de DAP 36,5.
Respuesta y análisis
Respuesta
a) No. El modelo está sobreajustado y además contradice la física del problema.
  1. Estadístico: con 5 puntos, un polinomio de grado 4 pasa exactamente por todos y el error cuadrático medio de entrenamiento es cero. Un error cero con tantos parámetros como datos no demuestra nada: el modelo memorizó los 5 árboles.
  2. Físico: la curva predice menos volumen para árboles más gruesos después de DAP 34 y volumen negativo desde DAP 36,5. El volumen no puede ser negativo y crece con el diámetro.
b) Cómo mejorarlo
  1. Bajar el grado del polinomio: con 5 puntos y una relación creciente, grado 1 o 2.
  2. Elegir el grado con un conjunto de validación. Es el ejemplo exacto de la lámina 8: «conjunto de validación: se utiliza para ajustar hiperparámetros (por ej., el orden del polinomio)».
  3. Conseguir más árboles: 5 puntos no sostienen un modelo flexible.
  4. Exigir lo que se sabe del dominio: volumen no negativo y creciente con el DAP.
Análisis

El algoritmo hizo exactamente lo que se le pidió: minimizar el error sobre los 5 árboles. El error está en el diseño, en elegir un grado que permite interpolar. La regresión polinomial sigue siendo regresión lineal (es lineal en los parámetros θ, no en x), así que la decisión que importa es el grado.

Qué decide la pregunta: error de entrenamiento ≠ calidad del modelo. Un error cero sobre 5 árboles no dice nada del sexto.

Error típico: elegir el grado mirando el conjunto de test, o proponer «un modelo lineal en vez de uno polinomial» sin decir cuál grado ni cómo se elige.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 8]; [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase6_Regresion.md · §6.5]; los puntos de la figura son aproximados. Repasar: Clase 5 · regresión · Clase 10 · brecha
Practica: una recta sobre los mismos 5 árboles tendría error de entrenamiento mayor que cero. ¿Por qué eso no la hace peor que el polinomio? ¿Qué conjunto hay que mirar?
Respuesta correcta y cómo se resuelve

Respuesta: un modelo se juzga por su error en datos que no vio. Para elegir entre la recta y el polinomio se mira el error en validación; el test se reserva para la evaluación final.

  1. Se ajusta cada candidato (grado 1, 2, …) con entrenamiento.
  2. Se mide cada uno en validación y gana el de menor error.
  3. Una recta que falla un poco en los 5 árboles pero predice bien el sexto le gana a un polinomio que da volumen negativo en DAP 37.

Error típico: elegir el grado con el test; deja de ser independiente (lámina 8).

8
Matriz de confusión desde una figura
Aplicar
Enunciado Para el siguiente modelo (línea verde punteada), calcule:
a) la matriz de confusión · b) exactitud · c) precisión · d) tasa de verdaderos positivos · e) tasa de falsos positivos

«Explicite cada supuesto que haga. Por ejemplo, a qué lado del modelo están los círculos, qué considera como positivo, etc.»

Durante el certamen el profesor indicó escribir esta respuesta en la pregunta 11 [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-28T22_09_14Z_Fundamentos_en_Ciencia_de_Datos.md · 0:12:32–0:14:47]. Abajo está el procedimiento completo, resuelto con la matriz oficial de la lámina 19.

Respuesta y análisis
Procedimiento
  1. Declarar la convención antes de contar: qué clase es positiva y qué lado de la línea predice positivo. Sin eso, «falso positivo» no significa nada.
  2. Contar VP, FN, FP y VN, asignando cada punto a una casilla.
  3. Verificar los marginales: VP + FN = P y FP + VN = N. Si no cuadran, hay un error de conteo.
  4. Aplicar las fórmulas de la lámina 18, con el denominador de cada métrica.
  5. Interpretar cada número en palabras del problema.
Resuelto con la matriz oficial de la lámina 19

Filas = etiqueta predicha, columnas = etiqueta real; positivo = círculo.

  1. a) Matriz: VP = 6, FP = 2, FN = 1, VN = 7. Marginales: P = 7, N = 9, total 16.
  2. b) Exactitud = (6 + 7) / 16 = 0,8125
  3. c) Precisión = 6 / (6 + 2) = 0,75
  4. d) TVP = 6 / 7 = 0,857
  5. e) TFP = 2 / 9 = 0,222
Qué decide la pregunta: precisión (÷ predichos positivos) ≠ TVP (÷ positivos reales) ≠ exactitud (÷ total); y TFP ≠ 1 − precisión. Si se invierte la clase positiva, la exactitud no cambia, pero precisión, TVP y TFP sí: por eso el enunciado exige declarar el supuesto.

Error típico: leer la matriz con la orientación de scikit-learn (filas = real) y cambiar el 2 por el 1: da precisión 6/7 y TVP 6/8, invertidas.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 17, 18 y 19]. Repasar: Clase 12 · matriz de confusión
Practica: con la matriz 3×3 de Galaxy Zoo de la Clase 12, toma como positiva la clase 0, calcula las métricas, invierte la convención y di cuál no cambia.
Respuesta correcta y cómo se resuelve

Respuesta: no cambia la exactitud (0,872). Cambian precisión, TVP y TFP.

  1. Positivo = clase 0: VP = 25, FN = 71, FP = 57, VN = 847 (P = 96, N = 904).
  2. Exactitud = 872 / 1.000 = 0,872; precisión = 25 / 82 = 0,305; TVP = 25 / 96 = 0,260; TFP = 57 / 904 = 0,063.
  3. Invertida: VP = 847, FN = 57, FP = 71, VN = 25. Exactitud = 0,872; precisión = 847 / 918 = 0,923; TVP = 847 / 904 = 0,937; TFP = 71 / 96 = 0,740.

Error típico: tomar esta exactitud binaria (0,872) como la del modelo de tres clases (0,774). [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · matriz de confusión]

9
TPR, FPR y curva ROC
1,0Analizar
Enunciado Calcule la razón de verdaderos positivos (TPR) y razón de falsos positivos (FPR) para los siguientes dos modelos utilizando los distintos umbrales de discriminación mostrados a continuación (línea verde para clasificar entre círculos y triángulos). ¿Qué modelo considera mejor y por qué?

La figura: 10 círculos y 5 triángulos. El Modelo 1 usa fronteras diagonales y el Modelo 2 fronteras horizontales, cada uno en cuatro umbrales.
Respuesta y análisis
Respuesta
El Modelo 1 es mejor: domina al Modelo 2. A igual tasa de falsos positivos recupera más positivos, en todos los umbrales. Es el mismo ejercicio de las láminas 22–23, y sus pares (TFP, TVP) son los de la lámina 23.
Cálculo del Modelo 1

Convención: círculo = positivo (P = 10), triángulo = negativo (N = 5); el lado inferior izquierdo de la línea predice positivo.

UmbralCírculos del lado positivoTriángulos del lado positivoTVP = VP/PTFP = FP/N
1300,30,0
2600,60,0
3810,80,2
41031,00,6

En el primer umbral, el Modelo 2 da TVP 0,2 con TFP 0,0: a igual TFP, recupera menos positivos que el Modelo 1 (0,3).

Por qué domina

Los datos se separan en diagonal: círculos abajo a la izquierda, triángulos arriba a la derecha. Las fronteras diagonales del Modelo 1 siguen esa separación; las horizontales del Modelo 2 solo cortan por x₂ y siempre arrastran errores. Si una curva ROC queda por encima de la otra, la conclusión no depende del umbral que se elija.

Si se quiere el área: con los cuatro puntos más (0,0) y (1,1), el AUC del Modelo 1 por trapecios es 0,2 · 0,70 + 0,4 · 0,90 + 0,4 · 1,00 = 0,900.

Qué decide la pregunta: comparar un punto de operación ≠ comparar un modelo. Un modelo es la curva completa, no un umbral.

Error típico: elegir por un solo umbral, comparar el umbral de un modelo con otro umbral del otro, o citar un AUC sin mostrar de dónde sale.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 22 y 23]: las tasas de la lámina 23 con P = 10 y N = 5 dan los conteos de la tabla. Repasar: Clase 14 · ROC y AUC
Practica: con P = 10 y N = 5, ¿qué par (TFP, TVP) tiene un clasificador que dice «círculo» a todo? ¿Y uno que dice «triángulo» a todo?
Respuesta correcta y cómo se resuelve

Respuesta: «círculo» a todo → (1,0; 1,0); «triángulo» a todo → (0,0; 0,0). Son las dos esquinas donde empieza y termina toda curva ROC.

  1. «Círculo» a todo: VP = 10 y FP = 5 → TVP = 10/10 = 1, TFP = 5/5 = 1.
  2. «Triángulo» a todo: VP = 0 y FP = 0 → TVP = 0, TFP = 0.
  3. Un clasificador al azar cae sobre la diagonal (TVP = TFP); uno útil queda por encima.

Error típico: creer que «círculo a todo» es bueno porque su TVP es 1: su TFP también es 1.

10
«Punto base»
Enunciado «Punto base». Selección múltiple con cuatro alternativas en imagen.
Respuesta y análisis
Respuesta
No había que responder nada. Así lo indicó el profesor durante el certamen:
«Una consulta que llegue unos minutos atrás a la pregunta 10 que hice punto base. No tienen que responder nada. Y si ya le puse una alternativa. […] Da lo mismo, da lo mismo.» Sesión del Certamen 2, 28-ago · 2:01:12–2:01:28 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-28T22_09_14Z_Fundamentos_en_Ciencia_de_Datos.md]
11
Comentarios y supuestos
0Evaluar
Enunciado Ingrese aquí cualquier comentario o supuesto que haya hecho.
Respuesta y análisis
Qué escribir
  1. La convención de clase positiva usada en la matriz y en la ROC.
  2. Las lecturas aproximadas de las figuras (por ejemplo, los puntos de la pregunta 7).
  3. Lo que no se pudo determinar, y por qué.
  4. En este certamen, además, la respuesta de la pregunta 8, porque el profesor pidió escribirla aquí.
Respuesta modelo «(1) En la matriz y en la ROC tomé los círculos como clase positiva y el lado inferior izquierdo de la línea como predicción positiva. (2) En la pregunta 7 leí los cinco árboles de la figura a ojo, y deduje el grado del polinomio por la forma de la curva. (3) En la ROC supuse que los cuatro paneles de cada modelo son el mismo modelo con cuatro umbrales, sobre los mismos quince puntos.»
Qué evalúa: declarar un supuesto o un vacío ≠ rellenarlo con algo plausible. Es la misma conducta que premia la 9B del Certamen 1.

Error típico: dejar el campo vacío o escribir «no hice supuestos»: la matriz no tiene sentido sin declarar cuál clase es positiva.

Cómo armar esta respuesta en cualquier certamen

Recorre cada respuesta y pregúntate «¿qué usé que el enunciado no me dio?». Salen tres tipos: convenciones (qué es positivo), lecturas aproximadas (valores tomados de una figura) e interpretaciones del enunciado (qué representa cada panel). [DATITO]

Las trampas de este certamen

TrampaDóndePregunta que la desarma
Cantidad presentada como calidad1¿Aporta algo distinto o es más de lo mismo?
Dirección invertida en una afirmación plausible3, opción 1¿Más filas o más columnas?
Criterio de entrenamiento ofrecido como métrica4, ganancia de pureza¿Sirve para construir o para evaluar?
Afirmación contraria a la lámina5, opción 1¿Qué dice la lista de «para qué son malos»?
Verdad histórica que no responde la pregunta6, la nube¿Qué acota el enunciado? «Mediante redes neuronales»
Ajuste perfecto presentado como buen ajuste7¿Cuántos parámetros contra cuántos datos? ¿Qué dice la física?
Comparar modelos en un solo punto9Un modelo es una curva, no un umbral

Cierre de la Clase 21 · Distinciones del Certamen 2

Qué aprendiste

  • Sobreajuste, validación y ensambles pesan 36 %; métricas de clasificación, 27 %.
  • Todo es resoluble a mano, en papel.

Qué no debes confundir

  • Comparar un punto ≠ comparar un modelo (P9).
  • FPR ≠ 1 − precisión (P8).
  • Número de modelos ≠ diversidad (P1).

Procedimiento para el papel

  1. Identifica el formato: verdadero/falso, «cuál es incorrecta», varias correctas, figura o cálculo.
  2. Nombra la distinción.
  3. Resuelve por el mecanismo y ancla con la cifra.

Viene de: Clase 20 · Distinciones del Certamen 1 · Sigue: Clase 22 · Transferencia: ¿qué problema tengo delante?

Vuelve a tu activación: Antes de abrir cada ficha: escribe la distinción que crees que decide la pregunta. ¿Cambiarías tu respuesta?

Pregunta final. ¿Qué distinción decide la P9 del Certamen 2?
Respuesta correcta y cómo se resuelve

Comparar un punto de operación ≠ comparar un modelo: un modelo es una curva ROC completa. [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §1]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 22 · Transferencia: ¿qué problema tengo delante?