Objetivo. Construir y leer una matriz de confusión, y pasar de tasas a conteos en una población.
- Evidencia de aprendizaje: Construye la matriz desde un enunciado y verifica que los totales cierren.
- Actividad final: El ejercicio de los 100 pacientes, que el profesor llamó «lo más importante del curso».
- Criterio de dominio: Declara la clase positiva, lee los rótulos de filas y columnas, y llega a 36 positivos en el ejercicio del profesor.
Matriz de confusión y sus métricas
Fundamentos de Ciencia de Datos · UdeC
Tensión declarada: pesa mucho en la evaluación —la ficha P8 del Certamen 2 (cálculo de métricas desde la matriz, en
07_DATITO/06_AUDITORIAS/patron_evaluacion.md)
pide calcularlo a mano: certamen_2.html#p8— y desbloquea solo dos
conceptos: metricas_clasificacion.html y
roc_auc.html. Rinde puntos; no es de los que sostienen el programa.Notación: VP / FP / FN / VN, como en las láminas (en inglés y en scikit-learn: TP / FP / FN / TN) [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 17].
1 · El problema, sin matemáticas
Un laboratorio analiza mamografías con un modelo que responde una sola cosa: ¿hay cáncer, sí o no? (Caso simulado [DATITO]: los números salen de los sliders, no de un dataset. El ejercicio real del profesor con pacientes está en el §6.)
Dos respuestas posibles, dos realidades posibles. Solo pueden pasar cuatro cosas, y esas cuatro cosas son la matriz de confusión.
SÍ hay cáncer
NO hay cáncer
SÍ tiene
NO tiene
Respuesta correcta y cómo se resuelve
Respuesta: la precisión baja, aunque el modelo no cambie.
Cómo se resuelve (1.000 pacientes, detecta 80 % de las enfermas, descarta 90 % de las sanas): con 5 % de enfermas hay 50 enfermas y 950 sanas → VP = 0,8 × 50 = 40, FP = 0,1 × 950 = 95, precisión = 40/135 ≈ 0,296. Con 1 % hay 10 enfermas y 990 sanas → VP = 8, FP = 99, precisión = 8/107 ≈ 0,075. Los VP salen de un grupo que se achica; los FP, de uno que crece.
Error típico: «no cambia, porque el modelo es el mismo». Lo que es del modelo son la sensibilidad y la tasa de falsas alarmas; la precisión mezcla el modelo con cuántas enfermas hay.
Fuente: cifras de los sliders, simuladas [DATITO]; fórmula de precisión: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].
Respuesta correcta y cómo se resuelve
Respuesta: los falsos negativos bajan.
Cómo se resuelve: cada enferma termina como VP o como FN, así que VP + FN = total de enfermas, fijo. Con 10 enfermas: si detecta 80 %, VP = 8 y FN = 2; si detecta 90 %, VP = 9 y FN = 1.
Error típico: pensar que los FN dependen de las sanas. Los FN salen solo de la fila de las enfermas.
Fuente: [DATITO]; definición de FN: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 17].
Respuesta correcta y cómo se resuelve
Respuesta: se resiente la precisión; la sensibilidad no se mueve.
Cómo se resuelve: descartar peor a las sanas produce más FP, y FP está en el denominador de la precisión, VP/(VP+FP), pero no en el de la sensibilidad, VP/(VP+FN). Con 10 enfermas, 990 sanas y sensibilidad 80 %: si descarta 90 % de las sanas, FP = 99 y precisión = 8/107 ≈ 0,075; si descarta 80 %, FP = 198 y precisión = 8/206 ≈ 0,039. La sensibilidad sigue en 0,80.
Error típico: elegir «la sensibilidad» porque «el modelo empeoró». Hay que mirar qué casilla cambió y en qué fórmula aparece.
Fuente: [DATITO]; fórmulas: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].
2 · Las cuatro casillas, en el laboratorio
Antes de contar nada hay que decidir qué es «positivo». Aquí: positivo = tiene cáncer. Es una convención, no una opinión sobre qué clase importa más:
Si das vuelta la convención, las casillas cambian de nombre (los FP pasan a ser FN y viceversa) y precisión, recall y FPR cambian de valor; la exactitud no. Por eso se escribe la convención antes de calcular.
| Sigla | Qué pasó | Consecuencia real |
|---|---|---|
| VP | Tenía cáncer y el modelo lo detectó | Se trata a tiempo |
| VN | No tenía y el modelo dijo que no | Se va tranquila a casa |
| FP | No tenía, pero el modelo dijo que sí | Falsa alarma. Angustia y biopsia innecesaria |
| FN | Sí tenía, y el modelo dijo que no | Cáncer no detectado. El error grave |
| Real: círculo | Real: triángulo | |
|---|---|---|
| Predicho: círculo | 6 (VP) | 2 (FP) |
| Predicho: triángulo | 1 (FN) | 7 (VN) |
05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase7_Clasificacion.md
3 · Las fórmulas, desarmadas
Las cinco métricas usan casi los mismos números. Lo único que las separa es entre qué dividen, y eso equivale a qué pregunta responden. Definiciones oficiales: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18]. El trabajo con el umbral y con F1 sigue en metricas_clasificacion.html.
| Símbolo | Qué es | Rol |
|---|---|---|
| VP | Enfermas que el modelo marcó bien | se cuenta |
| FP | Sanas que el modelo marcó por error | se cuenta |
| VP + FP | Todo lo que el modelo marcó como positivo | lo decide el modelo |
La pregunta que responde: de todo lo que marqué, ¿cuánto era de verdad? El denominador es una decisión del modelo, no un hecho del mundo.
| Símbolo | Qué es | Rol |
|---|---|---|
| VP | Enfermas detectadas | se cuenta |
| FN | Enfermas que se escaparon | se cuenta |
| VP + FN | Todas las enfermas que existían | es un dato del mundo |
La pregunta: de todas las que estaban enfermas, ¿a cuántas encontré? El denominador no depende del modelo: existía antes de que el modelo opinara.
| Símbolo | Qué es | Rol |
|---|---|---|
| FP | Sanas marcadas por error | se cuenta |
| VN | Sanas correctamente descartadas | se cuenta |
| FP + VN | Todas las sanas que existían | es un dato del mundo |
4 · Camino inverso: te dan la fórmula
En la prueba no te van a dar el laboratorio: te van a dar esto escrito en el papel. Haz el recorrido al revés.
1 · ¿Qué universo es el denominador?
Respuesta correcta y cómo se resuelve
Respuesta: FP + VN son todas las personas que realmente no tenían la enfermedad (los negativos reales, N).
Cómo se resuelve: busca qué tienen en común las dos casillas. FP = sana marcada como enferma; VN = sana marcada como sana. Las dos son sanas: juntas son la fila completa de las sanas. Es un dato del mundo: no cambia si cambias el modelo.
Error típico: leer «FP + VN» como «todo lo que el modelo marcó como negativo». Eso sería FN + VN.
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].
2 · ¿Qué mide entonces el cociente?
Respuesta correcta y cómo se resuelve
Respuesta: de todas las sanas, qué proporción recibió una falsa alarma: la tasa de falsos positivos.
Cómo se resuelve: numerador = las sanas que el modelo marcó mal (FP); denominador = todas las sanas (FP + VN). Con la lámina 19: 2 triángulos marcados como círculo de 9 triángulos → 2/9 ≈ 22,2 %.
Error típico: decir «la proporción de errores del modelo». Los errores totales son (FP + FN)/total; la FPR solo mira a las sanas.
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 18–19].
3 · ¿Por qué NO es «uno menos la precisión»?
Respuesta correcta y cómo se resuelve
Respuesta: porque la FPR divide por las sanas reales y la precisión divide por lo que el modelo marcó como positivo: son universos distintos, así que no se complementan.
| Denominador | ¿De quién depende? | |
|---|---|---|
| FPR | FP + VN — las sanas reales | Del mundo |
| Precisión | VP + FP — lo marcado positivo | Del modelo |
Cómo se comprueba: lámina 19 → precisión = 6/8 = 75 %, así que 1 − precisión = 2/8 = 25 %; pero FPR = 2/9 ≈ 22,2 %. Mismo numerador (FP = 2), denominadores distintos (8 contra 9). Mueve cualquier slider de arriba y verás que FPR + Precisión ≠ 1 casi siempre.
Error típico: restar de 1 porque «las dos hablan de falsas alarmas». Es la trampa exacta de la ficha P8 del Certamen 2 (certamen_2.html#p8).
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 18–19]; distinción P8: [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1].
4 · ¿Y qué sí es «uno menos» algo?
Respuesta correcta y cómo se resuelve
Respuesta: FPR = 1 − especificidad, porque la especificidad, VN/(FP+VN), divide por las mismas sanas reales.
Cómo se resuelve: mismo denominador, numeradores complementarios: FP + VN = N, así que FP/N + VN/N = 1. Con la lámina 19: 2/9 + 7/9 = 1. La regla general: solo se pueden restar de 1 dos métricas que compartan denominador.
Error típico: creer que cualquier par de métricas «opuestas» se complementa (precisión y FPR, recall y precisión).
Fuente: [INFERENCIA] a partir de las fórmulas de la lámina 18; la especificidad no aparece en la lámina 18; en clase solo la nombró un compañero, y el profesor le respondió que se estaba adelantando [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:50:00–0:50:15].
5 · Por qué la exactitud engaña
Pulsa «El modelo tonto» arriba: un modelo que dice «ninguna tiene cáncer» a todo el mundo. Mira su exactitud. Después su sensibilidad.
6 · El ejercicio del profesor: 20 de cada 100
El 4-sep, en las presentaciones del Hito 2, un grupo de compañeros mostraba un clasificador de tumores (positivo = maligno). El profesor los detuvo y les pidió traducir sus métricas a pacientes reales:
Un compañero preguntó si esos 100 eran el conjunto de entrenamiento. El profesor dijo que no: son los pacientes a los que se les va a aplicar el modelo [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:29:33–1:29:57].
Parte A · precisión 100 %, recall ~90 %
El modelo del grupo (random forest) tenía precisión 100 % y recall ⚠ ~90 %: en pantalla era ~90,5 % y el profesor lo redondeó a 90 % para que la cuenta saliera fácil [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:33:43–1:34:09].
Parte B · un punto de la curva ROC
Después señaló, con una flecha, un punto de la curva ROC del mismo grupo:
Respuesta correcta y cómo se resuelve
Respuesta: son 16 falsos positivos: 16 personas sin cáncer a las que el modelo les dice que tienen cáncer.
Cómo se resuelve: FPR = FP / (FP + VN) = FP / N. Despejas: FP = FPR × N = 0,2 × 80 = 16. Como sale de multiplicar por N (los que no tienen cáncer), solo pueden ser VN o FP; y como son los que el modelo marcó como positivos, son FP.
Error típico: llamarlos «falsos negativos», que es exactamente lo que se respondió en clase [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:14–1:42:21]. Un falso negativo es un enfermo que el modelo deja ir; esos salen de la fila de los 20, no de los 80. Otro error: multiplicar la FPR por 20 o por 100 en vez de por N = 80.
Fuente: la FPR y los 16 son del profesor (cita de arriba y [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:36–1:43:45]); la fórmula, [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].
Ejercicio de cálculo y producción. Con papel, sin mirar abajo:
- Arma la matriz de la Parte A sobre los 100 pacientes (filas = real).
- Arma la matriz de la Parte B.
- Para cada una: ¿cuántos pacientes reciben un informe que dice «cáncer»? ¿Cuántos de esos no lo tienen? ¿Cuántos enfermos se van a casa sin diagnóstico? ¿Cuál es la precisión?
- Explícale al médico, en tres frases y sin siglas, qué cambia entre A y B.
Respuesta correcta y cómo se resuelve
Respuesta en una frase: con A el médico recibe 18 informes de cáncer, todos verdaderos, y 2 enfermos se van sin diagnóstico; con B recibe 36 informes de cáncer, 16 de ellos de personas sanas, y ningún enfermo se va sin diagnóstico.
Paso 1 · la población. P = 20 (con cáncer), N = 80 (sin cáncer), total 100.
Paso 2 · Parte A (precisión 1, recall 0,9). Recall = VP / P → VP = 0,9 × 20 = 18; FN = 20 − 18 = 2 (en clase: «detectaría 18», «perdería 2» [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:34:21–1:34:37]). Precisión = VP / (VP + FP) = 1 → FP = 0; VN = 80 − 0 = 80 [INFERENCIA].
| Dice: cáncer | Dice: sano | total | |
|---|---|---|---|
| Tiene cáncer | VP 18 | FN 2 | 20 |
| No tiene | FP 0 | VN 80 | 80 |
| total | 18 | 82 | 100 |
Informes con «cáncer»: 18, todos correctos (precisión 18/18 = 1). Enfermos sin diagnóstico: 2.
Paso 3 · Parte B (TPR 1, FPR 0,2). TPR = VP / P → VP = 1 × 20 = 20; FN = 0. FPR = FP / N → FP = 0,2 × 80 = 16; VN = 80 − 16 = 64 [INFERENCIA].
| Dice: cáncer | Dice: sano | total | |
|---|---|---|---|
| Tiene cáncer | VP 20 | FN 0 | 20 |
| No tiene | FP 16 | VN 64 | 80 |
| total | 36 | 64 | 100 |
La respuesta del profesor:
Precisión de B = VP / (VP + FP) = 20/36 ≈ 0,556 [DATITO] (esta cifra no se dijo en clase): de cada 9 informes con «cáncer», 5 son reales y 4 no.
Paso 4 · comparar.
| A · precisión 1, recall 0,9 | B · TPR 1, FPR 0,2 | |
|---|---|---|
| Enfermos detectados | 18 de 20 | 20 de 20 |
| Enfermos que se van sin diagnóstico | 2 | 0 |
| Sanos con informe de «cáncer» | 0 | 16 |
| Informes con «cáncer» en total | 18 | 36 |
| Precisión | 1 | ≈ 0,556 |
Respuesta modelo para la frase 4 [DATITO]: «Doctor, de cada 100 pacientes suyos, 20 tienen cáncer. Con la primera configuración, el sistema le marca 18 como cáncer y acierta en todos, pero 2 personas con cáncer se van a casa con un informe que dice que están sanas. Con la segunda, no se le escapa ningún enfermo, pero le llegan 36 informes de cáncer y 16 son de personas sanas que tendrán que repetirse el examen; usted decide qué le cuesta más.»
Tu versión está bien si habla de pacientes (18, 2, 16, 36) y no de porcentajes sueltos; si no confunde «informes positivos» (36) con «enfermos» (20); y si deja la decisión al médico.
Errores típicos (los reales de la clase): no usar N = 80 al pasar la FPR a pacientes —costó varios minutos llegar a «los negativos son 80» [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:37:32–1:40:45]—; llamar «falsos negativos» a los 16 [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:14–1:42:21]; y decir que el médico recibe 20 informes de cáncer en B, olvidando sumar los 16 falsos positivos a los 20 verdaderos.
Fuente: planteo, tasas, 18/2, 16 y 36 del profesor (citas y marcas de arriba); FP = 0 y VN = 80 en A, VN = 64 en B: [INFERENCIA]; precisión de B y respuesta modelo: [DATITO].
Un compañero propuso resolverlo «más fácil» con una matriz. La respuesta:
Lo que eso significa [INFERENCIA]: los conteos de la matriz del informe vienen del reparto de clases del test, que no tiene por qué ser 20/80. Lo que sí viaja del test a la realidad son las tasas (TPR, FPR). Por eso se multiplica la tasa por la P o la N de la población donde se aplica el modelo, y recién ahí se arma una matriz nueva, la de los 100 pacientes.
Otro compañero dijo que le costaba asociar maligno con «positivo». El profesor:
Y sobre el peso de este ejercicio en el curso, en sus palabras:
La Parte B es un punto de operación de la curva ROC: otro punto de la misma curva daría otra matriz. Eso se trabaja en roc_auc.html y es la distinción de la ficha P9 (certamen_2.html#p9).
Variante de nivel 2 · minería (cifras ilustrativas [DATITO])
Una mina revisa 200 camiones de extracción por semana y 10 tienen una falla incipiente de rodamiento. El modelo opera en un punto con TPR 0,9 y FPR 0,1. ¿Cuántos camiones manda a taller, cuántos de esos estaban bien, cuántas fallas se escapan y cuál es la precisión?
Respuesta correcta y cómo se resuelve
Respuesta: manda 28 camiones a taller, 19 de ellos estaban bien, se escapa 1 falla y la precisión es 9/28 ≈ 32 %.
Cómo se resuelve: P = 10, N = 200 − 10 = 190. VP = TPR × P = 0,9 × 10 = 9; FN = 10 − 9 = 1. FP = FPR × N = 0,1 × 190 = 19; VN = 190 − 19 = 171. A taller: VP + FP = 9 + 19 = 28. Precisión = 9/28 ≈ 0,32.
| A taller | Sigue operando | total | |
|---|---|---|---|
| Con falla | VP 9 | FN 1 | 10 |
| Sin falla | FP 19 | VN 171 | 190 |
La lectura: con una FPR de «solo» 10 %, dos de cada tres camiones que van a taller estaban bien, porque los sanos son 19 veces más que los fallados. Es el mismo mecanismo que la Parte B.
Error típico: multiplicar la FPR por 200 (el total) en vez de por 190 (los sanos), o leer «FPR 10 %» como «el 10 % de lo que va a taller está bien» (eso sería 1 − precisión, que aquí es 68 %).
Fuente: cifras ilustrativas [DATITO]; fórmulas de TPR y FPR: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].
7 · Tercer caso: tus galaxias
La mamografía enseña una cosa que Galaxy Zoo no: que un falso positivo y un falso negativo cuestan distinto. Pero tiene un límite — solo tiene dos clases.
Tu desafío tiene tres, y con eso aparecen dos ideas nuevas: cómo se ve una matriz de 3×3, y qué significa promediar métricas por clase.
02_DATOS/GZ_mini_challenge_train.csv · resultados de
08_PROYECTO_FCD/Desafio/REPORT.md
El reparto de clases, antes de mirar el modelo
| Clase | Qué es | Filas | % |
|---|---|---|---|
| 0 | No decidible · los humanos no se pusieron de acuerdo | 96 | 9,6 % |
| 1 | Espiral | 227 | 22,7 % |
| 2 | Elíptica | 677 | 67,7 % |
Respuesta correcta y cómo se resuelve
Respuesta: un 67,7 %.
Cómo se resuelve: si responde siempre «elíptica», acierta exactamente en las galaxias que son elípticas y falla en todas las demás: exactitud = 677/1.000 = 0,677.
Error típico: «33 %, porque hay tres clases». Eso solo vale si las clases vinieran en partes iguales; aquí el reparto es 96 / 227 / 677.
Fuente: reparto de clases de 02_DATOS/GZ_mini_challenge_train.csv [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]; el cálculo es [INFERENCIA].
Tu matriz real, 3×3
Con tres clases la matriz crece, pero se lee igual. El profesor lo planteó así al presentarla:
En tus galaxias pasa lo mismo: la clase 0 («no decidible») se confunde con espirales y elípticas porque está hecha de galaxias entre las dos [INFERENCIA]. La matriz no solo cuenta errores: te dice con qué se confunde cada clase.
Filas = lo que la galaxia era. Columnas = lo que el modelo dijo. Pulsa una celda.
| pred 0 | pred 1 | pred 2 | total real | |
|---|---|---|---|---|
| real 0 | 25 | 36 | 35 | 96 |
| real 1 | 18 | 176 | 33 | 227 |
| real 2 | 39 | 65 | 573 | 677 |
| total predicho | 82 | 277 | 641 | 1.000 |
Las métricas, por clase
| Clase | Precisión | Sensibilidad | F1 | Cómo sale la precisión |
|---|---|---|---|---|
| 0 | 0,3049 | 0,2604 | 0,2809 | 25 / 82 |
| 1 | 0,6354 | 0,7753 | 0,6984 | 176 / 277 |
| 2 | 0,8939 | 0,8464 | 0,8695 | 573 / 641 |
Y ahora la comparación que importa
La exactitud dice 77,4 %, que suena bien. Pero el modelo tonto —responder siempre «elíptica»— ya saca 67,7 %. Todo el trabajo del modelo aporta menos de 10 puntos de exactitud.
El F1-macro dice 0,6163 y es más honesto, porque promedia las tres clases por igual. La clase 0 tiene F1 0,2809 — y arrastra el promedio hacia abajo en vez de esconderse detrás del 67,7 % de la clase mayoritaria.
La clase 0 no es «otro tipo de galaxia»: es «los votos humanos estaban divididos». Sus fracciones de voto medias son 0,356 y 0,271 — ninguna domina.
El modelo tendría que aprender a reconocer ausencia de consenso, que es una señal mucho más débil que una forma. Con 96 ejemplos de 1.000, no alcanza.
8 · Procedimiento para el papel
1. Declarar cuál es la CLASE POSITIVA "positivo = tiene cáncer" 2. Leer los RÓTULOS de la matriz ¿filas = real o filas = predicho? 3. Localizar positivos reales y positivos predichos 4. Escribir VP, VN, FP, FN 5. Verificar que los marginales cierren filas, columnas y total 6. Identificar qué métrica piden 7. Escribir la FÓRMULA antes de sustituir 8. Sustituir, calcular 9. Interpretar en palabras del problema pacientes, camiones, galaxias
- Sumar una fila sin mirar los rótulos (lámina 19: filas = predicho). FP y FN se cruzan.
- Calcular sin declarar la clase positiva. «Maligno = positivo» o al revés da la misma discusión, pero otros números.
- Multiplicar una tasa por el grupo equivocado: la FPR va por N (los negativos reales), el recall por P. En el ejercicio del 4-sep, costó llegar a N = 80.
- Llamar falso negativo a un falso positivo. El nombre dice primero si acertó (verdadero/falso) y después qué dijo el modelo (positivo/negativo).
- Copiar los conteos del test a la población real. Viajan las tasas, no los conteos.
- Restar de 1 dos métricas que no comparten denominador (FPR ≠ 1 − precisión).
- Reportar exactitud con clases desbalanceadas sin compararla con el modelo tonto.
Un compañero sostiene: «si la precisión es 75 %, entonces el FPR es 25 %, porque uno menos precisión da la tasa de error».
¿Tiene razón? Justifícalo con los denominadores, y comprueba tu respuesta moviendo los sliders.
Poder explicárselo a otro es la prueba de que lo entiendes. Y el formato de verdadero o falso con justificación es el que usan los certámenes [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §3].
Respuesta correcta y cómo se resuelve
Respuesta: no tiene razón: una precisión de 75 % no permite saber la FPR, porque las dos dividen por grupos distintos.
Cómo se resuelve: 1 − precisión = FP/(VP + FP), dividido por lo que el modelo marcó como positivo. FPR = FP/(FP + VN), dividido por los negativos reales. Con la lámina 19, la precisión es justo 75 % (6/8): 1 − precisión = 2/8 = 25 %, pero FPR = 2/9 ≈ 22,2 %. Y en el ejercicio de la mina (§6), 1 − precisión ≈ 68 % con FPR = 10 %.
Respuesta modelo [DATITO]: «No. El 25 % que sale de 1 − precisión es la parte de las alarmas que eran falsas: divide por lo que el modelo marcó. La FPR es la parte de los negativos que recibieron una alarma: divide por todos los negativos reales. Tienen el mismo numerador, los falsos positivos, pero distinto denominador, así que solo coinciden por casualidad. En la lámina 19 dan 25 % y 22,2 %.»
Error típico: aceptar la frase porque 25 % y 22,2 % «se parecen». Cerca no es igual, y con otra prevalencia se separan muchísimo.
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 18–19]; respuesta modelo [DATITO]. Llévala a Datito si quieres que te corrija la tuya.
metricas_clasificacion.html— los denominadores de cada métrica, el umbral que las mueve y F1 (macro y weighted).roc_auc.html— la Parte B del ejercicio del profesor es un punto de una curva ROC; ahí se recorren todos.- Dónde se pregunta, según las fichas de
07_DATITO/06_AUDITORIAS/patron_evaluacion.md: P4 (qué cantidad describe un clasificador), P8 (cálculo de métricas desde la matriz) y P9 (punto de operación ≠ modelo). Tres fichas salen de este artefacto. triaje_de_problemas.html— antes de elegir métrica hay que saber si las clases están equilibradas. El árbol te lleva justo a esa bifurcación.train_validation_test.html— sobre qué conjunto se calcula la matriz. Calcularla sobre entrenamiento no mide nada.
Cierre de la Clase 12 · Matriz de confusión
Qué aprendiste
- Cuatro casillas: VP, FP, FN, VN.
- Qué clase es la positiva es una convención que se declara.
- La matriz solo describe el conjunto de test, no la realidad.
- Una tasa multiplicada por la población da un conteo.
Qué no debes confundir
- Filas = real ≠ filas = predicho: lee los rótulos (la lámina 19 pone lo predicho en las filas).
- Falso positivo ≠ falso negativo.
- Test ≠ realidad.
Procedimiento para el papel
- Declara la clase positiva.
- Ubica los positivos reales y los positivos predichos.
- Obtén VP, FP, FN y VN, y verifica que los totales cierren.
Viene de: Clase 11 · Clasificación: cuando la etiqueta no es un número · Sigue: Clase 13 · Precisión, sensibilidad, exactitud y F1
Vuelve a tu activación: De 100 pacientes, 20 tienen cáncer. Un modelo tiene TPR 1 y FPR 0,2. ¿A cuántos les dirá que tienen cáncer? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
FP = 0,2 × 80 = 16; precisión = 20/36 ≈ 0,56. El profesor llegó a los 16 y los 36; la precisión no la dijo en clase [DATITO]. [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:36]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.