Unidad 4 · Clasificar y evaluarClase 13 de 23
Clase 13 · Precisión, sensibilidad, exactitud y F1

Objetivo. Calcular exactitud, precisión, sensibilidad, FPR y F1 eligiendo el denominador correcto, e interpretarlas.

Ficha Bloom · Analizar
  • Evidencia de aprendizaje: Calcula las cinco métricas desde la lámina 19 e interpreta cada una en palabras del problema.
  • Actividad final: El caso del pescado: redactar recall y precisión sin ambigüedad.
  • Criterio de dominio: Escribe la fórmula antes de sustituir y distingue FPR de 1 − precisión.
Activación. Una alarma de fallas tiene recall 100 % y precisión 70 %. ¿Qué significa eso para el operador de la máquina? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Accuracy, precisión, recall y F1

Las cuatro comparten casi el mismo numerador. Lo que las separa es por qué dividen.

Datito · concepto 12 del currículum · prerrequisito: matriz de confusión

clasificación→ matriz de confusión→ accuracy · precisión · recall · F1→ ROC y AUC

Estructura tomada de 07_DATITO/curriculum.yaml (campo prerrequisitos). La matriz de confusión se construye paso a paso en matriz_confusion.html: aquí se usa. Lo que viene después —recorrer todos los umbrales— está en roc_auc.html.

Notación: VP / FP / FN / VN, como en las láminas (en inglés y en scikit-learn: TP / FP / FN / TN). [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 17]

1 · La situación, antes de cualquier fórmula

Una planta tiene una máquina cara. Un modelo de detección de anomalías avisa cuándo va a fallar. Tú frenas la máquina cuando avisa.

Hay dos formas distintas de que el modelo te arruine el día, y no cuestan lo mismo:

Si alguien te dice «el modelo acierta el 99 % de las veces», todavía no sabes nada de lo que te importa. Necesitas saber cuál de los dos errores está cometiendo. Ese es el trabajo completo de estas cuatro métricas: no dan una nota al modelo, reparten la culpa.

La idea que hay que llevarse Las cuatro métricas se construyen con las mismas cuatro casillas. La única decisión de fondo es sobre qué grupo estás preguntando: sobre lo que era positivo, sobre lo que dijiste que era positivo, sobre lo que era negativo, o sobre el total. Ese grupo es el denominador.

2 · Cuatro casillas, cuatro denominadores

Las cuatro casillas se construyen paso a paso en matriz_confusion.html#casillas; aquí nos enfocamos en denominadores, umbral y F1.

Convención, y hay que escribirla siempre antes de calcular: positivo = círculo (en la historia de la máquina: círculo = iba a fallar). Los conteos son los de la matriz oficial de la lámina 19, la que el profesor armó en clase con 16 objetos.

Aprieta una métrica y mira qué casillas se encienden. Esas casillas sumadas son su denominador.

Dije: círculo
Dije: triángulo
Era:
círculo
VP6Círculo, y dije círculo
FN1Círculo que se me escapó
Era:
triángulo
FP2Triángulo que llamé círculo
VN7Triángulo, y dije triángulo
Elige una métrica arriba Ninguna seleccionada todavía. Fíjate en que las cuatro casillas son las mismas para todas: lo que cambia es cuáles entran en el denominador.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 19] Matriz oficial: VP 6, FP 2, FN 1, VN 7 (16 objetos; 7 círculos reales, 9 triángulos reales). Los mismos conteos los dicta el profesor en la Clase del 7-ago [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:46:58–0:47:52].

Ojo con la orientación. Aquí las filas son lo real y las columnas lo predicho (la convención de scikit-learn). En la lámina 19 es al revés: filas = etiqueta predicha, columnas = etiqueta real. Así se ve en su orientación original:
Real: círculoReal: triángulo
Predicho: círculo6 (VP)2 (FP)
Predicho: triángulo1 (FN)7 (VN)
Los números son los mismos; cambia dónde está cada uno. Lee los rótulos antes de sumar una fila. El detalle está en matriz_confusion.html#lamina19. [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 19] · orientación confirmada en la tabla de la lámina 19 de 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase7_Clasificacion.md
Corrección de este visual (21-sep). Antes este ejemplo usaba VP 12 · FN 3 · FP 4 · VN 31 presentados como «los del Certamen 2». No lo son: la figura del enunciado no está en el repositorio y esos conteos no son derivables de ningún archivo [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · ficha P8]. Se reemplazaron por la matriz oficial de la lámina 19. Del Certamen 2 queda el procedimiento, no los números: certamen_2.html#p8.
La distinción que decide el certamen · ficha P8 Precisión divide por lo que predijiste. Recall divide por lo que realmente era. Exactitud divide por el total. FPR divide por los negativos reales. La pregunta de cálculo desde la matriz (P8 en 07_DATITO/06_AUDITORIAS/patron_evaluacion.md) no premia recitar las definiciones: premia elegir bien el denominador cuando los cuatro números están a la vista y todos «calzan». Ver certamen_2.html#p8.

3 · Las fórmulas, desarmadas

Las fórmulas símbolo por símbolo están en matriz_confusion.html#formulas; aquí nos enfocamos en denominadores, umbral y F1. Definiciones oficiales: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].

Cada fila responde a una pregunta distinta en castellano. Si sabes decir la pregunta, la fórmula se reconstruye sola.

MétricaLa pregunta que respondeDenominadorAquí
Exactitud
accuracy
De todo lo que revisé, ¿qué porcentaje clasifiqué bien? el total (16) (6+7)/16
= 81,25 %
Precisión De lo que mi modelo marcó como círculo (falla), ¿qué porcentaje lo era de verdad? los predichos positivos (8) 6/8
= 75,0 %
Recall
= TPR = sensibilidad
De los círculos (fallas) que realmente había, ¿cuántos alcancé a recuperar? los positivos reales (7) 6/7
≈ 85,7 %
FPR
tasa de falsos positivos
De las veces que no había nada (triángulos), ¿en cuántas frené la máquina al cohete? los negativos reales (9) 2/9
≈ 22,2 %
F1 ¿Puedo resumir precisión y recall en un número que castigue si una de las dos está mala? media armónica de las dos 2·6/(12+2+1)
= 80,0 %

Qué es dato, qué aprende el modelo, qué decides tú

PiezaDe dónde sale
La etiqueta real (era falla / no era)Dato. Viene del mundo, no del modelo. Sin ella no hay matriz.
La probabilidad que el modelo asigna a cada casoLo aprende el modelo durante el entrenamiento.
La clase positivaLa decides tú. Si cambias cuál es la positiva, precisión, recall y FPR cambian. La exactitud no.
El umbral sobre esa probabilidadLo decides tú. El 0,5 por defecto es una costumbre, no una ley.
Qué métrica reportasLa decides tú, según qué error cuesta más plata o más vidas.
Consecuencia inmediata Precisión, recall y FPR no son propiedades del modelo. Son propiedades del modelo a un umbral. Cambias el umbral y cambian las tres. Eso es justo lo que vas a mover ahora.

4 · El umbral: el control que mueve todo

Abajo hay 200 revisiones. El modelo le puso a cada una una probabilidad de falla, de izquierda (baja) a derecha (alta).

Usamos la misma notación que el profesor dibujó en la pizarra: círculos = positivos reales (iban a fallar), triángulos = negativos reales (estaban bien). Todo lo que quede a la derecha del umbral lo declaras «va a fallar».

Convención de todo este visual [DATITO]: positivo si el puntaje ≥ umbral (lo que queda a la derecha de la línea). Entonces subir el umbral = mover la línea a la derecha = declaras menos positivos → TPR y FPR bajan (o se quedan igual). Bajar el umbral = moverla a la izquierda → TPR y FPR suben (o se quedan igual). Nunca se mueven en sentidos opuestos. Si una figura de certamen pone el positivo a la izquierda de la línea, todo esto se invierte: por eso la convención se escribe antes de calcular.

Antes de tocar nada — si bajas el umbral, o sea declaras «va a fallar» con menos evidencia: ¿qué le pasa al recall y a la precisión?

Respuesta correcta y cómo se resuelve

Respuesta: el recall sube (o se queda igual) y la precisión, en general, baja.

Cómo se resuelve con 10 casos de juguete [DATITO]: círculos (positivos) con puntajes 0,9 · 0,8 · 0,6 · 0,3; triángulos con 0,7 · 0,5 · 0,4 · 0,2 · 0,15 · 0,1.

  • Umbral 0,65 → declaras positivos 0,9 · 0,8 · 0,7: VP = 2, FP = 1. Recall = 2/4 = 50 %; precisión = 2/3 ≈ 67 %.
  • Umbral 0,35 → declaras positivos 0,9 · 0,8 · 0,7 · 0,6 · 0,5 · 0,4: VP = 3, FP = 3. Recall = 3/4 = 75 %; precisión = 3/6 = 50 %.

El denominador del recall (los 4 círculos reales) no cambia y el numerador solo puede crecer: el recall nunca baja al bajar el umbral. La precisión suma casos nuevos arriba y abajo; como cerca de un umbral bajo hay más triángulos que círculos, lo normal es que caiga (puede subir un poco en algún tramo) [INFERENCIA].

Error típico: «suben las dos». Cada caso nuevo que declaras positivo entra al denominador de la precisión siempre, pero al numerador solo si era círculo.

Fuente: fórmulas de la [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18]; ejemplo [DATITO].

Dije: va a fallar
Dije: está bien
Era:
iba a fallar
VP—
FN—
Era:
estaba bien
FP—
VN—
Exactitud—
Precisión—
Recall—
FPR—
F1—

Llévalo a los dos extremos y mira lo que pasa:

Ninguno de los dos extremos es un modelo malo: es el mismo modelo. Solo cambió dónde pusiste la raya. Por eso decir «mi modelo tiene 92 % de recall» sin decir a qué umbral es una frase incompleta.

Esto exacto ya apareció · ficha P9 En la sesión del Certamen 2 (28-ago), respondiendo una consulta sobre la pregunta de TPR y FPR con varios umbrales:
«Básicamente tiene un parámetro de sensibilidad tiene dos modelos y tiene un parámetro de sensibilidad que te mueve el umbral.» Sesión del Certamen 2, 28-ago · 1:20:27–1:20:34 · profesor (hablante identificado por contexto: responde a quien lo llamó «Profesor») [INFERENCIA] · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-28T22_09_14Z_Fundamentos_en_Ciencia_de_Datos.md]
El «parámetro de sensibilidad» de un enunciado es este slider. Con la convención de arriba: si mueves la línea a la derecha (subes el umbral), bajan TPR y FPR a la vez; a la izquierda, suben las dos a la vez. Recorrer todos los umbrales y dibujar cada par (FPR, TPR) es la curva ROC: roc_auc.html · certamen_2.html#p9.

5 · El caso del profesor: la falla que pasa 1 de cada 1.000

El efecto de la prevalencia también se ve con mamografías en matriz_confusion.html#problema; aquí nos enfocamos en el denominador de la precisión.

Este es el ejemplo que puso en clase, con una máquina que tiene un modelo de detección de anomalías:

«las fallas pasan poco de una cada mil emisiones de la máquina […] imagínense que ustedes tienen un recall del 100 por ciento pero tienen una precisión del 70 por ciento qué quiere decir eso» Clase del 7-ago · 0:51:16–0:51:42 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Tu turno, antes de seguir: ¿qué quiere decir recall 100 % con precisión 70 %? Dilo con alarmas y fallas, no con siglas.

Respuesta correcta y cómo se resuelve

Respuesta: ninguna falla real se escapa (recall 100 %), pero de cada 10 alarmas que da el modelo, 7 son fallas reales y 3 son falsas (precisión 70 %).

Cómo se resuelve: recall = VP/(VP + FN) = 1 → FN = 0: toda falla es detectada. Precisión = VP/(VP + FP) = 0,7 = 7/10 → por cada 7 alarmas verdaderas hay 3 falsas.

La respuesta del profesor. Primero escribió mal la cuenta y la corrigió en voz alta:

«esto quiere decir que hacer 1 sobre 1 más 6 […] me equivoqué perdón […] esto es 7 sobre 10 ahí sí me quedó» Clase del 7-ago · 0:55:41–0:57:06 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Su lectura final: 7 VP y 3 FP, precisión = 7/(7+3) [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:57:20–0:57:29]. La consecuencia práctica que describió: el modelo avisa, tú frenas la máquina, y algunas de esas veces no había falla [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:56:02–0:56:20] (lo dijo todavía con la cuenta mala; con la corregida, son 3 de cada 10 frenazos).

Errores típicos: (1) sustituir antes de escribir la fórmula: de ahí salió el «1 sobre 1 más 6», que da 1/7 ≈ 14 %, no 70 %; (2) leer recall 100 % como «todo lo que el modelo marca es falla», que es la definición de precisión 100 %. En clase se formuló así primero y se corrigió después [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:51:51–0:53:45].

La lección de la autocorrección Si primero escribes precisión = VP / (VP + FP) y después pones «de cada 10 alarmas, 7 eran reales», sale 7/10 sin tropezar. Fórmula primero, números después: le pasa hasta al profesor.

Ahora el paso siguiente [DATITO]: el modelo se queda fijo —tú fijas su TPR y su FPR, que son sus dos características propias— y lo único que cambia es cuán rara es la falla en la realidad.

Predicción, y esta es contraintuitiva — el modelo no cambia: mismo TPR, mismo FPR. Si las fallas pasan de 1 de cada 10 a 1 de cada 1.000, ¿qué le pasa a la precisión?

Respuesta correcta y cómo se resuelve

Respuesta: la precisión se desploma, aunque el modelo sea exactamente el mismo.

Cómo se resuelve (10.000 revisiones, TPR 100 %, FPR 1 %):

  • 1 de cada 10 → P = 1.000, N = 9.000. VP = 1.000; FP = 0,01 × 9.000 = 90. Precisión = 1.000/1.090 ≈ 91,7 %.
  • 1 de cada 1.000 → P = 10, N = 9.990. VP = 10; FP = 0,01 × 9.990 ≈ 100. Precisión = 10/110 ≈ 9,1 %.

TPR y FPR no se movieron. Lo que cambió es el tamaño de los dos grupos de donde salen VP (cada vez más chico) y FP (cada vez más grande).

Error típico: «sigue igual, el modelo es el mismo». La precisión no es una propiedad del modelo solo: depende de la prevalencia.

Fuente: cifras ilustrativas [DATITO]; fórmulas: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].

Sobre 10.000 revisiones de la máquina.

La escala es fina cerca de cero a propósito: ahí es donde se juega el problema raro.

Dije: va a fallar
Dije: está bien
Era:
iba a fallar
VP—
FN—
Era:
estaba bien
FP—
VN—
Exactitud—parece buenísima
Precisión—
Recall—no se movió
FPR—no se movió
1 − precisión—¿es igual al FPR?

Deja el TPR en 100 % y el FPR en 1 %, y baja la prevalencia a 1 de cada 1.000. Vas a leer algo como exactitud 99 %, precisión 9 %. El mismo modelo, sin tocar una sola línea de código, pasa de razonable a inservible solo porque el mundo cambió de proporción.

Lectura extendida [DATITO] (esto no lo dijo el profesor; es una consecuencia que se puede calcular): un recall de 100 % con precisión de 70 % en un problema de 1 en 1.000 no es «un modelo con un defectito»: es un modelo extraordinariamente bueno, porque para conseguir 70 % de precisión con esa prevalencia su FPR tiene que ser menor a 0,05 % (por cada falla real, 3/7 ≈ 0,43 falsas alarmas repartidas entre 999 revisiones sanas: 0,43/999 ≈ 0,043 %). Prueba a lograrlo con el slider.

Por qué esto importa para tu proyecto Melbourne es regresión y aquí no aplica; pero Galaxy Zoo tiene 67,7 % de galaxias elípticas. Es el mismo fenómeno, invertido: cuando una clase domina, la exactitud se la regala el desbalance.

[FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md, cifras verificadas sobre 02_DATOS/GZ_mini_challenge_train.csv]

6 · FPR no es 1 − precisión

El recorrido «te dan la fórmula, reconstruye el universo» está en matriz_confusion.html#camino-inverso; aquí nos enfocamos en los denominadores.

Este es el error que el expediente del Certamen 2 marca por escrito para la pregunta de cálculo desde la matriz (ficha P8 de 07_DATITO/06_AUDITORIAS/patron_evaluacion.md). Y es tentador, porque las dos suenan a «la proporción de veces que me equivoqué al decir que sí».

FPR = FPFP + VN frente a 1 − precisión = FPVP + FP

Mismo numerador. Denominadores de universos distintos. El FPR se pregunta por la fila de abajo de la matriz —lo que era negativo—. El «1 − precisión» se pregunta por la columna de la izquierda —lo que dijiste que era positivo—. Son dos poblaciones que no tienen por qué parecerse en nada. (En la orientación de la lámina 19, con filas = predicho, se invierte: el FPR es una columna y el 1 − precisión una fila. Por eso se razona con rótulos, no con posiciones.)

Con la matriz oficial de la lámina 19: FPR = 2/9 ≈ 22,2 %, mientras que 1 − precisión = 2/8 = 25,0 %. Se parecen, y justamente por eso la trampa es peligrosa: con números cercanos el error pasa inadvertido. Pero no son lo mismo. Y en el panel de arriba puedes dejar el FPR clavado en 1 % mientras el «1 − precisión» se pasea entre 10 % y 99 %: si fueran lo mismo, eso sería imposible.

¿Cuándo sí coinciden FPR y 1 − precisión?

Respuesta correcta y cómo se resuelve

Respuesta: solo cuando VP = VN (o cuando FP = 0, y las dos valen 0). Es una coincidencia aritmética, no una regla.

Cómo se resuelve: 1 − precisión = FP/(VP + FP) y FPR = FP/(FP + VN). Con el mismo numerador, son iguales si los denominadores son iguales: VP + FP = FP + VN, o sea VP = VN. En la lámina 19, VP = 6 y VN = 7: casi iguales, y por eso 25 % y 22,2 % quedan cerca. Cerca no es igual.

Error típico: ver que en un ejercicio dan lo mismo y concluir que «siempre» son iguales.

Fuente: [INFERENCIA] desde las fórmulas de la [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].

Cómo se ve esto en la prueba · certamen_2.html#p8 Te dan una figura con círculos y triángulos separados por una línea, y te piden la matriz de confusión más exactitud, precisión, TPR y FPR. Lo primero es declarar la convención —qué símbolo es el positivo, de qué lado está la predicción positiva— porque sin eso la respuesta es irreproducible. La exactitud es simétrica y no cambia si inviertes las clases; precisión, TPR y FPR sí cambian.

7 · F1: por qué media armónica y no el promedio

F1 existe porque precisión y recall se pueden hacer trampa una a la otra. Puedes tener precisión casi perfecta si avisas una sola vez al año, cuando estás segurísimo. Y recall perfecto si avisas siempre.

F1 = 2 · precisión · recallprecisión + recall

Mira qué hace la media armónica con un modelo tramposo, comparada con el promedio de toda la vida (las tres primeras filas son cifras ilustrativas [DATITO]; la última es la matriz oficial):

ModeloPrecisiónRecallPromedio simpleF1
Avisa una vez y le achunta100 %1 %50,5 %2,0 %
Avisa siempre (prevalencia 10 %)10 %100 %55,0 %18,2 %
Equilibrado70 %70 %70,0 %70,0 %
La matriz de la lámina 19 (VP 6 · FP 2 · FN 1 · VN 7)75 %85,7 %80,4 %80,0 %

El promedio simple le regala un 50 % al modelo que avisa una sola vez. F1 le da 2 %. La media armónica se va con el más chico: para que F1 sea alto, las dos tienen que serlo. Cuando precisión y recall se parecen, F1 y el promedio dan casi lo mismo —fíjate en las dos últimas filas—; la diferencia solo aparece cuando hay desequilibrio, que es exactamente cuando la quieres.

8 · Camino inverso: te entregan la fórmula

En la prueba la fórmula te la dan escrita. El trabajo es desarmarla. Toma esta forma equivalente de F1 y contesta antes de abrir la solución:

F1 = 2 · VP2 · VP + FP + FN

a) ¿Qué casilla de la matriz de confusión no aparece por ninguna parte? ¿Y qué consecuencia tiene?

Respuesta correcta y cómo se resuelve

Respuesta: no aparece VN; por eso F1 no se puede inflar con aciertos sobre la clase negativa.

Cómo se resuelve: recorre la fórmula casilla por casilla: VP está (dos veces), FP y FN están en el denominador, VN no está. En un problema desbalanceado VN es un número gigante que infla la exactitud sin que el modelo haya hecho nada difícil; F1 lo deja fuera y sobrevive al desbalance. Con la lámina 19: la exactitud, (6+7)/16, usa VN; el F1, 12/(12+2+1), no.

Error típico: decir que falta FN o FP porque «F1 es precisión y recall»; los dos están en el denominador.

Fuente: [INFERENCIA] sobre la fórmula de F1 del P5 [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.333–344].

b) ¿De dónde sale el 2 del numerador?

Respuesta correcta y cómo se resuelve

Respuesta: sale de desarrollar la media armónica 2·P·R/(P + R); no es un ajuste arbitrario.

Cómo se resuelve: con P = VP/(VP+FP) y R = VP/(VP+FN): 2PR = 2·VP² / [(VP+FP)(VP+FN)] y P + R = VP·(2·VP+FP+FN) / [(VP+FP)(VP+FN)]. Al dividir se cancela el denominador común y un VP: queda 2·VP/(2·VP+FP+FN). Compruébalo con la lámina 19: 2·0,75·0,857/(0,75+0,857) = 0,80 y 12/15 = 0,80.

Error típico: creer que el 2 «normaliza» el resultado o que F1 es el promedio simple (P + R)/2.

Fuente: [INFERENCIA] (álgebra); definición de F1 como media armónica: [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.333].

c) Reconstruye el fenómeno: ¿qué historia cuenta un F1 bajo con exactitud alta?

Respuesta correcta y cómo se resuelve

Respuesta: hay una clase positiva rara que el modelo está ignorando: acierta «por abstención» gracias a un VN enorme.

Cómo se resuelve: exactitud alta con F1 bajo significa que (VP + VN)/total es grande pero 2·VP/(2·VP + FP + FN) es chico: VN es enorme y VP es chico frente a FP + FN. El modelo casi nunca dice que sí, y cuando lo dice no le achunta mucho. Ejemplo [DATITO]: 1.000 casos, 20 positivos; el modelo marca 5 y acierta 2 → VP 2, FP 3, FN 18, VN 977: exactitud 97,9 %, F1 = 4/25 = 16 %.

Error típico: concluir que «el modelo es bueno porque la exactitud es alta» o que «F1 está mal calculado».

Fuente: [INFERENCIA]; es lo que verías en Galaxy Zoo sin cuidar la clase 0 (§9).

9 · Tus propios datos: por qué Galaxy Zoo se evalúa con F1-macro

La matriz 3×3 real y las métricas por clase se construyen paso a paso en matriz_confusion.html#galaxias; aquí nos enfocamos en cómo se promedian.

El desafío tiene tres clases y la métrica oficial es F1-macro, no exactitud. Esa elección tiene motivo, y el motivo está en el reparto:

ClaseQué esFilas%
0No decidible — los humanos no se pusieron de acuerdo969,6 %
1Espiral22722,7 %
2Elíptica67767,7 %

[FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md · 02_DATOS/GZ_mini_challenge_train.csv, 1.000 filas, cero nulos. Desbalance 7,1×]

Construye el modelo más tonto posible: responde «elíptica» siempre. No mira ni un pixel.

Exactitud del modelo tonto: 67,7 %. Acaba de sacarse un 6,8 sin aprender nada.

Ahora el F1 por clase:

  • Clase 0 — recall 0, precisión indefinida → F1 = 0
  • Clase 1 — recall 0, precisión indefinida → F1 = 0
  • Clase 2 — recall 1,00 · precisión 0,677 → F1 = 2(0,677)(1)/(0,677+1) = 0,807

F1-macro = (0 + 0 + 0,807) / 3 = 0,269.

Exactitud 67,7 % contra F1-macro 26,9 %. El mismo modelo, los mismos datos. La exactitud premia haber adivinado la clase mayoritaria; el F1-macro promedia las tres clases con el mismo peso y por eso delata que dos de las tres quedaron sin atender.

Y hay una segunda razón, específica de estos datos: la clase 0 no es otro tipo de galaxia. Es «no hubo consenso entre los humanos». Reconocer una ausencia de acuerdo es una señal mucho más débil que reconocer una forma, así que la clase 0 es la difícil y la chica a la vez — es la que hunde el F1-macro, y por eso es la que hay que mirar primero.

Macro contra weighted: dos formas de promediar

El classification_report de scikit-learn trae dos promedios al final. Esto lo explicó la ayudantía del 7-ago, resolviendo el P5 (no la clase del profesor: sirve para los proyectos, no se presenta aquí como materia de certamen):

«el macro las va a calcular para cada etiqueta y va a básicamente sacarle el promedio y dice que no toma el desbalanceo en cuenta […] el weighted […] va a estar pesado por el ⟨support⟩ o sea por el número de elementos» Ayudantía del 7-ago (P5) · 1:13:38–1:14:14 · ayudantía · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción («supo» en el ASR) [INFERENCIA]

Con tus números de Galaxy Zoo se ve qué significa eso en la práctica:

ModeloF1 clase 0F1 clase 1F1 clase 2F1-macroF1-weighted
Tu CatBoost (OOF)0,28090,69840,86950,61630,774
El modelo tonto («siempre elíptica»)000,8070,2690,547

F1 por clase y F1-macro: [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §«OOF CatBoost, argmax normal»]. F1-weighted: [INFERENCIA] calculado aquí con los support 96 / 227 / 677 — no aparece en el REPORT.

«Toma en cuenta el desbalance» no quiere decir «es mejor con desbalance». El weighted pondera por el support, así que la clase mayoritaria (677 elípticas) manda en el promedio: tu modelo sube de 0,616 a 0,774 sin haber mejorado en nada la clase 0. El macro es el que no deja dominar a la mayoritaria: cada clase pesa un tercio, y la clase 0 hunde el promedio como tiene que hundirlo. Por eso el desafío Galaxy Zoo usa F1-macro [DATITO].
Errata del material oficial. El P5 dice que la exactitud «es invariante a conjuntos de datos desbalanceados» [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.326]. Tómalo como «no toma en cuenta el desbalance», que es como lo leyó la ayudantía al explicarlo [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T23_57_03Z_Fundamentos_en_Ciencia_de_Datos.md · 0:52:33]. La exactitud no es invariante: depende directamente del reparto de clases (el modelo tonto saca 67,7 % solo porque la clase 2 es el 67,7 %). Manda la lámina / la clase: la lámina 18 presenta la exactitud junto a recall, precisión y tasa de falsos positivos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18], y el caso de la máquina del profesor (§5, una falla cada mil) es justamente un problema desbalanceado donde la exactitud sola no dice nada [INFERENCIA].
El ejemplo de juguete del P5 (Bajo / Batería / Guitarra), con macro y weighted — contiene resultados del P5

Aviso: contiene el resultado del P5; intenta antes 06_LABORATORIOS/2026_[P5]Clasificación(vacio).ipynb.

precisiónrecallf1support
Bajo0,750,500,606
Batería0,750,750,754
Guitarra0,711,000,835
macro avg0,740,750,7315
weighted avg0,740,730,7215

[FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.424–432]

Aquí macro y weighted casi coinciden porque los support (6, 4, 5) son parecidos. La diferencia solo se vuelve grande cuando hay desbalance fuerte, como en Galaxy Zoo.

Ejemplo crítico en salud: dos clases desbalanceadas

En diagnóstico médico, el desbalance es la regla. Un modelo que ve 50 casos de enfermedad y 350 de ausencia de enfermedad es típico. Mira qué pasa:

precisiónrecallf1-scoresupport
Clase 1 (rara)0,340,960,5050
Clase 2 (común)0,990,730,84350
macro avg0,670,840,67400
weighted avg0,910,760,80400

De acuerdo a las métricas derivadas de la matriz de confusión. [DATITO].

La frase que alguien podría soltar: «El modelo tiene F1-score global del 80 %, lo cual puede considerarse apenas aceptable, especialmente en aplicaciones críticas como la salud.»

Pero eso oculta un problema grave. El 80 % es el weighted average: cada clase se pesa por su cantidad de muestras. Como hay 350 muestras de clase 2, ese promedio se la regala casi todo el peso. Miremos qué pasa con la clase rara:

El macro promedia sin peso: da un tercio de importancia a clase 1 y un tercio a clase 2 (aquí vemos solo dos, pero el procedimiento es igual para N). El macro te dice: «Oye, en la clase rara el F1 es 0,50. En la común es 0,84. En promedio, 0,67.» Y eso es mucho más honesto.

¿Cuál es el problema? Con precision 0,34 en la clase rara, solo un tercio de lo que el modelo marca como enfermo lo está realmente. Los otros dos tercios son pacientes sanos que reciben un tratamiento innecesario. Y con recall 0,96, casi todos los enfermos se detectan. Pero ese 0,96 entra en el promedio con su peso diminuto: 50 muestras frente a 350 de la clase 2. El weighted 0,80 no lo cuenta. [DATITO]

Contraste con Galaxy Zoo: allá los support eran 96, 227 y 677 — el desbalance es fuerte pero no tan extremo. Aquí son 50 y 350, un 7:1, y el weighted sube a 0,80 sin que la clase rara haya mejorado nada. Por eso Galaxy Zoo dice «usa F1-macro»: en salud, en detección de fraudes, en detección de anomalías, la clase rara es la que importa, y el macro la mira sin dejarla ser silenciada por el peso de la mayoritaria.

Pregunta de cierre: si solo ves F1 global = 80 %, ¿apruebas el modelo para detectar la clase 1 en salud?

Respuesta: No. Mirarías en primer lugar el F1-macro = 0,67 (no el weighted 0,80), y verías que la clase 1 tiene F1 = 0,50 y precision = 0,34. Un tercio de precisión es inaceptable: dos de cada tres pacientes que marca como enfermo no lo están. Ese número se esconde si solo miras el global 80 %. El macro te obliga a verlo.

Fuente: [DATITO].

El salto que el certamen te puede pedir Pasar de una matriz 3×3 a las cuatro casillas VP / FN / FP / VN. Se hace eligiendo una clase como positiva y metiendo todas las demás en «negativo». Haces eso tres veces, una por clase, y de ahí salen los tres F1 que luego promedias. Ese paso —declarar cuál es la positiva— es el mismo de siempre, y sin declararlo el resultado es irreproducible.

10 · Transferencia: explicárselo a quien paga

Esta es la parte que el profesor pregunta en las presentaciones del Hito 2. A un grupo le dijo:

«la pregunta es cuál es la decisión que deberían tomar con este modelo y cuál sería la implicancia de acuerdo a tus métricas» Clase del 4-sep · 1:12:28–1:12:32 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md]

Y el principio detrás de la pregunta, en sus palabras, al cerrar el ejercicio de los pacientes:

«no se trata solamente de tener el número decir un 90% es súper importante entender qué quiere decir en la práctica ese número» Clase del 4-sep · 1:47:24–1:47:30 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md]

Y dio su propia respuesta modelo, con pescado: detección de comida en mal estado, recall 70 %, precisión 80 %.

«yo soy capaz de captar un 70% de la comida que está en mal estado y un 30% se pasa […] el precision es de un 80% […] va a perder un 20% de pescados buenos que ellos tienen que ⟨botar⟩» Clase del 4-sep · 1:13:38–1:14:38 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción («votar» en el ASR) [INFERENCIA]

Las dos frases, dichas sin ambigüedad [DATITO]:

  • Recall 70 % → «de todo el pescado que efectivamente está malo, mi sistema capta 7 de cada 10. Tres de cada diez se te van a pasar y van a llegar al cliente.»
  • Precisión 80 % → «de todo lo que mi sistema marca como malo —lo que botas—, 8 de cada 10 lo está de verdad. De lo que botas, un 20 % era bueno.»

Y ahí recién viene la decisión, que no es tuya: ¿qué te cuesta más, la devolución del cliente por el 30 % del pescado malo que se pasó, o el pescado sano que va a la basura? Según la respuesta, mueves el umbral para un lado o para el otro.

Por qué no es «el 20 % de los pescados buenos». La frase oral «va a perder un 20 % de pescados buenos» se puede leer de dos maneras, y solo una es la precisión:
  • «De lo que boto, 20 % era bueno» → divide por lo que el modelo marcó como malo = 1 − precisión. Esta es la correcta.
  • «Boto el 20 % de todo el pescado bueno» → divide por todo el pescado que era bueno = FPR. Con precisión 80 % este número no se puede saber: depende de cuánto pescado bueno hay en total. Si el 95 % de la pesca es buena, el FPR sale muchísimo más chico que 20 % [DATITO].
Es exactamente la trampa FPR ≠ 1 − precisión del §6, escondida en una frase de conversación.

Ejercicio de producción: escribe, sin mirar lo de arriba, el párrafo que le leerías a un productor de pescado que no sabe qué es recall ni precisión (recall 70 %, precisión 80 %). Tiene que caber en cinco líneas.

Respuesta correcta y cómo se resuelve

Respuesta en una frase: de todo el pescado malo, el sistema atrapa 7 de cada 10 y deja pasar 3; y de todo lo que el sistema te hace botar, 8 de cada 10 estaba malo y 2 estaban buenos.

Respuesta modelo [DATITO]: «Don Juan, de cada 10 pescados que llegan malos, este sistema le va a atrapar 7; los otros 3 se le pasan y pueden llegar a un cliente. Y de cada 10 pescados que el sistema le manda a botar, 8 estaban malos de verdad y 2 estaban buenos. Si le duele más un reclamo, conviene hacerlo más estricto y aceptar botar más pescado bueno; si le duele más la mercadería perdida, al revés. Eso lo decide usted.»

Cómo se construye: recall = VP/(VP + FN) → divide por todo lo que estaba malo → «de cada 10 malos, atrapo 7, se pasan 3». Precisión = VP/(VP + FP) → divide por todo lo que el sistema marca como malo (lo que se bota) → «de cada 10 botados, 8 malos y 2 buenos».

Criterios para corregir el tuyo: el recall aparece como «de todo lo que estaba malo…» y dice cuánto se pasa; la precisión aparece como «de todo lo que boto…» y dice cuánto de eso era bueno; termina con la decisión que le toca a él, no con un número.

Error típico: escribir «vas a botar el 20 % de tu pescado bueno». Eso divide por todo el pescado bueno: es la FPR, no 1 − precisión, y con precisión 80 % no se puede calcular.

Fuente: cifras y ejemplo del profesor (cita de arriba, Clase del 4-sep · 1:13:38–1:14:38); redacción [DATITO]. Si quieres que corrija tu versión, llévala a Datito.

Fíjate en la estructura de las dos frases, porque es reutilizable y es la evidencia de que entendiste:

Recall → «de todo lo que ERA ___ , capto el __ % · se me pasa el __ %»
Precisión → «de todo lo que MARCO como ___ , acierto el __ % · el resto es falsa alarma»

El mismo molde sirve para el caso clínico que presentó un grupo de compañeros (no el profesor) el 4 de septiembre: tumores mamarios, 42 malignos en el conjunto de prueba. Con umbral 0,5, cada uno de sus tres modelos cometía exactamente un falso negativo [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:43:53–0:44:19]. Decirle «benigno» a alguien con un tumor maligno les pareció inaceptable, así que bajaron el umbral hasta dejar el recall en 100 % [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:46:23–0:46:49]. ¿El costo? En la regresión logística, 37 personas sin cáncer quedaron marcadas como enfermas [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:48:02–0:48:07]. No hay almuerzo gratis: el recall se compra con precisión.

⚠ Las cifras de precisión de ese grupo no cuadran tal como quedaron transcritas. Dijeron que la precisión «cae» con dos números que el ASR anotó como «042» y «033» [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:47:36–0:47:51]. Pero con 42 VP y 37 FP la precisión sería 42/79 ≈ 0,53, no 0,42 ni 0,33. Lo más probable es que 0,42 y 0,33 sean las caídas de precisión, no su valor final [INFERENCIA]. Y los 37 FP son solo de la regresión logística, no de los tres modelos. Úsalo por su lógica, no por sus números.

Interpretación: un modelo de deserción escolar tiene recall 0,91 y precisión 0,45 (cifras ilustrativas [DATITO]). Escríbelo en dos frases para el director del colegio.

Respuesta correcta y cómo se resuelve

Respuesta: «De los alumnos que efectivamente van a desertar, el sistema detecta 9 de cada 10 — se le escapa aproximadamente uno de cada diez. Pero de cada 100 alumnos que el sistema marca en riesgo, solo 45 iban a desertar realmente: los otros 55 van a recibir una intervención que no necesitaban.»

Cómo se resuelve: recall 0,91 = VP/(todos los que desertan) → 91 de cada 100 desertores detectados, 9 se escapan. Precisión 0,45 = VP/(todos los marcados) → de cada 100 marcados, 45 desertan y 55 no.

La decisión que se sigue: si la intervención es barata y no estigmatiza —una tutoría, una llamada— este punto de operación está bien y conviene incluso bajar más el umbral. Si es cara o marca al alumno, hay que subirlo y aceptar que se escapen más.

Error típico: decir «el 55 % de los alumnos que no desertan recibe intervención». Eso sería la FPR, y para calcularla necesitas saber cuántos alumnos no desertan en total.

Fuente: cifras ilustrativas [DATITO]; molde de las dos frases a partir del ejemplo del pescado del profesor (Clase del 4-sep).

Transferencia (agricultura): un sensor de plaga revisa 200 huertos del Maule; 20 tienen plaga de verdad. El modelo marca 30 huertos, y 15 de esos tienen plaga (cifras ilustrativas [DATITO]). Arma la matriz, calcula recall, precisión, FPR y 1 − precisión, y dile al agricultor qué significa cada uno.

Respuesta correcta y cómo se resuelve

Respuesta: recall 75 %, precisión 50 %, FPR ≈ 8,3 % y 1 − precisión = 50 %: el sensor encuentra 3 de cada 4 huertos con plaga, y la mitad de los huertos que manda a fumigar no lo necesitaba.

Matriz (filas = real): VP 15 · FN 20 − 15 = 5 · FP 30 − 15 = 15 · VN 180 − 15 = 165. Cierra: 20 + 180 = 200; predichos positivos 15 + 15 = 30.

  • Recall = 15/20 = 75 % → «de los huertos que tenían plaga, el sensor encontró 3 de cada 4; uno de cada cuatro se le pasa».
  • Precisión = 15/30 = 50 % → «de los huertos que el sensor te manda a fumigar, la mitad no la necesitaba».
  • FPR = 15/180 ≈ 8,3 % → «de los huertos sanos, solo 1 de cada 12 recibe una falsa alarma».
  • 1 − precisión = 15/30 = 50 %. Compara con el 8,3 %: la misma cantidad de falsas alarmas (15) se ve chica contra los 180 sanos y enorme contra los 30 marcados.

La lectura para el agricultor depende de a quién le hablas: al que paga la fumigación le importa la precisión (cuánto de lo que fumiga era innecesario); al que cuida la producción le importa el recall (cuánta plaga se escapa).

Error típico: calcular la FPR como 15/30 (eso es 1 − precisión) o como 15/200 (el total, no los sanos).

Fuente: cifras ilustrativas [DATITO]; fórmulas: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 18].

11 · Procedimiento para el papel

Todo el Certamen 2 se resolvió a mano, sin ejecutar código. Este es el orden que no falla:

  1. Declara la clase positiva por escrito. «Tomo círculo = positivo; lado izquierdo de la línea = predicción positiva.» Una línea. Sin esto, cualquier número que escribas es irreproducible.
  2. Mira los rótulos de la matriz antes de sumar. ¿Las filas son lo real o lo predicho? La lámina 19 pone filas = predicho; scikit-learn, filas = real.
  3. Llena las cuatro casillas VP / FN / FP / VN contando de la figura.
  4. Suma los márgenes y anótalos al lado. Positivos reales (VP + FN), negativos reales (FP + VN), predichos positivos (VP + FP) y el total. Estos cuatro números son los denominadores; tenerlos escritos es la mitad del trabajo.
  5. Para cada métrica escribe primero el denominador, después el numerador. Al revés es cuando se cuela el error.
  6. Verifica que cierre. Las dos filas suman el total, las dos columnas también. Si no cierra, contaste mal.

Ejercicio de cálculo con la matriz oficial, en su orientación original. Así viene en la lámina 19 (círculo = positivo):

Real: círculoReal: triángulo
Predicho: círculo62
Predicho: triángulo17

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 19]

Identifica VP, FP, FN y VN, y calcula exactitud, precisión, TPR, FPR, F1 y 1 − precisión. Escribe la fórmula antes de cada número.

Respuesta correcta y cómo se resuelve

Respuesta: VP 6, FP 2, FN 1, VN 7 → exactitud 81,25 %, precisión 75 %, TPR ≈ 85,7 %, FPR ≈ 22,2 %, F1 = 80 % y 1 − precisión = 25 %.

Rótulos primero. Filas = predicho. Entonces la fila «Predicho: círculo» tiene VP = 6 (era círculo) y FP = 2 (era triángulo); la fila «Predicho: triángulo» tiene FN = 1 y VN = 7. Si hubieras leído las filas como «real», habrías cambiado FP por FN.

Márgenes. Positivos reales = VP + FN = 6+1 = 7. Negativos reales = FP + VN = 2+7 = 9. Predichos positivos = VP + FP = 6+2 = 8. Total = 16. Cierra: 7+9 = 16 y 8+8 = 16.

  • Exactitud = (VP+VN)/total = (6+7) / 16 = 13/16 = 81,25 %
  • Precisión = VP/(VP+FP) = 6 / 8 = 75,0 %
  • TPR (recall) = VP/(VP+FN) = 6 / 7 ≈ 85,7 %
  • FPR = FP/(FP+VN) = 2 / 9 ≈ 22,2 %
  • F1 = 2·VP/(2·VP+FP+FN) = 12 / (12+2+1) = 12/15 = 80,0 %
  • De yapa: TNR = VN/(FP+VN) = 7/9 ≈ 77,8 %, que es 1 − FPR. Eso sí es un complemento verdadero, porque comparten denominador.

Y el control de la trampa: 1 − precisión = 2/8 = 25,0 %, pero FPR = 2/9 ≈ 22,2 %. Cercanos, pero distintos, como tienen que ser.

Error típico: leer las filas como «real» (costumbre de scikit-learn): te sale FP = 1 y FN = 2, y con eso precisión 6/7 y TPR 6/8, cambiadas.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · láminas 18–19]; F1 del P5.

Pregunta de seguimiento probable [INFERENCIA]: si mueves la línea a la derecha, ¿qué le pasa a TPR y FPR?

Respuesta correcta y cómo se resuelve

Respuesta: con la convención de este visual (positivo a la derecha de la línea), bajan las dos (o se quedan igual); si la figura pone el positivo a la izquierda, suben las dos.

Esta pregunta no la hizo el profesor: no aparece en las 14 transcripciones disponibles al 2026-09-21. Es una repregunta probable que el propio expediente se plantea en su «Prueba de comprensión» [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/01_ANALISIS_RECONSTRUCCION_CERTAMEN.md · l.548].

Depende de la convención, y ese es el punto. Con la de este visual (positivo = puntaje ≥ umbral = a la derecha de la línea): mover la línea a la derecha baja las dos (o las deja igual), porque declaras menos positivos: se te escapan círculos (baja TPR) y dejas de marcar triángulos (baja FPR).

En el expediente la respuesta es «suben las dos» porque allí el lado izquierdo es el positivo: mover la línea a la derecha agranda la zona positiva. Las dos respuestas son correctas con su convención escrita; sin escribirla, ninguna se puede corregir. Lo que no cambia con la convención: TPR y FPR nunca se mueven en sentidos opuestos.

Error típico: responder «sube una y baja la otra», o responder sin haber escrito de qué lado está el positivo.

Ese compromiso, recorrido para todos los umbrales posibles, es la curva ROC: roc_auc.html.

12 · Errores que este formato castiga

Lo que sigue

Ya moviste el umbral y viste que TPR y FPR se mueven juntos. Si en vez de mirar un umbral a la vez dibujas todos los puntos (FPR, TPR) que ese slider puede generar, tienes la curva ROC. Y el área bajo ella —el AUC— resume al modelo sin comprometerse con ningún umbral. Sigue en roc_auc.html.

Eso resuelve una pregunta que aquí quedó abierta: cómo comparar dos modelos cuando cada uno se puede operar a cualquier umbral. La distinción de ese concepto es comparar un punto de operación ≠ comparar un modelo, y es la pregunta 9 del Certamen 2 — la que el expediente marca como no evidenciada: certamen_2.html#p9. La que separa «métrica de un clasificador» de «estadístico de una variable» es la P4: certamen_2.html#p4.

Cierre de la Clase 13 · Precisión, sensibilidad, exactitud y F1

Qué aprendiste

  • Cada métrica divide por un universo distinto.
  • La exactitud engaña cuando las clases están desbalanceadas.
  • F1 es la media armónica de precisión y sensibilidad.
  • El promedio macro trata igual a todas las clases.

Qué no debes confundir

  • Precisión (÷ predichos positivos) ≠ sensibilidad (÷ positivos reales) ≠ exactitud (÷ total) (C2 P8).
  • FPR ≠ 1 − precisión (C2 P8).
  • Macro ≠ weighted.

Procedimiento para el papel

  1. Declara la clase positiva y arma la matriz.
  2. Identifica qué métrica te piden.
  3. Escribe la fórmula antes de sustituir.
  4. Calcula e interpreta en palabras del problema.

Viene de: Clase 12 · Matriz de confusión · Sigue: Clase 14 · ROC-AUC y elección del umbral

Vuelve a tu activación: Una alarma de fallas tiene recall 100 % y precisión 70 %. ¿Qué significa eso para el operador de la máquina? ¿Cambiarías tu respuesta?

Pregunta final. Con la lámina 19 (VP 6, FP 2, FN 1, VN 7), calcula FPR y 1 − precisión.
Respuesta correcta y cómo se resuelve

FPR = 2/9 ≈ 0,22 y 1 − precisión = 1 − 6/8 = 0,25: dividen por universos distintos. [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 19]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 14 · ROC-AUC y elección del umbral