Unidad 4 · Clasificar y evaluarClase 14 de 23
Clase 14 · ROC-AUC y elección del umbral

Objetivo. Elegir un punto de operación y comparar modelos por sus curvas ROC.

prerrequisitosClase 13 · Precisión, sensibilidad, exactitud y F1
habilitaninguna
tiempo estimado~40 min
Ficha Bloom · Evaluar
  • Evidencia de aprendizaje: Construye una curva ROC con cuatro puntos y decide si hay dominancia o cruce.
  • Actividad final: La lámina 23, a mano.
  • Criterio de dominio: Compara curvas y no puntos, y justifica el umbral por el costo de cada error.
Activación. El modelo rojo tiene más TPR en un umbral y el naranjo en otro. ¿Cuál es mejor? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Curva ROC y AUC

Un modelo no es un punto: es una curva. El umbral elige el punto; el modelo dibuja la curva.
Fundamentos de Ciencia de Datos · UdeC · Clase del 7-ago (láminas FCD-07, 22 a 24)

Matriz de confusión → Accuracy, precisión, recall y F1 → ROC y AUC · hoja del grafo: no habilita otros conceptos
Dónde estás. Este concepto viene de las métricas de clasificación —sin el umbral y sin los denominadores de TVP y TFP no se entiende— y no habilita ningún otro del currículum [FUENTE · Repo: 07_DATITO/curriculum.yaml · roc_auc].

Y aun así rinde puntos directos. La ficha P9 del Certamen 2 (1,0 punto) es exactamente esto: calcular TPR y FPR de dos modelos a varios umbrales y decidir cuál es mejor. El expediente registra la evidencia de esa pregunta como INSUFICIENTE [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · P9]. Por eso el currículum lo marca como prioritario.

1 · La situación, antes de cualquier fórmula

En la clase del 7-ago el profesor parte de un clasificador de perros y gatos que no entrega una etiqueta, sino una probabilidad. Si dice «90 % perro, 10 % gato», dices perro sin pensarlo. Si dice «50 y 50», necesitas una regla. Esa regla es el umbral, y no está escrita en piedra:

«[…] en mi cabeza generalmente un 50 por ciento pero no tiene porque ser un 50 por ciento podría ser un 55 o un 60 y lo que ocurre es que este umbral me ayuda a mover el modelo […]» Clase del 7-ago · 1:06:01–1:06:19 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Fíjate en la última parte: el umbral mueve el modelo. El mismo modelo, entrenado una sola vez, se comporta distinto según dónde pongas la raya. Eso deja dos preguntas separadas, que conviene no mezclar nunca:

PreguntaQué la responde
¿Qué tan bien separa este modelo a los positivos de los negativos, antes de decidir dónde cortar?La curva ROC entera (y su área, el AUC)
¿Dónde corto yo, dado lo que me cuesta cada error?El punto de operación: un punto de esa curva

Números pequeños

Cinco perros y cinco gatos; el modelo le da a cada uno su «probabilidad de perro» [DATITO] (cifras ilustrativas). Perro = positivo, así que P = 5 y N = 5.

Perros (positivos reales)0,95 · 0,85 · 0,70 · 0,55 · 0,40
Gatos (negativos reales)0,60 · 0,45 · 0,30 · 0,20 · 0,10

Corta en tres lugares y cuenta:

UmbralDeclaro «perro» a…VPFPVP / PFP / N
0,650,95 · 0,85 · 0,70300,60,0
0,50… + 0,60 (gato) · 0,55410,80,2
0,35… + 0,45 (gato) · 0,40521,00,4

Tres umbrales, tres pares. Si pones FP/N en el eje horizontal y VP/P en el vertical, y recorres todos los umbrales posibles, el rastro que queda es la curva ROC (Receiver Operating Characteristic). Recién ahora, la notación de la lámina 22:

TVP = VP / P   ·   TFP = FP / N
VPPositivos reales que quedaron del lado «positivo» del umbral se cuenta cambia con el umbral
PTodos los positivos reales, VP + FN dato del mundo no cambia con el umbral
FPNegativos reales que quedaron del lado «positivo» se cuenta cambia con el umbral
NTodos los negativos reales, FP + VN dato del mundo no cambia con el umbral
puntajeLa probabilidad que el modelo le asigna a cada caso lo aprende el modelo
umbralDónde cortas lo decides tú

TVP es la tasa de verdaderos positivos (en inglés TPR; es el mismo recall o sensibilidad). TFP es la tasa de falsos positivos (FPR). Dos denominadores distintos: TVP mira solo la fila de los positivos reales; TFP, solo la de los negativos reales. [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 22]

2 · Mueve el umbral y mira el punto recorrer la curva

Abajo hay 200 casos inventados [DATITO] (cifras ilustrativas): 50 positivos reales (círculos, arriba de la línea gris) y 150 negativos reales (triángulos, abajo). Cada caso está ubicado según el puntaje que le dio el modelo.

Convención de esta página (la misma de metricas_clasificacion.html): se declara positivo todo caso con puntaje ≥ umbral. Relleno = declarado positivo; solo contorno = declarado negativo.

Antes de tocar el umbral, predice: si subes el umbral, ¿TVP (TPR) y TFP (FPR)…
Respuesta correcta y cómo se resuelve

Si subes el umbral, TVP y TFP bajan las dos (o se quedan quietas si ningún caso cruza la raya); nunca van en sentidos opuestos.

  1. Con la convención «positivo si puntaje ≥ umbral», subir el umbral solo puede sacar casos de la zona positiva; ningún caso entra.
  2. Entonces VP no sube (algún positivo puede salir) y FP no sube (algún negativo puede salir).
  3. P y N son datos del mundo: no cambian con el umbral.
  4. TVP = VP/P y TFP = FP/N tienen numeradores que bajan o se quedan, y denominadores fijos: bajan o se quedan las dos.

Error típico: elegir «sentidos opuestos» porque se habla de un trade-off. El compromiso es entre detectar más (TVP alto) y alarmar menos (TFP bajo); como las dos tasas se mueven juntas, mejorar una empeora la otra, pero numéricamente van en la misma dirección.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 22] para las fórmulas; [INFERENCIA] el razonamiento por monotonía; compruébalo en el simulador.

● positivos reales (50) arriba · ▲ negativos reales (150) abajo · relleno = declarado positivo · la franja azul es la zona «declaro positivo».

La matriz a este umbral
—
VP
—
FN
—
FP
—
VN
Las tasas
—
TVP (TPR)
—
TFP (FPR)
—
Precisión
—
Exactitud
—
AUC
no depende del umbral

Segunda predicción: si separas más las dos nubes de puntajes, ¿qué le pasa a la curva?
Respuesta correcta y cómo se resuelve

Si separas más las nubes, la curva se acerca a la esquina (0, 1) y el AUC sube; si las juntas hasta superponerlas, la curva cae sobre la diagonal y el AUC se acerca a 0,5.

  1. Separar las nubes es cambiar el modelo: ahora los positivos reciben puntajes más altos que los negativos.
  2. Entonces existe un umbral que deja casi todos los círculos a la derecha y casi todos los triángulos a la izquierda: TVP cerca de 1 con TFP cerca de 0.
  3. Ese punto está pegado a la esquina (0, 1), y la curva pasa por él.
  4. Con las nubes superpuestas, cualquier umbral deja pasar la misma fracción de positivos que de negativos: TVP ≈ TFP, que es la diagonal.

Error típico: «la curva no cambia; solo se mueve el punto». Eso es lo que hace el umbral. La separación no es un umbral: es la calidad del modelo, y cambia la curva entera.

[DATITO] explicación con el simulador; la diagonal como referencia está en [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/FCD-2026-2_07_Clasificacion.pdf · lámina 24].

Lo que acabas de ver, en una línea: el umbral mueve el punto a lo largo de la curva; la calidad del modelo (qué tan separados quedan los puntajes) mueve la curva. Con umbral 0 declaras todo positivo y caes en (1, 1); con umbral 1 no declaras nada y caes en (0, 0). Toda curva ROC pasa por esas dos esquinas.
Cuidado con el verbo «subir». Al pasar del panel con TVP 0,8 al de TVP 1,0, el profesor dice que el umbral lo «vuelvo a subir» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:08:23]. Con la convención de esta página, llegar a TVP 1 exige bajar el umbral; lo que él sube es la posición de la línea verde en el dibujo [INFERENCIA]. En el papel no discutas el verbo: declara la convención y di hacia dónde se mueve el punto: hacia (1, 1) es más permisivo, hacia (0, 0) más exigente.

Elegir dónde quedarse tiene nombre propio:

«[…] tiene que definir de alguna forma lo que se llama el punto de operación del modelo cuál es el umbral que tú vas a usar al momento de poner esto en producción […]» Clase del 7-ago · 1:08:42–1:08:46 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

El punto de operación no se deduce de la curva: se decide mirando lo que cuesta cada error en el problema. La curva te muestra el menú; el negocio elige el plato.

3 · La lámina 23, a mano

La lámina 22 muestra el mismo conjunto de datos cuatro veces —10 círculos y 5 triángulos— con la línea verde de clasificación en cuatro posiciones, y pide calcular TVP y TFP de cada una; la lámina 23 da los resultados [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 23]. Los cuatro pares oficiales, escritos como (TFP, TVP):

PanelTFPTVP
1 · el más exigente0,00,3
20,00,6
30,20,8
4 · el más permisivo0,61,0

Convención (la misma que fija certamen_2.html para la figura del certamen): círculo = positivo; el lado inferior izquierdo de la línea = predicción positiva. Entonces P = 10 y N = 5. Contando sobre las cuatro imágenes de la lámina 22, extraídas del PDF [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/FCD-2026-2_07_Clasificacion.pdf · lámina 22] (conteo propio [INFERENCIA]; reproduce exactamente los cuatro pares oficiales):

PanelCírculos del lado positivo (VP)Triángulos del lado positivo (FP)
130
260
381
4103
Ejercicio de cálculo (papel y lápiz).
  1. Con esos conteos, calcula TVP = VP/P y TFP = FP/N de cada panel, y completa FN y VN.
  2. Dibuja un cuadrado con TFP en el eje horizontal y TVP en el vertical, ambos de 0 a 1. Marca los cuatro puntos.
  3. Agrega (0, 0) y (1, 1) y une todo en orden de TFP creciente. Eso es la curva ROC del modelo.
  4. ¿Qué panel elegirías si un falso positivo fuera carísimo? ¿Y si lo carísimo fuera el falso negativo?
Respuesta correcta y cómo se resuelve

Los cuatro paneles dan (TFP, TVP) = (0; 0,3), (0; 0,6), (0,2; 0,8) y (0,6; 1,0); con FP carísimo eliges el panel 2 y con FN carísimo el panel 4.

PanelVPFNFPVNTVP = VP/10TFP = FP/5
137050,30,0
264050,60,0
382140,80,2
4100321,00,6

Coincide con la lámina 23. Verificación de marginales: en cada fila VP + FN = 10 y FP + VN = 5. La curva es (0; 0) → (0; 0,3) → (0; 0,6) → (0,2; 0,8) → (0,6; 1,0) → (1; 1):

Punto 4. Si el falso positivo es carísimo, el panel 2: tiene TFP 0 y, entre los que no alarman en falso, el mayor TVP (0,6). El panel 1 no tiene ninguna ventaja sobre el 2: mismo TFP, menos TVP. Si lo carísimo es el falso negativo, el panel 4: TVP 1,0 al precio de TFP 0,6 — el caso del examen de VIH de la sección 4.

Error típico: dividir FP por P (3/10 = 0,3 en el panel 4) o por el total (3/15 = 0,2). El TFP divide por los negativos reales: 3/5 = 0,6. Y olvidar (0, 0) y (1, 1), que no son paneles pero sí son puntos de toda curva ROC (umbral que no declara nada y umbral que declara todo).

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 23] para los pares; conteos VP/FP sobre la figura de la lámina 22 [INFERENCIA].

4 · La distinción del certamen: punto de operación ≠ modelo

Distinción de certamen (P9). Comparar un punto de operación ≠ comparar un modelo. Un modelo es la curva entera; cada umbral es un punto de ella. «En el umbral tal, el Modelo 1 acierta más» no demuestra que el Modelo 1 sea mejor. Ficha completa en certamen_2.html#p9 (en Canvas figura como «Pregunta 8»). [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, P9]

El enunciado real del certamen:

«Calcule la razón de verdaderos positivos (TPR) y razón de falsos positivos (FPR) para los siguientes dos modelos utilizando los distintos umbrales de discriminación mostrados a continuación (línea verde para clasificar entre círculos y triángulos) […] ¿Qué modelo considera mejor y por qué?»

[FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/fuentes/Historial de exámenes para Cristobal Ramon Herrera Jara_ Certamen 2.html]

En ese enunciado, «modelo» es la curva (Modelo 1 y Modelo 2) y «umbral» es cada punto. Pero en clase la palabra se usó de otra manera, y conviene saberlo antes de la prueba:

«[…] entonces acá yo diría cuál de los dos modelos está mejor bueno claramente el de la derecha porque la tasa de verdadero positivo es más alta que el de la izquierda y la tasa de falsos positivos se mantuvo igual» Clase del 7-ago · 1:07:16–1:07:45 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]
Advertencia. Ahí el profesor compara el panel 1 (0; 0,3) con el panel 2 (0; 0,6) de la lámina 23 y los llama «dos modelos», pero son dos umbrales de un mismo modelo. La lámina 22 usa el mismo vocabulario: «Considere los modelos a continuación, donde el modelo puede variar de acuerdo a un hiperparámetro, por ejemplo, un umbral de clasificación» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 22].

Su conclusión es correcta como elección de punto de operación: mismo TFP, más TVP, el panel 2 es mejor punto. Lo que la P9 castiga es trasladar eso a dos modelos distintos: tomar un punto del Modelo 1 y un punto del Modelo 2 y declarar un ganador. En tu respuesta escrita, reserva «modelo» para la curva y di «umbral» o «punto de operación» para cada panel.

La misma confusión apareció durante el certamen, y la respuesta del profesor separa las dos cosas:

«el mejor modelo, o sea el mejor umbral por modelo […] Básicamente tiene un parámetro de sensibilidad tiene dos modelos y tiene un parámetro de sensibilidad que te mueve el umbral.» Sesión del Certamen 2, 28-ago · 1:19:59–1:20:34 · pregunta un compañero; responde el profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-28T22_09_14Z_Fundamentos_en_Ciencia_de_Datos.md]

Dos modelos; un parámetro que mueve el umbral dentro de cada uno. Y cuando en clase sí compara dos modelos distintos, compara curvas:

«[…] yo podría usar otro modelo que esta curva ⟨ROC⟩ se ve ir algo como así qué modelo preferiría el naranjo o el rojo el rojo cierto porque está más cerca del uno […]» ⟨⟩ = corrección de transcripción [INFERENCIA] Clase del 7-ago · 1:10:33–1:10:53 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Dominancia o cruce: los dos casos posibles

CasoCómo se veQué concluyes
Una curva dominaA igual TFP, una tiene TVP mayor o igual en todo el rango: queda siempre por encima, más cerca de la esquina (0, 1)Es mejor sin ambigüedad. No importa dónde vayas a operar ni cuánto cueste cada error
Las curvas se cruzanEn un tramo de TFP gana una; en otro, la otraNo hay ganador absoluto. Depende del punto de operación, o sea, de cuánto cuesta cada error en el problema

Y el costo de cada error lo trae el problema, no la curva. El ejemplo que propuso un compañero en clase, y que el profesor validó:

«imagínate que tiene algún examen de alguna enfermedad muy grave como puede ser el VIH entonces tú lo que dice es no me quiero perder ninguno […] prefiero que alguien diagnosticar equivocadamente para que alguien se vaya a hacer un segundo examen» Clase del 7-ago · 1:13:01–1:13:18 · profesor, respondiendo a un compañero · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Un examen de tamizaje opera arriba en la curva (TVP alto, aunque suba el TFP) porque el falso positivo se corrige con un segundo examen y el falso negativo no. Si dos modelos se cruzan, esa es la información que decide entre ellos.

Ejercicio estilo certamen

(a) El Modelo X tiene los puntos de la lámina 23: (0; 0,3), (0; 0,6), (0,2; 0,8), (0,6; 1,0). El Modelo Y [DATITO] (cifras ilustrativas, no son las del certamen): (0; 0,2), (0,2; 0,5), (0,4; 0,8), (0,8; 1,0). ¿Cuál es mejor y por qué?

(b) [DATITO] Modelo A: (0; 0,5), (0,1; 0,6), (0,3; 0,7), (0,6; 0,8). Modelo B: (0; 0,1), (0,1; 0,3), (0,3; 0,75), (0,6; 0,95). Agrega (0, 0) y (1, 1) a ambos. ¿Cuál es mejor? Si solo toleras 10 % de falsas alarmas, ¿cuál eliges? ¿Y si toleras 50 %?
Respuesta correcta y cómo se resuelve · (a)

(a) El Modelo X es mejor, porque su curva domina a la de Y: a igual TFP nunca tiene menos TVP.

Compara a igual TFP (misma vertical), interpolando en línea recta entre puntos:

TFPTVP de XTVP de Y
0,00,60,2
0,20,80,5
0,40,90,8
0,61,00,9
0,81,01,0

X nunca queda por debajo de Y: X domina. Es mejor sea cual sea el punto de operación, y la respuesta no necesita ningún AUC. (Si te lo piden: X da 0,900 e Y 0,760 por trapecios; el número confirma, no decide.)

Error típico: comparar solo el «tercer punto» de cada uno —X (0,2; 0,8) contra Y (0,4; 0,8)— y decir «empatan en TVP». Están en TFP distintos: hay que comparar en la misma vertical.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 23] para X; Y es [DATITO]; método de comparación en [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7].

Respuesta correcta y cómo se resuelve · (b)

(b) Ninguno es mejor en absoluto: las curvas se cruzan y tienen el mismo AUC (0,770); con 10 % de falsas alarmas tolerables eliges A, con 50 % eliges B.

A TFP 0,1: A tiene 0,6 y B 0,3 → gana A. A TFP 0,3: A tiene 0,7 y B 0,75 → gana B. A TFP 0,5: A ≈ 0,77 y B ≈ 0,88 → gana B. Se cruzan cerca de TFP ≈ 0,27 (TVP ≈ 0,69).

Áreas por trapecios, (ancho) × (promedio de alturas):

Mismo AUC, curvas distintas. No hay ganador absoluto: con 10 % de falsas alarmas tolerables eliges A (detecta el doble); con 50 % eliges B. La respuesta de certamen es: «se cruzan; depende del punto de operación; declaro qué error cuesta más y elijo».

Error típico: decidir por el AUC («el de mayor AUC es mejor») o por un solo punto («A tiene TVP 0,5 con TFP 0, así que A es mejor»). Aquí el AUC empata y cada punto solo habla de su tramo.

[DATITO] cifras ilustrativas; criterio de cruce en [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7].

Compruébalo moviendo el máximo de falsas alarmas que toleras:

5 · El AUC: el área bajo la curva

Qué dice el material oficial, y qué no. La lámina 24 trae unos ejes ROC vacíos con una recta diagonal de (0, 0) a (1, 1) [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/FCD-2026-2_07_Clasificacion.pdf · lámina 24] (figura verificada sobre la imagen extraída del PDF); el resumen híbrido anota que el profesor no la comenta [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase7_Clasificacion.md · l.699]. El texto de las láminas FCD-07 no nombra el AUC. Y en las 14 transcripciones disponibles al 2026-09-21 el profesor no define el AUC: «área bajo la curva» solo aparece en presentaciones de grupos de compañeros el 4-sep [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 0:46:59], [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:25:15], [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 2:43:15]. Aun así el Certamen 2 lo usa: la P4 lista «Área bajo la curva ROC» entre las medidas para evaluar un clasificador (certamen_2.html#p4). Por eso lo que sigue sobre el AUC va rotulado [DATITO]: es la definición estándar, apoyada en los ejes de la lámina 24.

[DATITO] El AUC (area under the curve) es el área bajo la curva ROC. Resume la curva entera en un número entre 0 y 1:

AUCCómo se ve la curvaQué significa
1,0Pasa por la esquina (0, 1)Existe un umbral que separa perfecto: todos los positivos por encima de todos los negativos
0,5Sobre la diagonal de la lámina 24Azar: el puntaje no distingue. Declarar positivo al azar con probabilidad p cae en (p, p)
< 0,5Bajo la diagonalPeor que el azar: invirtiendo la regla sale uno mejor
AUC ≈ Σ (TFPi+1 − TFPi) · (TVPi + TVPi+1) / 2
TFPi+1 − TFPiEl ancho de cada tramo, de un punto al siguiente se lee de la curva
(TVPi + TVPi+1)/2La altura media del tramo: por eso es un trapecio
ΣSuma sobre todos los tramos, desde (0, 0) hasta (1, 1)

[DATITO] Un tramo vertical (mismo TFP) tiene ancho cero y no aporta área. Olvidar agregar (0, 0) y (1, 1) es el error de cálculo más común.

Ejercicio de cálculo. Calcula por trapecios el AUC de la curva de la lámina 23: (0; 0), (0; 0,3), (0; 0,6), (0,2; 0,8), (0,6; 1,0), (1; 1).
Respuesta correcta y cómo se resuelve

El AUC de la curva de la lámina 23 es 0,900.

Tramo de TFPAnchoAltura mediaÁrea
0 → 0 (vertical)0—0
0 → 0,20,2(0,6 + 0,8)/2 = 0,700,140
0,2 → 0,60,4(0,8 + 1,0)/2 = 0,900,360
0,6 → 1,00,41,000,400
AUC0,900

Coincide con el 0,900 de certamen_2.html#p9. Esa misma ficha documenta que las cifras «AUC ≈ 0,78 y ≈ 0,68» de la respuesta reconstruida no se derivan de estos puntos. Y la tabla «bajo / medio / alto» con pares como 0,95/0,34 de 01_DOCUMENTACION/01_CERTAMEN2/03_DEFENSA_ORAL_CERTAMEN.md tampoco sale de la lámina 23 [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/03_DEFENSA_ORAL_CERTAMEN.md]. Si citas un AUC en un oral, que sea este y di de dónde sale.

Error típico: partir en (0; 0,3) sin agregar (0, 0) y (1, 1), lo que deja fuera el último trapecio (0,400) y da 0,500; o asignarle área al tramo vertical en TFP = 0.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 23] para los puntos; método de trapecios [DATITO].

El camino inverso: qué significa el área

[DATITO] El AUC tiene una lectura que no parece un área: es la probabilidad de que un positivo tomado al azar reciba mayor puntaje que un negativo tomado al azar. Mide si el modelo ordena bien, no si corta bien.

Ejercicio de interpretación. Vuelve a los 5 perros y 5 gatos de la sección 1. (a) De los 25 pares perro–gato posibles, ¿en cuántos el perro tiene mayor puntaje? (b) Dibuja la ROC completa —un escalón por caso, de mayor a menor puntaje— y calcula su área. (c) Compara los dos números y di en una frase qué mide el AUC.
Respuesta correcta y cómo se resuelve

En 22 de los 25 pares el perro tiene mayor puntaje (0,88), y el área bajo la ROC también da 0,88: el AUC es la fracción de pares positivo–negativo que el modelo ordena bien.

(a) El perro de 0,95 le gana a los 5 gatos; el de 0,85, a 5; el de 0,70, a 5; el de 0,55, a 4 (pierde con el gato de 0,60); el de 0,40, a 3. Total 22 de 25 = 0,88.

(b) Ordenados de mayor a menor: P P P N P N P N N N. Cada P sube 0,2; cada N avanza 0,2 a la derecha. Puntos: (0; 0) → (0; 0,6) → (0,2; 0,6) → (0,2; 0,8) → (0,4; 0,8) → (0,4; 1) → (1; 1). Área: 0,2·0,6 + 0,2·0,8 + 0,6·1 = 0,12 + 0,16 + 0,60 = 0,88.

(c) Son el mismo número. El AUC dice qué fracción de los pares positivo–negativo el modelo deja en el orden correcto. No dice nada de dónde cortar.

Error típico: leer AUC 0,88 como «acierta el 88 % de los casos». Eso sería una exactitud, y la exactitud depende del umbral: con umbral 0,50 este mismo modelo acierta 8 de 10 (80 %), no 88 %.

[DATITO] cifras ilustrativas de la sección 1; la equivalencia área = pares bien ordenados es la definición estándar [DATITO].

Lo que el AUC no dice

Ejercicio de interpretación, ligado a tu pregunta diagnóstica. ¿Puede un modelo tener AUC alto y, al mismo tiempo, exactitud baja? Si crees que sí, constrúyelo con 4 casos (2 positivos, 2 negativos) y puntajes inventados; si crees que no, demuéstralo. Después di qué mide cada número que el otro no mide.
Respuesta correcta y cómo se resuelve

Sí, es posible: el AUC mide si el modelo ordena bien a los positivos por encima de los negativos en todos los umbrales, y la exactitud mide cuántos casos acierta en un solo umbral; un buen orden con el corte mal puesto da AUC alto y exactitud baja.

  1. Ejemplo [DATITO]: positivos con puntajes 0,40 y 0,35; negativos con 0,30 y 0,20.
  2. AUC por pares: los 4 pares positivo–negativo quedan bien ordenados (0,40 > 0,30; 0,40 > 0,20; 0,35 > 0,30; 0,35 > 0,20) → AUC = 4/4 = 1,0.
  3. Exactitud con umbral 0,5 (positivo si puntaje ≥ 0,5): nadie llega a 0,5, así que todos quedan como negativos. VP = 0, FN = 2, FP = 0, VN = 2 → exactitud = 2/4 = 50 %.
  4. Sin tocar el modelo, bajando el umbral a 0,32: VP = 2, VN = 2 → exactitud 100 %. El orden ya era perfecto; lo malo era el corte.
  5. Qué mide cada uno que el otro no: el AUC ignora el umbral y la proporción de clases; la exactitud depende de los dos y no mira el orden.

Error típico: tratar el AUC como «otra exactitud» y creer que un AUC alto obliga a una exactitud alta. Es el error registrado como auc_confundido_con_accuracy.

Criterios para revisar tu versión: distingue ordenar de cortar; calcula el AUC contando pares; fija el umbral y la convención antes de contar la exactitud; dice qué cambiar para mejorar la exactitud sin reentrenar. Puedes probarlo en el simulador de la sección 2: separación 3,6 y umbral 0 dan AUC cercano a 1 con exactitud 25 %. Llévale tu respuesta a Datito.

[DATITO] ejemplo ilustrativo; [FUENTE · Repo: 07_DATITO/errores_conceptuales.yaml · auc_confundido_con_accuracy].

6 · FPR ≠ 1 − precisión, y del punto de la ROC a personas reales

Mismo numerador, otro universo. TFP divide FP por los negativos reales (FP + VN); la precisión divide VP por los declarados positivos (VP + FP). El detalle, con el caso del Certamen 2, está en metricas_clasificacion.html y en la ficha certamen_2.html#p8.

La consecuencia para la ROC: la curva no muestra la precisión. TVP y TFP se calculan dentro de cada clase real, así que no cambian si la enfermedad se vuelve más rara. La precisión mezcla las dos clases, y sí cambia. Para pasar de un punto de la curva a personas reales necesitas P y N. El profesor hizo justo ese paso el 4-sep:

«digamos que esa flechita esté una tasa de verdaderos positivos de 1 y una tasa de falso positivos de 0,2 […] entonces de los 100 pacientes 36 el modelo le va a decir que tiene cáncer aun cuando en realidad sólo 20 tiene cáncer» Clase del 4-sep · 1:35:29–1:45:18 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md]
VP = TVP · P = 1 · 20 = 20  ·  FP = TFP · N = 0,2 · 80 = 16

Declarados positivos: 20 + 16 = 36, como dice el profesor (la aritmética lo confirma). Precisión = 20/36 = 55,6 %; 1 − precisión = 44,4 %, no el 20 % del TFP. El ejercicio completo, con la matriz y las preguntas que hizo en clase, está en matriz_confusion.html.

Ejercicio de cálculo. El mismo modelo, operando en el mismo punto (TFP 0,2; TVP 1), se aplica ahora a 1.000 personas de las cuales 10 tienen la enfermedad [DATITO]. ¿Cuántas alarmas da? ¿Qué precisión tiene? ¿Se movió el punto en la ROC?
Respuesta correcta y cómo se resuelve

Da 208 alarmas con precisión de 4,8 %, y el punto en la ROC no se movió: sigue en (0,2; 1).

P = 10 y N = 990. VP = 1 · 10 = 10; FP = 0,2 · 990 = 198. Alarmas = 208. Precisión = 10/208 = 4,8 %: de cada 100 alarmas, 95 son falsas.

El punto en la ROC no se movió: sigue siendo (0,2; 1). Lo que cambió es el mundo (la prevalencia), y la precisión lo siente; TVP y TFP, no. Por eso una ROC buena no garantiza pocas falsas alarmas en un problema raro.

Error típico: calcular FP = 0,2 · 1.000 (sobre el total) en vez de 0,2 · 990 (sobre los negativos reales), o suponer que la precisión es 1 − TFP = 80 %.

[DATITO] cifras ilustrativas; el mismo paso de la ROC a conteos lo hizo el profesor con 20/80 [FUENTE · Repo: 05_CLASES/transcripciones/2026-09-04T22_05_05Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:34].

7 · Aplicar y transferir

Otro dominio: fallas en camiones de extracción [DATITO]

Una faena minera tiene un modelo que avisa cuándo un camión de extracción va a fallar. Cifras ilustrativas: en un periodo hay 1.050 revisiones, de las cuales 50 terminan en falla real (P = 50, N = 1.000). La curva ROC del modelo ofrece, entre otros, estos dos puntos de operación:

PuntoTFPTVP
Exigente0,050,70
Permisivo0,200,94
Ejercicio de transferencia. Una falla no detectada cuesta 20 (millones de pesos: camión detenido y reparación mayor); una alarma falsa cuesta 1 (inspección y dos horas de detención). (a) Calcula FN y FP de cada punto y su costo total. ¿Cuál eliges? (b) Repite si la alarma falsa costara 3. (c) ¿Cambió el AUC del modelo entre (a) y (b)?
Respuesta correcta y cómo se resuelve

(a) El punto permisivo (costo 260 contra 350); (b) con alarma falsa a 3 conviene el exigente (450 contra 660); (c) el AUC no cambia: solo cambia qué punto de la misma curva conviene.

(a) Exigente: VP = 0,70 · 50 = 35 → FN = 15; FP = 0,05 · 1.000 = 50. Costo = 15 · 20 + 50 · 1 = 300 + 50 = 350. Permisivo: VP = 47 → FN = 3; FP = 200. Costo = 60 + 200 = 260. Eliges el permisivo.

(b) Exigente: 300 + 150 = 450. Permisivo: 60 + 600 = 660. Ahora eliges el exigente.

(c) No. El modelo y su curva son los mismos; solo cambió cuál punto conviene. Eso es el punto de operación: una decisión de costos sobre una curva fija.

Error típico: elegir siempre el punto de mayor TVP «porque detecta más fallas», o siempre el de menor TFP, sin hacer la cuenta con los costos y con P y N. Sin costos no hay punto de operación defendible.

[DATITO] cifras ilustrativas; la idea de «hacer los números» para fijar el punto de operación es del profesor [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:11:21–1:11:32].

Tus datos: Galaxy Zoo

Qué hay y qué no hay en tu repositorio. REPORT.md no trae la curva ROC ni el AUC del modelo CatBoost: esos números no existen y no hay que inventarlos. Sí trae dos cosas verificables que son de este tema [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §8.3 y §10]:

Variante de la regla de decisión (§10)PesosPredichas clase 0Recall clase 0Precisión clase 0
A · argmax[1; 1; 1]820,26040,3049
B · pesos declarados[1,7; 0,9; 0,9]1570,46880,2866

Y de §8.3: el techo de AUC de una sola variable es 0,754 para 0-vs-resto y 0,9041 para 1-vs-2. La clase 0 tiene 96 de las 1.000 galaxias.

Ejercicio de aplicación. Toma clase 0 = positiva (P = 96, N = 904). (a) Calcula (TFP, TVP) de A y de B. (b) ¿Son dos modelos? (c) ¿Cuál es mejor?
Respuesta correcta y cómo se resuelve

A está en (0,063; 0,260) y B en (0,124; 0,469); no son dos modelos sino dos puntos de operación del mismo CatBoost, y ninguno domina al otro.

(a) A: VP = 0,2604 · 96 = 25; FP = 82 − 25 = 57; TFP = 57/904 = 0,063, TVP = 0,260. B: VP = 0,4688 · 96 = 45; FP = 157 − 45 = 112; TFP = 112/904 = 0,124, TVP = 0,469. Control: 45/157 = 0,2866, la precisión del informe.

(b) No. Son las mismas probabilidades del mismo CatBoost con dos reglas de corte: dos puntos de operación de una misma curva. Con pesos [1,9; 1; 1] (equivalentes a los de B), se declara clase 0 cuando P0 ≥ máx(P1, P2)/1,9: es un umbral sobre P0/máx(P1, P2) que baja de 1 a ≈ 0,53 [INFERENCIA].

(c) Ninguno domina: B detecta más clase 0 a cambio de más falsas alarmas. Y hay un dato más fuerte en §10.1: elegido honestamente (pesos ajustados solo con los folds de entrenamiento), el F1-macro de la regla con pesos es 0,6001, peor que el 0,6163 del argmax. El 0,6339 reportado tenía un sesgo optimista de +0,0338 por elegir el punto de operación sobre los mismos datos con que se evaluó.

Error típico: tratar A y B como «dos modelos» y declarar mejor a B porque su recall es mayor, sin mirar que su TFP casi se duplica (57 → 112 falsas clase 0). Es el error de la P9, en tus propios datos.

[FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §10 y §10.1] para las cifras; TFP y TVP calculados aquí; la lectura como umbral [INFERENCIA].

Eso último es exactamente lo que el profesor le pidió a todos los grupos:

«y esa es una decisión que hay que considerar como un hiperparámetro entonces se toma sobre un conjunto de ⟨validación⟩ […] lo que uno tiene que seleccionar un punto de operación y eso se selecciona con la curva ⟨ROC⟩» ⟨⟩ = corrección de transcripción [INFERENCIA] Clase del 14-ago · 1:24:44–1:25:03 · profesor, comentando la presentación de un grupo · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md]
Ejercicio de interpretación. Traduce a una frase para tu equipo: «techo de AUC marginal univariada: 0,754 para 0-vs-resto, frente a 0,9041 para 1-vs-2». ¿Qué te dice sobre la clase 0? ¿Qué no te dice?
Respuesta correcta y cómo se resuelve

Ninguna variable sola separa bien la clase 0 (la mejor ordena bien cerca del 75 % de los pares, contra 90 % para espiral frente a elíptica); no dice nada del F1 de la clase 0 ni de cómo rinde el modelo completo.

[INFERENCIA] Si usas una sola variable como puntaje, la mejor de todas ordena correctamente un par (galaxia clase 0, galaxia de otra clase) cerca del 75 % de las veces; para separar espirales de elípticas, cerca del 90 %. Ninguna variable individual separa bien la clase 0: calza con que sea una frontera («no hubo consenso»), no un grupo propio.

Lo que no dice: el F1 de la clase 0, en qué umbral operar, ni qué lograría el modelo completo combinando variables. Es un AUC de variables, no del modelo.

Error típico: citar 0,754 como «el AUC de mi modelo». REPORT.md no trae el AUC del modelo; este número es de variables sueltas.

[FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §8.3 y §14]; lectura como probabilidad de ordenar bien un par [DATITO].

¿Y Melbourne? Es regresión: predice un precio, no hay umbral ni ROC que trazar [INFERENCIA]. Solo aparecería si convirtieras el problema en clasificación, por ejemplo «¿supera la mediana de 910.000 AUD?».

8 · Procedimiento para el papel

1. DECLARAR      clase positiva y qué lado de la línea es «positivo»
2. CONTAR P y N  son fijos: no cambian entre umbrales
3. POR UMBRAL    VP y FP → TVP = VP/P · TFP = FP/N   (dos denominadores)
4. GRAFICAR      (TFP, TVP) de cada umbral + (0,0) + (1,1), en orden
5. UN MODELO = UNA CURVA     nunca un punto suelto contra otro
6. COMPARAR      a igual TFP, ¿cuál tiene más TVP? (o umbral a umbral:
                 ¿uno tiene mayor TVP y menor TFP en todos?)
7. DOMINA        → mejor sin ambigüedad
   SE CRUZAN     → depende del punto de operación: di en qué tramo
                   gana cada uno y qué error cuesta más
8. AUC           solo como resumen; por trapecios si lo piden
9. INTERPRETAR   «de cada 10 positivos detecto __; de cada 10
                 negativos alarmo __»

[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §7 «Comparación con ROC»], ampliado con los pasos de cálculo [DATITO].

Errores que el formato castiga.
Antes de cerrar: explícaselo a alguien.

Un compañero de tu grupo escribe en el informe: «el Modelo 2 es mejor porque en su tercer umbral tiene TPR 0,9 y el Modelo 1, en su tercer umbral, solo 0,8».

En cinco líneas, explícale qué le falta a ese argumento, qué tendría que mirar, y en qué caso podría tener razón. Escríbelo tú, sin mirar esta página, y llévaselo a Datito.
Respuesta correcta y cómo se resuelve

El argumento no alcanza: compara un solo punto de cada modelo y sin su TFP; hay que comparar las curvas completas, y el compañero solo tendría razón si la curva del Modelo 2 quedara por encima en todo el rango o si su aplicación opera justo en el tramo donde el Modelo 2 gana.

Respuesta modelo (cinco líneas):

«Un TPR de 0,9 contra 0,8 no compara nada si no sé a qué TFP ocurre cada uno: el Modelo 2 podría estar alarmando el doble. Además, un modelo no es un umbral, es una curva: el "tercer umbral" de uno no tiene por qué corresponder al del otro. Lo que hay que hacer es poner las dos curvas ROC en el mismo gráfico y comparar a igual TFP. Si la curva del Modelo 2 queda por encima en todo el rango, lo domina y tienes razón sin importar dónde operemos. Si se cruzan, depende del punto de operación: tenemos que decir cuánto nos cuesta cada error y elegir el modelo que gana en ese tramo.»

  1. Nota que falta el TFP de ambos puntos: un TVP solo no compara nada.
  2. Dice que un modelo es una curva y que se compara la curva, no un umbral.
  3. Distingue dominancia (gana en todo el rango) de cruce (depende del punto de operación).
  4. Si hay cruce, pide el costo de cada error para decidir.
  5. No usa el AUC como único argumento.

Error típico: «corregirlo» diciendo «mejor comparemos el AUC». Con curvas que se cruzan el AUC puede empatar (A y B de la sección 4) y aun así uno de los dos es claramente mejor en tu punto de operación.

[FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1 P9 y §7]; redacción de la respuesta modelo [DATITO].

A dónde seguir.

Cierre de la Clase 14 · ROC-AUC y elección del umbral

Qué aprendiste

  • El modelo entrega un puntaje; el umbral lo decides tú.
  • Cada umbral es un punto; el modelo es la curva completa.
  • El AUC resume toda la curva, pero no fija el umbral.

Qué no debes confundir

  • Punto de operación ≠ modelo (C2 P9).
  • AUC alto ≠ exactitud alta.
  • Subir el umbral baja TPR y FPR a la vez: no van en sentidos opuestos.

Procedimiento para el papel

  1. Un modelo es una curva, no un punto.
  2. Compara umbral a umbral: ¿uno tiene mayor TPR y menor FPR en todos?
  3. Si domina en todos, es mejor sin ambigüedad.
  4. Si se cruzan, depende del punto de operación.

Viene de: Clase 13 · Precisión, sensibilidad, exactitud y F1 · Sigue: Clase 15 · Árboles de decisión

Vuelve a tu activación: El modelo rojo tiene más TPR en un umbral y el naranjo en otro. ¿Cuál es mejor? ¿Cambiarías tu respuesta?

Pregunta final. Dos curvas ROC se cruzan. ¿Puedes decir cuál modelo es mejor sin más información?
Respuesta correcta y cómo se resuelve

No: depende del punto de operación, es decir, del costo relativo de falsos positivos y negativos. Solo una curva que domina en todos los umbrales es mejor sin ambigüedad. [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §7]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 15 · Árboles de decisión