Objetivo. Distinguir un problema de clasificación de uno de regresión, y explicar qué cambia en el error.
- Evidencia de aprendizaje: Decide el tipo de problema por el target y justifica por qué el MAE no aplica a clases.
- Actividad final: Clasificar cinco targets como regresión o clasificación, con su justificación.
- Criterio de dominio: Decide por el target y no por las features, y reconoce una categoría con una variable numérica de fondo.
Clasificación
La misma ecuación que en regresión. Lo que cambia es qué haces con el número que sale.
Datito · concepto 10 del currículum · prerrequisito: regresión
Estructura de 07_DATITO/curriculum.yaml, campo prerrequisitos. Este documento se detiene justo antes de la matriz de confusión: ese concepto ya lo tienes en matriz_confusion.html, las métricas en metricas_clasificacion.html y el umbral recorrido entero en roc_auc.html. Aquí no se repiten.
1 · La situación, antes de cualquier fórmula
Sales a terreno con una huincha. A cada animal que encuentras le mides dos cosas: el tamaño del animal y el tamaño de la oreja. Y anotas si es perro o gato, porque lo estás viendo.
Vuelves con una tabla de 28 filas. Mañana te van a pasar las medidas de un animal que no viste, sin decirte qué es, y tienes que responder: perro o gato.
Este ejemplo es de tu profesor, no inventado:
Fíjate en lo que acaba de cambiar respecto a Melbourne. Allí tu modelo respondía 910.000 AUD y el error era una distancia: fallaste por 188.218 AUD. Aquí tu modelo responde perro. No existe fallar por poco. O es perro, o no lo es.
2 · Por qué no puedes usar MAE aquí
Objeción razonable: si a las clases les pongo números —0, 1, 2— ya puedo restarlas. ¿Por qué no calculo el MAE y listo?
Porque para que una resta signifique algo, los números tienen que traer dos cosas: orden y distancia. Las categorías no traen ninguna de las dos.
Tu profesor, cuando preguntó en clase cuál es la diferencia entre una variable categórica y una numérica:
Justo antes, un compañero lo había dicho con la idea de interpolar: entre 1 y 2 hay 1,5, pero entre perro y gato no hay nada [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:10:28–0:10:43].
Cualitativo no es lo mismo que categórico
Otro compañero preguntó si la diferencia era «cualitativa contra cuantitativa». El profesor dijo que no necesariamente, con este ejemplo:
O sea: cualitativo / cuantitativo habla de cómo se obtuvo el dato (lo juzga una persona o lo mide un instrumento); categórico / numérico habla de qué operaciones admite (ordenar, interpolar). La nota del paisaje es cualitativa y numérica a la vez [INFERENCIA].
¿El «nivel de dolor de 1 a 10» que anota un paciente es categórico?
Respuesta correcta y cómo se resuelve
Respuesta: no: es numérico y cualitativo, como el paisaje del profesor.
Cómo se resuelve: dos preguntas separadas. (1) ¿Lo mide un instrumento o lo juzga una persona? Lo juzga el paciente → cualitativo. (2) ¿Tiene orden y tiene sentido un punto medio? 4 < 6 y un 5 está entre medio → numérico.
Error típico: decir «es categórico porque lo decide una persona». Eso confunde cómo se obtuvo el dato con qué operaciones admite.
Fuente: análogo al paisaje del profesor (cita de arriba); el dolor es [DATITO].
Y esto no es filosofía: lo puedes ver fallar con tus propios datos
Esta es la matriz de confusión real de tu desafío Galaxy Zoo, modelo CatBoost, 1.000 galaxias OOF. Tres clases: ambigua, espiral, elíptica.
Cifras verificadas en 08_PROYECTO_FCD/Desafio/REPORT.md §«OOF CatBoost, argmax normal».
Antes de tocar nada. Voy a cambiar qué número le toca a cada clase —nada más que eso, el modelo y sus 1.000 predicciones quedan idénticos—. ¿Qué se mueve?
Respuesta correcta y cómo se resuelve
Respuesta: solo el MAE; la exactitud no se mueve.
Cómo se resuelve: la exactitud solo pregunta si el código predicho es igual al real: renombrar las clases no convierte un acierto en error, y sigue en 774/1.000 = 0,774. El MAE resta códigos: con ambigua = 0, espiral = 1, elíptica = 2, las 74 confusiones ambigua↔elíptica (35 + 39) valen 2 y el resto de los errores vale 1 → (152 + 2·74)/1.000 = 0,300. Si pones elíptica en el medio, el par a distancia 2 pasa a ser ambigua↔espiral (36 + 18 = 54): (172 + 2·54)/1.000 = 0,280. Si pones ambigua en el medio, el par lejano es espiral↔elíptica (33 + 65 = 98): (128 + 2·98)/1.000 = 0,324.
Error típico: «las dos», pensando que cualquier cambio de codificación mueve cualquier métrica.
Fuente: matriz OOF de [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §«OOF CatBoost, argmax normal»]; cálculo [INFERENCIA].
Asigna los códigos. Elige en qué orden numeras las tres clases:
| Real ↓ / Predicho → | — | — | — |
|---|
La exactitud no se mueve: 0,774 siempre. El MAE recorre 0,280 → 0,300 → 0,324, un 16 % de diferencia, y lo único que cambió fue cuál clase pusiste en el medio. Esa decisión no tiene ningún significado: nadie puede decir que «espiral» esté entre «ambigua» y «elíptica».
El argumento completo, en una línea: una métrica cuyo valor depende de una decisión arbitraria del analista no está midiendo el modelo. Está midiendo la decisión.
¿Por qué solo hay tres valores distintos de MAE y no seis?
Respuesta correcta y cómo se resuelve
Respuesta: porque el MAE sobre códigos solo depende de qué par de clases quedó en los extremos, y hay solo tres pares posibles.
Cómo se resuelve: con tres códigos 0, 1, 2, un par de clases queda a distancia 2 (los extremos) y los otros dos a distancia 1. Invertir el orden completo —0,1,2 por 2,1,0— deja los mismos extremos, porque |a − b| = |b − a|. Seis órdenes, de a dos iguales: tres valores (0,280 · 0,300 · 0,324).
Error típico: pensar que cada orden da un MAE distinto, sin ver la simetría de la resta en valor absoluto.
Fuente: [INFERENCIA] sobre la matriz de [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md].
El matiz que el profesor sí distingue: categorías que esconden un número
Un compañero propuso adulto joven / adulto mayor como categoría. El profesor respondió que eso está en una zona gris, porque por debajo hay una variable numérica que sí se ordena. Minutos después, otro compañero planteó frío / templado / caliente [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:14:02–0:14:17], y el profesor le contestó con la misma idea:
Lo que dijo el profesor es eso: si la categoría es un tramo de una variable numérica (edad, temperatura), conserva el orden de esa variable. Para él, una categoría «de verdad» es la que no está asociada a ninguna variable numérica (hombre / mujer, árbol / planta, círculo / cuadrado / triángulo).
Categoría que discretiza un número (adulto joven / mayor · frío / mediano / caliente): hereda el orden de la edad o la temperatura. También del profesor.
Numérica: orden y punto medio con sentido; se puede restar. Por eso el MAE la necesita.
[DATITO] En vocabulario estándar, las dos primeras se llaman nominal y ordinal, y la ordinal tiene orden pero no distancia: no puedes afirmar que frío→templado sea igual a templado→caliente.
Aplicado: el Certamen 1 preguntó qué modelo predice una salida «bueno / regular / malo», y la respuesta es clasificación multiclase, aunque esas categorías tengan orden: certamen_1.html#p6. En el Certamen 2 la distinción vecina es qué cantidad describe un clasificador: certamen_2.html#p4.
V/F con justificación: «Como "bueno / regular / malo" tiene orden, predecirlo es un problema de regresión».
Respuesta correcta y cómo se resuelve
Respuesta: falso: es clasificación multiclase, porque la salida son tres categorías y no un número con punto medio.
Cómo se resuelve: (1) ¿cuál es el target? La etiqueta de calidad. (2) ¿Toma valores numéricos con punto medio con sentido? No: entre «regular» y «bueno» no hay un «regular y medio» medible. (3) Entonces el modelo tiene que elegir cuál de tres etiquetas → clasificación. Que las etiquetas tengan orden permite, a lo más, tratarlas con cuidado (confundir «malo» con «bueno» es peor que confundirlo con «regular»), pero no las convierte en un número.
Error típico: confundir «tiene orden» con «es numérica». Tener orden no basta para restar.
Fuente: [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html · P6] (respuesta verificada allí); el argumento del punto medio, de la clase (cita de arriba) y [INFERENCIA].
3 · Lo que no cambia respecto a regresión
Antes de mirar lo nuevo, conviene ver cuánto se reutiliza. El profesor abrió la clase diciendo que sería muy parecida a la de regresión, con los mismos componentes, pero para clasificación [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:04:20–0:04:31].
| Pieza | En regresión (Melbourne) | En clasificación (perro/gato) |
|---|---|---|
Datos de entrada x | Rooms, Distance, Bathroom… | tamaño, tamaño de oreja |
Etiqueta real y | Price — un número | perro / gato — una categoría |
| Lo que se busca | una función ŷ = f(x). Idéntico. | |
El gorrito ŷ | predicción del modelo. Sin gorrito, el dato real. Idéntico. | |
| Supervisado | sí, en los dos: entrenas con y a la vista. Idéntico. | |
| Generalizar | separar train de test, validación cruzada. Idéntico. | |
| La diferencia | el tipo de y. Eso es todo. Y arrastra todo lo demás. | |
x₁ y x₂ son numéricas —centímetros— y aun así es clasificación, porque lo que se predice es una categoría.
Al revés también: si tus features son categóricas hay que codificarlas. Cuando un compañero preguntó si estaba mal darle un valor numérico a una categórica, el profesor respondió que un modelo matemático no entiende «perro» o «gato» y que hay que transformarlo con one-hot encoding [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:15:10–0:15:48]. Eso —one-hot, como hiciste con Type, Method y Regionname en Melbourne— no convierte el problema en clasificación. Melbourne tiene tres features categóricas y sigue siendo regresión, porque Price es un número.
Cuatro casos para separarlo de una vez: ¿regresión o clasificación? (1) Precio de una propiedad de Melbourne · (2) forma de una galaxia · (3) si una propiedad se vende sobre el millón · (4) cuántos días tarda en venderse.
Respuesta correcta y cómo se resuelve
Respuesta: (1) regresión · (2) clasificación de 3 clases · (3) clasificación binaria · (4) regresión.
| Problema | Target | Tarea |
|---|---|---|
| Precio de una propiedad de Melbourne | Price, en AUD | Regresión |
| Forma de una galaxia | ambigua / espiral / elíptica | Clasificación (3 clases) |
| Si una propiedad se vende sobre el millón | sí / no | Clasificación binaria |
| Cuántos días tarda en venderse | días, un número | Regresión |
Cómo se resuelve: para cada uno, escribe el target y pregúntale si tiene punto medio con sentido. Precio y días: sí → regresión. Forma y «sobre el millón»: son etiquetas → clasificación. La tercera fila es la interesante: es el mismo dataset de Melbourne. Cambiaste el target de un número a un sí/no y cambiaste de tarea. El dato no manda; manda qué le preguntas.
Error típico: decidir por las features («Melbourne tiene Type y Regionname, entonces es clasificación»).
Fuente: [DATITO] sobre la definición de clasificación de la clase: etiqueta categórica [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:00:32–0:00:37].
4 · Entonces, ¿qué es un modelo de clasificación?
En regresión el modelo lineal era una recta que pasaba por los puntos: para cada x te daba una altura, y esa altura era la predicción.
En clasificación la recta hace lo contrario: separa los puntos. Ya no te da una altura; te dice de qué lado caes.
Regresión
La recta atraviesa la nube. La predicción es la altura de la recta. El error es la distancia vertical de cada punto a la recta.
Clasificación
La recta divide el plano. La predicción es el lado. El error es un conteo: cuántos quedaron del lado equivocado.
Y sin embargo la ecuación es la misma. Un modelo lineal de clasificación calcula un número, exactamente como en regresión:
La diferencia está en el paso siguiente. En regresión, s era la respuesta. Aquí, solo importa su signo:
Esa aclaración es del profesor, al presentar el support vector machine (SVM). El SVM no está entre los 21 conceptos del currículum de Datito: aquí solo importa la idea de las etiquetas.
Y la frontera —la línea del dibujo— es exactamente el conjunto de puntos donde el score vale cero:
Qué es dato, qué aprende la máquina, qué decides tú
| Símbolo | Qué es | De dónde sale |
|---|---|---|
x₁, x₂ | tamaño y oreja de un animal | dato. Lo mediste tú con la huincha |
y | perro o gato, de verdad | dato. Solo lo tienes en el conjunto de entrenamiento |
w₁, w₂ | cuánto pesa cada medida | lo aprende el modelo al ajustarse |
b | desplaza la frontera del origen | lo aprende el modelo |
ŷ | lo que el modelo responde | sale de aplicar la fórmula |
| qué es «positivo» | que perro sea +1 y gato −1 | lo decides tú. El modelo no tiene opinión |
5 · Muévela tú
Abajo están los 28 animales. El color del borde es la clase real. El fondo es lo que el modelo responde. Cuando un punto queda sobre un fondo de otro color, es un error: aparece con un aspa.
Antes de mover los controles. Vas a girar la recta de a poquito, un grado a la vez. El número de errores, ¿cómo se va a comportar?
Respuesta correcta y cómo se resuelve
Respuesta: a saltos: el número de errores se queda quieto varios grados y después cambia un entero de golpe.
Cómo se resuelve: un error es un animal del lado equivocado de la recta. Mientras giras, el conteo solo cambia cuando la recta pasa por encima de un animal; entre un cruce y otro, ningún animal cambia de lado y el conteo no se mueve. Nunca puede dar 2,4 errores: se cuentan animales enteros.
Error típico: «suave, de a fracciones», trasladando la intuición del MAE de regresión, que sí se mueve de a centavos.
Fuente: [DATITO] sobre el ejemplo perro/gato del profesor; la pérdida 0-1 se define en el §6.
Las dos medidas están normalizadas a [0, 1] antes de entrar a la fórmula —tamaño entre 10 y 75 cm, oreja entre 3 y 17 cm—, así w₁ y w₂ son comparables entre sí y la distancia a la recta se lee en las mismas unidades para ambos ejes.
Lo que tenías que ver
- El error salta. Giras un grado y nada; giras otro y de repente bajaste un error entero. Nunca vas a ver 2,4 errores. Esa es toda la diferencia con regresión: allí el error se movía de a centavos y podías derivarlo para saber hacia dónde ir. Aquí no hay pendiente que seguir.
- El chihuahua no tiene arreglo. Es un perro pequeño con orejas modestas, metido entre los gatos. Ninguna recta lo salva sin llevarse media docena de gatos por delante.
- Con el mismo número de errores, hay rectas mejores que otras. Dos rectas pueden fallar exactamente en los mismos animales y aun así una te da más confianza: la que deja más espacio libre a cada lado. El número de errores no las distingue; el margen sí.
Tu profesor, sobre el punto 2:
Y siguió: la naturaleza no es 100 % perfecta, hay perros que parecen gatos y gatos que parecen perros [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:22:56–0:23:03]. Un 100 % en test no es un logro: es una alarma de fuga de información o de un test mal armado [INFERENCIA].
Otra forma de clasificar: por vecinos, y con una probabilidad
Antes del modelo lineal, el profesor mostró la idea de cercanía con el k vecinos más cercanos (KNN): para clasificar un punto nuevo, miras sus k vecinos del entrenamiento y votan.
Fíjate en lo que acaba de aparecer: el modelo no solo dice «triángulo», dice «triángulo con probabilidad 2/3». Si decides «triángulo» cuando esa probabilidad pasa de 0,5, elegiste un umbral. Moverlo cambia qué casos se declaran positivos, y recorrer todos los umbrales es la curva ROC: roc_auc.html. El Random Forest hace algo parecido: si 3 de 4 árboles dicen perro, 75 % de probabilidad de perro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:31:53–1:32:09].
Con K = 5, los vecinos de un punto nuevo son 3 círculos y 2 triángulos. ¿Qué responde el modelo, con qué probabilidad, y qué pasa si exiges al menos 0,7 para decir «círculo»?
Respuesta correcta y cómo se resuelve
Respuesta: responde círculo con probabilidad 3/5 = 0,6; con un umbral de 0,7, en cambio, el punto quedaría como triángulo.
Cómo se resuelve: probabilidad de círculo = votos de círculo / K = 3/5 = 0,60. Con la regla por defecto (gana la mayoría, o sea umbral 0,5): 0,60 ≥ 0,5 → círculo. Con umbral 0,7: 0,60 < 0,7 → no alcanza, se declara triángulo.
Error típico: creer que la clase que entrega el modelo es fija. Depende del umbral que tú eliges sobre la probabilidad; el modelo solo entrega el 0,6.
Fuente: mecanismo del KNN y la probabilidad por votos: cita de arriba; números [DATITO]; el umbral como decisión tuya: metricas_clasificacion.html.
6 · El error de clasificación, con notación
Si el error no es una distancia, ¿qué es? Es un conteo. Se llama pérdida 0-1, y es literalmente «cero si acerté, uno si fallé»:
Compáralo con lo que usabas en Melbourne:
y viva en una recta numérica. Es el supuesto que se rompe
Son la misma forma —promedio de algo por observación— y difieren en ese algo. El MAE pregunta cuánto me equivoqué. La pérdida 0-1 solo puede preguntar me equivoqué, sí o no.
Por eso ningún algoritmo de clasificación minimiza directamente el número de errores. Cada uno inventa algo derivable o buscable que se le parezca: el SVM maximiza el margen, el árbol reduce la impureza, la regresión logística minimiza una verosimilitud. Todos los modelos que vas a ver después son respuestas distintas a este mismo estorbo [DATITO].
El margen, que es lo que hace el SVM
Cuando sí existe una recta sin errores, el profesor mostró cómo se elige entre las infinitas que sirven: se toman los puntos más cercanos de cada clase —los vectores de soporte—, se trazan dos planos paralelos por ellos, y se busca la recta que hace esa franja lo más ancha posible.
La restricción es el truco elegante del ±1: si yᵢ = +1 exige que el score sea ≥ +1; si yᵢ = −1, al multiplicar por −1 exige que el score sea ≤ −1. Una sola línea cubre las dos clases.
El botón Ajustar el modelo de arriba hace justo eso, a lo bruto: prueba miles de rectas, se queda con las de menos errores y, entre ellas, con la que deja la calle más ancha.
7 · Camino inverso: te entregan la fórmula
En el certamen no te van a dar el gráfico. Te van a dar esto, escrito, y tendrás que reconstruir de qué habla.
1 · ¿Qué es cada cosa, y qué fenómeno describe?
Respuesta correcta y cómo se resuelve
Respuesta: es un clasificador lineal que separa perros de gatos con una recta en el plano (tamaño, oreja): x₁ y x₂ son datos, 0,82 y 0,57 son los pesos aprendidos, 0,55 es el desplazamiento, y el signo convierte el puntaje en una clase.
x₁,x₂: las dos medidas del animal, normalizadas. Dato.0,82y0,57: el vector w, lo que el modelo aprendió. Los dos son positivos, así que más tamaño y más oreja empujan hacia la clase positiva. Y 0,82 > 0,57: el tamaño pesa más que la oreja (se pueden comparar porque las dos medidas están normalizadas).0,55: elb. Es cuánto tiene que acumular un animal entre las dos medidas antes de que el modelo se atreva a decir «perro».signo(·): el paso que convierte un número continuo en una decisión discreta. Esta es la pieza que no existe en regresión.
Error típico: leer 0,82·x₁ + 0,57·x₂ − 0,55 como «la predicción». Es el puntaje; la predicción es su signo.
Fuente: ecuación y coeficientes ilustrativos [DATITO]; el esquema perro/gato con una recta es del profesor (cita del §1).
2 · Un animal mide 38 cm y tiene orejas de 12 cm. ¿Qué responde el modelo?
Respuesta correcta y cómo se resuelve
Respuesta: perro, porque el puntaje sale +0,170, positivo (aunque cerca de la frontera).
Primero normalizas, porque la fórmula está escrita en unidades normalizadas (tamaño entre 10 y 75 cm, oreja entre 3 y 17 cm):
x₁ = (38 − 10) / (75 − 10) = 28/65 = 0,431
x₂ = (12 − 3) / (17 − 3) = 9/14 = 0,643
Ahora sustituyes:
s = 0,82 · 0,431 + 0,57 · 0,643 − 0,55
s = 0,353 + 0,366 − 0,55 = +0,170
El signo es positivo → perro. Y fíjate: 0,170 es un número chico. El modelo dice «perro» con la misma cara con la que lo diría si el puntaje fuera 0,9 — el signo no guarda memoria de cuán cerca estuvo. Ese descarte de información es lo que la curva ROC recupera cuando dejas de mirar el signo y miras el puntaje: roc_auc.html.
Error típico: sustituir 38 y 12 directamente, sin normalizar: s = 0,82·38 + 0,57·12 − 0,55 = 37,5, un número sin sentido en esta escala (aquí da el mismo signo por casualidad).
Fuente: [DATITO] (cifras ilustrativas).
3 · ¿Cuánto tendría que valer b para que ese mismo animal saliera gato, sin tocar w?
Respuesta correcta y cómo se resuelve
Respuesta: cualquier b mayor que 0,719 (por ejemplo 0,75).
Cómo se resuelve: necesitas s < 0, o sea 0,353 + 0,366 − b < 0, o sea b > 0,719. Con b = 0,75 el puntaje pasa a −0,031 y el modelo dice gato.
La relación que hay que nombrar: mover b dejando w fijo desplaza la recta en paralelo, sin girarla. Cambiar w la gira. Compruébalo con los dos deslizadores de arriba: uno inclina, el otro traslada. Y el corolario: subir b hace al modelo más exigente para declarar «perro» — declarará menos perros, se le escaparán perros de verdad, pero casi todos los que declare lo serán. Ese es el umbral que recorre la curva ROC.
Error típico: responder «b < 0,719» por invertir la desigualdad al despejar un término con signo menos.
Fuente: [DATITO] (cifras ilustrativas); el umbral como decisión: metricas_clasificacion.html.
8 · Qué cantidad describe qué objeto
Esto es una pregunta del Certamen 2 con nombre y apellido (ficha P4: certamen_2.html#p4). No pide calcular: pide clasificar la cantidad.
| Cantidad | ¿Qué objeto describe? | ¿Existe si no hay clases? |
|---|---|---|
| Media, mediana, varianza, IQR | una variable | Sí |
| MAE, RMSE, R² | un modelo de regresión | Sí, si el target es numérico |
| VP, VN, FP, FN, exactitud, precisión, recall, FPR, F1, AUC | un clasificador | No |
| Impureza de Gini, entropía | criterio de entrenamiento de un árbol | No |
Margen 2/‖w‖ | criterio de entrenamiento de un SVM | No |
Una cantidad que describe una variable —la varianza— existe con o sin clases, con o sin modelo, con o sin nada. Le basta una columna de números.
Por eso, ante «¿cuál de estas no es una métrica de evaluación de un clasificador?», la varianza se cae sola.
Ficha P4 en 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · certamen_2.html#p4.
¿Cuál de estas no describe a un clasificador: precisión, FPR, varianza, AUC?
Respuesta correcta y cómo se resuelve
Respuesta: la varianza.
Cómo se resuelve: pregunta a cada una si existiría sin clases. Precisión y FPR necesitan falsos positivos, que solo existen si hay una clase positiva; el AUC se arma con TPR y FPR. La varianza solo necesita una columna de números: describe una variable, no un modelo.
Error típico: elegir el AUC «porque es un área y no un porcentaje». Sigue siendo una medida del clasificador.
Fuente: [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, ficha P4].
Y una que se cuela seguido: la impureza de Gini necesita clases, sí, pero no es una métrica de evaluación — es lo que el árbol usa mientras se construye, para decidir por dónde cortar (el profesor la calculó en clase [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:22:15–1:22:31]). Evaluar y entrenar son momentos distintos del ciclo.
Tu profesor cerró la clase con la importancia de variables en un Random Forest, y la explicó contando, no con impureza:
Es lo mismo que dice la lámina 38: se estima la importancia «contando cuántas veces cada variable fue escogida por cada árbol como relevante» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 38]. La importancia por reducción de impureza (la que entrega scikit-learn) es otra forma de medirla: viene de tu trabajo en los proyectos, no de la clase [INFERENCIA]. Más en arboles_y_ensambles.html#random-forest.
9 · Procedimiento para el papel
Cuatro pasos, para cuando te den un enunciado y tengas que decidir qué es.
- Escribe cuál es el target. Literalmente, la columna. No «predecir ventas»: la columna
monto_venta. - Pregúntale al target si tiene orden. ¿Puedes decir que un valor va antes que otro, y que entre dos hay un valor intermedio con sentido? Si sí → regresión. Si no → clasificación. Si son categorías con orden (bueno/regular/malo, frío/templado/caliente) → sigue siendo clasificación: el modelo elige una etiqueta (Certamen 1, P6); si te piden tratarlo de otra forma, declara el supuesto [DATITO].
- No mires las features para decidir esto. Features categóricas se codifican con one-hot y no cambian la tarea. Melbourne tiene tres y sigue siendo regresión.
- Declara la clase positiva antes de calcular nada. En binaria, escribe «positivo = X» en el margen de la hoja. Sin eso, precisión y recall no significan nada, y todas las preguntas siguientes se construyen sobre esa elección.
10 · Errores que este formato castiga
- Usar R² o MAE para describir un clasificador. Cuando un compañero preguntó si estas métricas reemplazaban al R², el profesor respondió que el R² se usa para regresión y que en clasificación se miden otros tipos de errores [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:11:39–1:12:26].
- Decidir la tarea mirando las features en vez del target. Tres columnas categóricas no hacen clasificación.
- Codificar una categórica nominal como 0, 1, 2 y tratarla como número. Acabas de ver el MAE moverse 16 % por una decisión sin contenido.
- Confundir el score con la probabilidad.
w·x − bpuede dar −3,7 o +12. No es una probabilidad; es una distancia con signo. - Reportar un 100 % sin sospechar. El profesor dijo que de un modelo 100 % perfecto «al tiro» duda (cita del §5). Tú ya tienes un caso de número inflado:
99_ARCHIVO/_obsoleto_split_aleatorio/anunciaba 81 % con split aleatorio y estaba mal medido. - Diagnosticar mirando un solo número. Tu error registrado del 19 de septiembre es exactamente este, en sobreajuste. Aquí reaparece: exactitud sola no te dice qué clase estás hundiendo — para eso necesitas la matriz, que es el concepto siguiente.
11 · Qué tendrías que producir para demostrar que entendiste
APLICAR — con material del curso
06_LABORATORIOS/2026_[P5]Clasificación(vacio).ipynb. Los primeros ejercicios son codificación de categóricas a mano, get_dummies y LabelEncoder.
La pregunta que importa mientras lo resuelves: LabelEncoder convierte tus categorías en 0, 1, 2. Acabas de ver que eso es peligroso. ¿En qué caso es inofensivo y en cuál no? Escribe la respuesta antes de seguir.
Respuesta correcta y cómo se resuelve
Respuesta: es inofensivo para codificar el target de un clasificador y peligroso para codificar una feature categórica sin orden.
Cómo se resuelve: un clasificador trata los valores del target como nombres de clases: le da lo mismo que «gato» sea 0 o 2, porque solo compara si acertó. En cambio, si codificas una feature (por ejemplo, fruta = 0, 1, 2, 3, 4) y se la pasas a un modelo que suma o mide distancias (regresión lineal, KNN), el modelo cree que la fruta 4 es «el doble» de la 2 y que la 1 está «entre» la 0 y la 2: un orden y una distancia inventados. Para features se usa one-hot (get_dummies). Y si con el target codificado calculas un MAE, reaparece el problema del §2.
Error típico: usar LabelEncoder en todas las columnas «porque es más corto».
Fuente: el propio P5 aconseja usarlo «solo en la variable objetivo» [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.244]; la razón es [INFERENCIA] a partir del §2.
TRANSFERIR — otro dominio, sin galaxias ni casas
CONAF monitorea plantaciones de pino en la Región del Biobío con imágenes satelitales. Cada rodal tiene dos índices numéricos —vigor de la copa y humedad foliar— y se etiqueta en tres estados: sano, con plaga, con estrés hídrico. De 2.400 rodales, 2.050 están sanos.
Responde por escrito, para Datito:
- ¿Regresión o clasificación? Justifica desde el target, no desde las features.
- Un colega propone codificar sano=0, plaga=1, estrés=2 y evaluar con MAE. Dale un argumento cuantitativo de por qué no, del mismo tipo que el de Galaxy Zoo.
- Un modelo reporta 85 % de exactitud. ¿Por qué esa cifra, sola, no te deja dormir tranquilo? (La respuesta está en los 2.050.)
- Si tuvieras que elegir una clase positiva para armar una detección binaria, ¿cuál eliges y por qué esa decisión no es del modelo?
Respuesta correcta y cómo se resuelve
Respuesta en una frase: es clasificación de tres clases; el MAE depende de un orden arbitrario; el 85 % no supera a responder siempre «sano»; y la clase positiva la eliges tú según qué error cuesta más.
- Clasificación multiclase. El target es el estado del rodal (sano / plaga / estrés): no hay un «plaga y media» entre plaga y estrés, así que no tiene punto medio. Que los dos índices sean numéricos es irrelevante: la tarea la define el target.
- El MAE depende del orden que inventes. Con una matriz ilustrativa [DATITO] de 2.400 rodales donde los errores son sano→plaga 30, sano→estrés 20, plaga→sano 40, plaga→estrés 30, estrés→sano 25, estrés→plaga 35: con sano = 0, plaga = 1, estrés = 2, el par a distancia 2 es sano↔estrés (20 + 25 = 45) y MAE = (135 + 2·45)/2.400 ≈ 0,094. Con sano = 0, estrés = 1, plaga = 2, el par lejano pasa a ser sano↔plaga (30 + 40 = 70) y MAE = (110 + 2·70)/2.400 ≈ 0,104. Mismo modelo, mismas predicciones, 11 % de diferencia por una decisión sin significado ecológico.
- Porque 2.050/2.400 = 85,4 %. Un modelo que responde siempre «sano» ya saca 85 % sin aprender nada. El 85 % reportado no demuestra que el modelo detecte plagas ni estrés. Es el mismo mecanismo que hace que tu desafío se evalúe con F1-macro: la clase 2 de Galaxy Zoo es el 67,7 %.
- Positivo = «con plaga» (o «con estrés», según el objetivo). Depende del costo de cada error —no detectar una plaga cuesta hectáreas; una falsa alarma cuesta una inspección—, y ese costo lo pone la persona que decide, no el algoritmo.
Error típico: en 1, decir «regresión porque los índices son numéricos»; en 3, aceptar el 85 % sin compararlo con el modelo tonto.
Fuente: caso y cifras ilustrativas [DATITO]; el argumento del MAE es el del §2 con la matriz real de 08_PROYECTO_FCD/Desafio/REPORT.md.
PRODUCIR — explícaselo a alguien
Un compañero te dice: «si a perro, gato y conejo les pongo 0, 1 y 2, ya puedo usar el MAE como en Melbourne». Explícale en cinco líneas, sin fórmulas, por qué no.
Respuesta correcta y cómo se resuelve
Respuesta en una frase: no, porque el MAE resta los códigos y esa resta inventa un orden y una distancia que las categorías no tienen; el resultado depende de qué número le pusiste a cada animal.
Respuesta modelo [DATITO]: «El MAE mide cuánto te equivocaste restando lo que dijiste menos lo que era. Con precios eso tiene sentido: equivocarte por 10.000 es menos grave que por 100.000. Pero con animales no: si pones perro = 0, gato = 1, conejo = 2, el MAE dice que confundir perro con conejo es el doble de grave que confundirlo con gato, y eso lo decidiste tú al numerar. Cambia la numeración y cambia el MAE, aunque el modelo sea el mismo; en tu Galaxy Zoo pasa de 0,280 a 0,324. Para categorías se cuenta si acertaste o no: exactitud y, mejor, la matriz de confusión.»
Criterios para corregir la tuya: nombra la resta; dice que el orden de los códigos es arbitrario; da un ejemplo de que el número cambia sin que cambie el modelo; propone qué usar en su lugar.
Error típico: responder «porque no son números», sin decir qué operación falla. Sí son números después de codificar; lo que no tienen es orden ni distancia.
Fuente: argumento del profesor sobre el orden (cita del §2); cifras de Galaxy Zoo de 08_PROYECTO_FCD/Desafio/REPORT.md [INFERENCIA]; redacción [DATITO]. Si quieres que corrija tu versión, llévala a Datito.
Lo que sigue: una vez que aceptas que el error es un conteo y no una distancia, la pregunta obvia es qué clase de errores estás cometiendo. Ahí entra la matriz de confusión — matriz_confusion.html —, después las métricas que salen de ella — metricas_clasificacion.html — y el umbral recorrido entero — roc_auc.html.
Cierre de la Clase 11 · Clasificación: cuando la etiqueta no es un número
Qué aprendiste
- Clasificar es predecir una categoría.
- Una variable categórica no tiene orden entre sus valores.
- El modelo puede entregar una probabilidad, no solo una clase.
- Un modelo 100 % perfecto es sospechoso.
Qué no debes confundir
- Categórica ≠ cualitativa.
- Categoría ≠ discretización de un número.
- Lo que define la tarea es el target, no las features.
Procedimiento para el papel
- Mira el target: ¿número o categoría?
- ¿Tiene orden? ¿Hay una variable numérica de fondo?
- Elige la tarea según para qué usarás la predicción.
Viene de: Clase 10 · Overfitting y underfitting · Sigue: Clase 12 · Matriz de confusión
Vuelve a tu activación: «Frío, templado, caliente»: ¿es un problema de clasificación o de regresión? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Regresión si interesa el valor, porque es un número con distancia; clasificación si solo interesa aprobado o reprobado. Lo decide el uso de la predicción. [INFERENCIA] Así lo planteó el profesor a un grupo: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md · 1:57:26]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.