Unidad 4 · Clasificar y evaluarClase 11 de 23
Clase 11 · Clasificación: cuando la etiqueta no es un número

Objetivo. Distinguir un problema de clasificación de uno de regresión, y explicar qué cambia en el error.

Ficha Bloom · Analizar
  • Evidencia de aprendizaje: Decide el tipo de problema por el target y justifica por qué el MAE no aplica a clases.
  • Actividad final: Clasificar cinco targets como regresión o clasificación, con su justificación.
  • Criterio de dominio: Decide por el target y no por las features, y reconoce una categoría con una variable numérica de fondo.
Activación. «Frío, templado, caliente»: ¿es un problema de clasificación o de regresión? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Clasificación

La misma ecuación que en regresión. Lo que cambia es qué haces con el número que sale.

Datito · concepto 10 del currículum · prerrequisito: regresión

regresión→ clasificación→ matriz de confusión→ precisión · recall · F1→ ROC y AUC

Estructura de 07_DATITO/curriculum.yaml, campo prerrequisitos. Este documento se detiene justo antes de la matriz de confusión: ese concepto ya lo tienes en matriz_confusion.html, las métricas en metricas_clasificacion.html y el umbral recorrido entero en roc_auc.html. Aquí no se repiten.

1 · La situación, antes de cualquier fórmula

Sales a terreno con una huincha. A cada animal que encuentras le mides dos cosas: el tamaño del animal y el tamaño de la oreja. Y anotas si es perro o gato, porque lo estás viendo.

Vuelves con una tabla de 28 filas. Mañana te van a pasar las medidas de un animal que no viste, sin decirte qué es, y tienes que responder: perro o gato.

Este ejemplo es de tu profesor, no inventado:

«yo estoy midiendo el tamaño del animal y el tamaño de las orejas […] ajustar un modelo que […] digo todo lo que está hacia arriba es perro y todo lo que está hacia abajo es gato» Clase del 7-ago · 0:05:05–0:06:57 (dos tramos: 0:05:05–0:05:10 y 0:06:46–0:06:57; […] = salto de 1:36 en que muestra perros y gatos uno por uno) · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Fíjate en lo que acaba de cambiar respecto a Melbourne. Allí tu modelo respondía 910.000 AUD y el error era una distancia: fallaste por 188.218 AUD. Aquí tu modelo responde perro. No existe fallar por poco. O es perro, o no lo es.

La idea que hay que llevarse En regresión predices cuánto. En clasificación predices cuál. Y como «cuál» no vive en una recta numérica, todo lo que medía distancias —MAE, RMSE, R²— deja de tener sentido y hay que construir otra forma de contar los errores.

2 · Por qué no puedes usar MAE aquí

Objeción razonable: si a las clases les pongo números —0, 1, 2— ya puedo restarlas. ¿Por qué no calculo el MAE y listo?

Porque para que una resta signifique algo, los números tienen que traer dos cosas: orden y distancia. Las categorías no traen ninguna de las dos.

Tu profesor, cuando preguntó en clase cuál es la diferencia entre una variable categórica y una numérica:

«la diferencia es que la variable categórica no tiene una noción de orden entonces si digo perro gato conejo yo no puedo decir el perro viene antes que el gato o después del gato» Clase del 7-ago · 0:10:43–0:10:59 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Justo antes, un compañero lo había dicho con la idea de interpolar: entre 1 y 2 hay 1,5, pero entre perro y gato no hay nada [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:10:28–0:10:43].

Cualitativo no es lo mismo que categórico

Otro compañero preguntó si la diferencia era «cualitativa contra cuantitativa». El profesor dijo que no necesariamente, con este ejemplo:

«voy a observar un paisaje y le voy a asignar un número de 1 a 5 de acuerdo a qué tan bonito el paisaje es un numérico y es cualitativo» Clase del 7-ago · 0:11:24–0:11:39 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

O sea: cualitativo / cuantitativo habla de cómo se obtuvo el dato (lo juzga una persona o lo mide un instrumento); categórico / numérico habla de qué operaciones admite (ordenar, interpolar). La nota del paisaje es cualitativa y numérica a la vez [INFERENCIA].

¿El «nivel de dolor de 1 a 10» que anota un paciente es categórico?

Respuesta correcta y cómo se resuelve

Respuesta: no: es numérico y cualitativo, como el paisaje del profesor.

Cómo se resuelve: dos preguntas separadas. (1) ¿Lo mide un instrumento o lo juzga una persona? Lo juzga el paciente → cualitativo. (2) ¿Tiene orden y tiene sentido un punto medio? 4 < 6 y un 5 está entre medio → numérico.

Error típico: decir «es categórico porque lo decide una persona». Eso confunde cómo se obtuvo el dato con qué operaciones admite.

Fuente: análogo al paisaje del profesor (cita de arriba); el dolor es [DATITO].

Y esto no es filosofía: lo puedes ver fallar con tus propios datos

Esta es la matriz de confusión real de tu desafío Galaxy Zoo, modelo CatBoost, 1.000 galaxias OOF. Tres clases: ambigua, espiral, elíptica.

Cifras verificadas en 08_PROYECTO_FCD/Desafio/REPORT.md §«OOF CatBoost, argmax normal».

Antes de tocar nada. Voy a cambiar qué número le toca a cada clase —nada más que eso, el modelo y sus 1.000 predicciones quedan idénticos—. ¿Qué se mueve?

Respuesta correcta y cómo se resuelve

Respuesta: solo el MAE; la exactitud no se mueve.

Cómo se resuelve: la exactitud solo pregunta si el código predicho es igual al real: renombrar las clases no convierte un acierto en error, y sigue en 774/1.000 = 0,774. El MAE resta códigos: con ambigua = 0, espiral = 1, elíptica = 2, las 74 confusiones ambigua↔elíptica (35 + 39) valen 2 y el resto de los errores vale 1 → (152 + 2·74)/1.000 = 0,300. Si pones elíptica en el medio, el par a distancia 2 pasa a ser ambigua↔espiral (36 + 18 = 54): (172 + 2·54)/1.000 = 0,280. Si pones ambigua en el medio, el par lejano es espiral↔elíptica (33 + 65 = 98): (128 + 2·98)/1.000 = 0,324.

Error típico: «las dos», pensando que cualquier cambio de codificación mueve cualquier métrica.

Fuente: matriz OOF de [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md · §«OOF CatBoost, argmax normal»]; cálculo [INFERENCIA].

Asigna los códigos. Elige en qué orden numeras las tres clases:

Real ↓ / Predicho →———
Exactitud0,774774 aciertos de 1.000
MAE sobre los códigos0,300—
Clase en el medioespiralla que quedó con el código 1

La exactitud no se mueve: 0,774 siempre. El MAE recorre 0,280 → 0,300 → 0,324, un 16 % de diferencia, y lo único que cambió fue cuál clase pusiste en el medio. Esa decisión no tiene ningún significado: nadie puede decir que «espiral» esté entre «ambigua» y «elíptica».

El argumento completo, en una línea: una métrica cuyo valor depende de una decisión arbitraria del analista no está midiendo el modelo. Está midiendo la decisión.

¿Por qué solo hay tres valores distintos de MAE y no seis?

Respuesta correcta y cómo se resuelve

Respuesta: porque el MAE sobre códigos solo depende de qué par de clases quedó en los extremos, y hay solo tres pares posibles.

Cómo se resuelve: con tres códigos 0, 1, 2, un par de clases queda a distancia 2 (los extremos) y los otros dos a distancia 1. Invertir el orden completo —0,1,2 por 2,1,0— deja los mismos extremos, porque |a − b| = |b − a|. Seis órdenes, de a dos iguales: tres valores (0,280 · 0,300 · 0,324).

Error típico: pensar que cada orden da un MAE distinto, sin ver la simetría de la resta en valor absoluto.

Fuente: [INFERENCIA] sobre la matriz de [FUENTE · Repo: 08_PROYECTO_FCD/Desafio/REPORT.md].

El matiz que el profesor sí distingue: categorías que esconden un número

Un compañero propuso adulto joven / adulto mayor como categoría. El profesor respondió que eso está en una zona gris, porque por debajo hay una variable numérica que sí se ordena. Minutos después, otro compañero planteó frío / templado / caliente [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:14:02–0:14:17], y el profesor le contestó con la misma idea:

«la variable real que está midiendo adulto mayor o adulto joven es la edad y la edad yo sí la puedo ordenar […] es una discretización de una variable numérica […] frío mediano caliente está asociado a una temperatura como la altura» Clase del 7-ago · 0:12:19–0:14:25 (dos tramos: 0:12:19–0:12:33 sobre la edad y 0:14:17–0:14:25 sobre la temperatura; […] = omisiones) · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Lo que dijo el profesor es eso: si la categoría es un tramo de una variable numérica (edad, temperatura), conserva el orden de esa variable. Para él, una categoría «de verdad» es la que no está asociada a ninguna variable numérica (hombre / mujer, árbol / planta, círculo / cuadrado / triángulo).

Lo que es de Datito, no de la clase. Las palabras nominal y ordinal (en el sentido de tipos de variable) y la regla «orden sin distancia» no aparecen en las 14 transcripciones disponibles al 2026-09-21 (la única coincidencia es «precio nominal», en una presentación de alumnos del 14-ago): son vocabulario estándar que agrega Datito [DATITO]. Úsalas para ordenar tu cabeza, pero en el certamen justifica con el argumento del profesor: ¿hay una variable numérica debajo?, ¿tiene sentido un punto medio?
Distinción que vale puntos · Certamen 1, P6 Categoría sin orden (perro, gato, conejo · círculo, cuadrado, triángulo): no puedes decir cuál va antes. Así lo dijo el profesor.
Categoría que discretiza un número (adulto joven / mayor · frío / mediano / caliente): hereda el orden de la edad o la temperatura. También del profesor.
Numérica: orden y punto medio con sentido; se puede restar. Por eso el MAE la necesita.
[DATITO] En vocabulario estándar, las dos primeras se llaman nominal y ordinal, y la ordinal tiene orden pero no distancia: no puedes afirmar que frío→templado sea igual a templado→caliente.
Aplicado: el Certamen 1 preguntó qué modelo predice una salida «bueno / regular / malo», y la respuesta es clasificación multiclase, aunque esas categorías tengan orden: certamen_1.html#p6. En el Certamen 2 la distinción vecina es qué cantidad describe un clasificador: certamen_2.html#p4.

V/F con justificación: «Como "bueno / regular / malo" tiene orden, predecirlo es un problema de regresión».

Respuesta correcta y cómo se resuelve

Respuesta: falso: es clasificación multiclase, porque la salida son tres categorías y no un número con punto medio.

Cómo se resuelve: (1) ¿cuál es el target? La etiqueta de calidad. (2) ¿Toma valores numéricos con punto medio con sentido? No: entre «regular» y «bueno» no hay un «regular y medio» medible. (3) Entonces el modelo tiene que elegir cuál de tres etiquetas → clasificación. Que las etiquetas tengan orden permite, a lo más, tratarlas con cuidado (confundir «malo» con «bueno» es peor que confundirlo con «regular»), pero no las convierte en un número.

Error típico: confundir «tiene orden» con «es numérica». Tener orden no basta para restar.

Fuente: [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html · P6] (respuesta verificada allí); el argumento del punto medio, de la clase (cita de arriba) y [INFERENCIA].

3 · Lo que no cambia respecto a regresión

Antes de mirar lo nuevo, conviene ver cuánto se reutiliza. El profesor abrió la clase diciendo que sería muy parecida a la de regresión, con los mismos componentes, pero para clasificación [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:04:20–0:04:31].

PiezaEn regresión (Melbourne)En clasificación (perro/gato)
Datos de entrada xRooms, Distance, Bathroom…tamaño, tamaño de oreja
Etiqueta real yPrice — un númeroperro / gato — una categoría
Lo que se buscauna función ŷ = f(x). Idéntico.
El gorrito ŷpredicción del modelo. Sin gorrito, el dato real. Idéntico.
Supervisadosí, en los dos: entrenas con y a la vista. Idéntico.
Generalizarseparar train de test, validación cruzada. Idéntico.
La diferenciael tipo de y. Eso es todo. Y arrastra todo lo demás.
Lo que define la tarea [DATITO], y lo que dijo el profesor sobre las features categóricas Lo que define la tarea es el tipo del target, no el de las features. En el ejemplo del plano, x₁ y x₂ son numéricas —centímetros— y aun así es clasificación, porque lo que se predice es una categoría.

Al revés también: si tus features son categóricas hay que codificarlas. Cuando un compañero preguntó si estaba mal darle un valor numérico a una categórica, el profesor respondió que un modelo matemático no entiende «perro» o «gato» y que hay que transformarlo con one-hot encoding [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:15:10–0:15:48]. Eso —one-hot, como hiciste con Type, Method y Regionname en Melbourne— no convierte el problema en clasificación. Melbourne tiene tres features categóricas y sigue siendo regresión, porque Price es un número.

Cuatro casos para separarlo de una vez: ¿regresión o clasificación? (1) Precio de una propiedad de Melbourne · (2) forma de una galaxia · (3) si una propiedad se vende sobre el millón · (4) cuántos días tarda en venderse.

Respuesta correcta y cómo se resuelve

Respuesta: (1) regresión · (2) clasificación de 3 clases · (3) clasificación binaria · (4) regresión.

ProblemaTargetTarea
Precio de una propiedad de MelbournePrice, en AUDRegresión
Forma de una galaxiaambigua / espiral / elípticaClasificación (3 clases)
Si una propiedad se vende sobre el millónsí / noClasificación binaria
Cuántos días tarda en vendersedías, un númeroRegresión

Cómo se resuelve: para cada uno, escribe el target y pregúntale si tiene punto medio con sentido. Precio y días: sí → regresión. Forma y «sobre el millón»: son etiquetas → clasificación. La tercera fila es la interesante: es el mismo dataset de Melbourne. Cambiaste el target de un número a un sí/no y cambiaste de tarea. El dato no manda; manda qué le preguntas.

Error típico: decidir por las features («Melbourne tiene Type y Regionname, entonces es clasificación»).

Fuente: [DATITO] sobre la definición de clasificación de la clase: etiqueta categórica [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:00:32–0:00:37].

4 · Entonces, ¿qué es un modelo de clasificación?

En regresión el modelo lineal era una recta que pasaba por los puntos: para cada x te daba una altura, y esa altura era la predicción.

En clasificación la recta hace lo contrario: separa los puntos. Ya no te da una altura; te dice de qué lado caes.

Regresión

La recta atraviesa la nube. La predicción es la altura de la recta. El error es la distancia vertical de cada punto a la recta.

Clasificación

La recta divide el plano. La predicción es el lado. El error es un conteo: cuántos quedaron del lado equivocado.

Y sin embargo la ecuación es la misma. Un modelo lineal de clasificación calcula un número, exactamente como en regresión:

s(x) = w₁·x₁ + w₂·x₂ − b ese número s se llama score, y todavía no es una clase

La diferencia está en el paso siguiente. En regresión, s era la respuesta. Aquí, solo importa su signo:

ŷ = signo( s(x) )  →  +1 = perro  ·  −1 = gato el ±1 es una herramienta matemática para poder ajustar el modelo, no una afirmación de que perro «vale más» que gato

Esa aclaración es del profesor, al presentar el support vector machine (SVM). El SVM no está entre los 21 conceptos del currículum de Datito: aquí solo importa la idea de las etiquetas.

«a uno de los objetos le ponemos la etiqueta más uno y a la otra etiqueta al otro objeto le pongo la etiqueta menos uno entonces esto es solamente una […] herramienta matemática para poder ajustar el modelo» Clase del 7-ago · 0:25:54–0:26:16 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Y la frontera —la línea del dibujo— es exactamente el conjunto de puntos donde el score vale cero:

w₁·x₁ + w₂·x₂ − b = 0

Qué es dato, qué aprende la máquina, qué decides tú

SímboloQué esDe dónde sale
x₁, x₂tamaño y oreja de un animaldato. Lo mediste tú con la huincha
yperro o gato, de verdaddato. Solo lo tienes en el conjunto de entrenamiento
w₁, w₂cuánto pesa cada medidalo aprende el modelo al ajustarse
bdesplaza la frontera del origenlo aprende el modelo
ŷlo que el modelo respondesale de aplicar la fórmula
qué es «positivo»que perro sea +1 y gato −1lo decides tú. El modelo no tiene opinión

5 · Muévela tú

Abajo están los 28 animales. El color del borde es la clase real. El fondo es lo que el modelo responde. Cuando un punto queda sobre un fondo de otro color, es un error: aparece con un aspa.

Antes de mover los controles. Vas a girar la recta de a poquito, un grado a la vez. El número de errores, ¿cómo se va a comportar?

Respuesta correcta y cómo se resuelve

Respuesta: a saltos: el número de errores se queda quieto varios grados y después cambia un entero de golpe.

Cómo se resuelve: un error es un animal del lado equivocado de la recta. Mientras giras, el conteo solo cambia cuando la recta pasa por encima de un animal; entre un cruce y otro, ningún animal cambia de lado y el conteo no se mueve. Nunca puede dar 2,4 errores: se cuentan animales enteros.

Error típico: «suave, de a fracciones», trasladando la intuición del MAE de regresión, que sí se mueve de a centavos.

Fuente: [DATITO] sobre el ejemplo perro/gato del profesor; la pérdida 0-1 se define en el §6.

Errores2de 28 animales
Exactitud0,9291 − error 0-1
Punto más cercano0,01distancia a la recta
Haz clic en el gráfico para poner un animal del que no sabes nada, como hizo el profesor con el mouse en clase. El modelo lo va a clasificar igual, sin dudar.

Las dos medidas están normalizadas a [0, 1] antes de entrar a la fórmula —tamaño entre 10 y 75 cm, oreja entre 3 y 17 cm—, así w₁ y w₂ son comparables entre sí y la distancia a la recta se lee en las mismas unidades para ambos ejes.

Lo que tenías que ver

  1. El error salta. Giras un grado y nada; giras otro y de repente bajaste un error entero. Nunca vas a ver 2,4 errores. Esa es toda la diferencia con regresión: allí el error se movía de a centavos y podías derivarlo para saber hacia dónde ir. Aquí no hay pendiente que seguir.
  2. El chihuahua no tiene arreglo. Es un perro pequeño con orejas modestas, metido entre los gatos. Ninguna recta lo salva sin llevarse media docena de gatos por delante.
  3. Con el mismo número de errores, hay rectas mejores que otras. Dos rectas pueden fallar exactamente en los mismos animales y aun así una te da más confianza: la que deja más espacio libre a cada lado. El número de errores no las distingue; el margen sí.

Tu profesor, sobre el punto 2:

«podrías tener un perro pequeño […] un chihuahua por ejemplo podría ser clasificado como gato pero eso es un error […] un modelo de 100% perfecto yo al tiro dudo de ese modelo porque ningún modelo 100% perfecto hay algo raro» Clase del 7-ago · 0:22:25–0:22:52 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Y siguió: la naturaleza no es 100 % perfecta, hay perros que parecen gatos y gatos que parecen perros [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:22:56–0:23:03]. Un 100 % en test no es un logro: es una alarma de fuga de información o de un test mal armado [INFERENCIA].

Otra forma de clasificar: por vecinos, y con una probabilidad

Antes del modelo lineal, el profesor mostró la idea de cercanía con el k vecinos más cercanos (KNN): para clasificar un punto nuevo, miras sus k vecinos del entrenamiento y votan.

«los tres más cercanos de un círculo y dos triángulos […] hay una probabilidad de dos de tres o sea un 66 coma 6 periódico por ciento de probabilidad de que sea un triángulo» Clase del 7-ago · 0:24:42–0:24:56 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Fíjate en lo que acaba de aparecer: el modelo no solo dice «triángulo», dice «triángulo con probabilidad 2/3». Si decides «triángulo» cuando esa probabilidad pasa de 0,5, elegiste un umbral. Moverlo cambia qué casos se declaran positivos, y recorrer todos los umbrales es la curva ROC: roc_auc.html. El Random Forest hace algo parecido: si 3 de 4 árboles dicen perro, 75 % de probabilidad de perro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:31:53–1:32:09].

Con K = 5, los vecinos de un punto nuevo son 3 círculos y 2 triángulos. ¿Qué responde el modelo, con qué probabilidad, y qué pasa si exiges al menos 0,7 para decir «círculo»?

Respuesta correcta y cómo se resuelve

Respuesta: responde círculo con probabilidad 3/5 = 0,6; con un umbral de 0,7, en cambio, el punto quedaría como triángulo.

Cómo se resuelve: probabilidad de círculo = votos de círculo / K = 3/5 = 0,60. Con la regla por defecto (gana la mayoría, o sea umbral 0,5): 0,60 ≥ 0,5 → círculo. Con umbral 0,7: 0,60 < 0,7 → no alcanza, se declara triángulo.

Error típico: creer que la clase que entrega el modelo es fija. Depende del umbral que tú eliges sobre la probabilidad; el modelo solo entrega el 0,6.

Fuente: mecanismo del KNN y la probabilidad por votos: cita de arriba; números [DATITO]; el umbral como decisión tuya: metricas_clasificacion.html.

6 · El error de clasificación, con notación

Si el error no es una distancia, ¿qué es? Es un conteo. Se llama pérdida 0-1, y es literalmente «cero si acerté, uno si fallé»:

E0-1 = 1n  Σi=1..n  1[ ŷi ≠ yi ] 1[·] vale 1 cuando lo de adentro es verdad y 0 cuando es falso · la exactitud es 1 − E0-1

Compáralo con lo que usabas en Melbourne:

MAE = 1n  Σi=1..n  | ŷi − yi | esta resta exige que y viva en una recta numérica. Es el supuesto que se rompe

Son la misma forma —promedio de algo por observación— y difieren en ese algo. El MAE pregunta cuánto me equivoqué. La pérdida 0-1 solo puede preguntar me equivoqué, sí o no.

Y aquí aparece el problema técnico que explica todo el resto del curso Esa función escalonada que acabas de ver moviendo la recta es E0-1. Como salta, no se puede derivar, y sin derivada no hay forma de que el modelo sepa hacia dónde moverse para mejorar.

Por eso ningún algoritmo de clasificación minimiza directamente el número de errores. Cada uno inventa algo derivable o buscable que se le parezca: el SVM maximiza el margen, el árbol reduce la impureza, la regresión logística minimiza una verosimilitud. Todos los modelos que vas a ver después son respuestas distintas a este mismo estorbo [DATITO].

El margen, que es lo que hace el SVM

Cuando sí existe una recta sin errores, el profesor mostró cómo se elige entre las infinitas que sirven: se toman los puntos más cercanos de cada clase —los vectores de soporte—, se trazan dos planos paralelos por ellos, y se busca la recta que hace esa franja lo más ancha posible.

maximizar  2‖w‖   ≡  minimizar ‖w‖   sujeto a   yi·( w·xi − b ) ≥ 1 la restricción dice: cada punto tiene que quedar de su lado y fuera de la franja

La restricción es el truco elegante del ±1: si yᵢ = +1 exige que el score sea ≥ +1; si yᵢ = −1, al multiplicar por −1 exige que el score sea ≤ −1. Una sola línea cubre las dos clases.

La analogía que propuso un compañero, y que el profesor aceptó Un compañero comparó el margen con un barrio: las dos clases son casas de dos barrios y el margen es la calle que los separa; el profesor dijo que era una muy buena analogía [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:29:12–0:29:36].

El botón Ajustar el modelo de arriba hace justo eso, a lo bruto: prueba miles de rectas, se queda con las de menos errores y, entre ellas, con la que deja la calle más ancha.

7 · Camino inverso: te entregan la fórmula

En el certamen no te van a dar el gráfico. Te van a dar esto, escrito, y tendrás que reconstruir de qué habla.

ŷ = signo( 0,82·x₁ + 0,57·x₂ − 0,55 )

1 · ¿Qué es cada cosa, y qué fenómeno describe?

Respuesta correcta y cómo se resuelve

Respuesta: es un clasificador lineal que separa perros de gatos con una recta en el plano (tamaño, oreja): x₁ y x₂ son datos, 0,82 y 0,57 son los pesos aprendidos, 0,55 es el desplazamiento, y el signo convierte el puntaje en una clase.

  • x₁, x₂: las dos medidas del animal, normalizadas. Dato.
  • 0,82 y 0,57: el vector w, lo que el modelo aprendió. Los dos son positivos, así que más tamaño y más oreja empujan hacia la clase positiva. Y 0,82 > 0,57: el tamaño pesa más que la oreja (se pueden comparar porque las dos medidas están normalizadas).
  • 0,55: el b. Es cuánto tiene que acumular un animal entre las dos medidas antes de que el modelo se atreva a decir «perro».
  • signo(·): el paso que convierte un número continuo en una decisión discreta. Esta es la pieza que no existe en regresión.

Error típico: leer 0,82·x₁ + 0,57·x₂ − 0,55 como «la predicción». Es el puntaje; la predicción es su signo.

Fuente: ecuación y coeficientes ilustrativos [DATITO]; el esquema perro/gato con una recta es del profesor (cita del §1).

2 · Un animal mide 38 cm y tiene orejas de 12 cm. ¿Qué responde el modelo?

Respuesta correcta y cómo se resuelve

Respuesta: perro, porque el puntaje sale +0,170, positivo (aunque cerca de la frontera).

Primero normalizas, porque la fórmula está escrita en unidades normalizadas (tamaño entre 10 y 75 cm, oreja entre 3 y 17 cm):

x₁ = (38 − 10) / (75 − 10) = 28/65 = 0,431
x₂ = (12 − 3) / (17 − 3) = 9/14 = 0,643

Ahora sustituyes:

s = 0,82 · 0,431 + 0,57 · 0,643 − 0,55
s = 0,353 + 0,366 − 0,55 = +0,170

El signo es positivo → perro. Y fíjate: 0,170 es un número chico. El modelo dice «perro» con la misma cara con la que lo diría si el puntaje fuera 0,9 — el signo no guarda memoria de cuán cerca estuvo. Ese descarte de información es lo que la curva ROC recupera cuando dejas de mirar el signo y miras el puntaje: roc_auc.html.

Error típico: sustituir 38 y 12 directamente, sin normalizar: s = 0,82·38 + 0,57·12 − 0,55 = 37,5, un número sin sentido en esta escala (aquí da el mismo signo por casualidad).

Fuente: [DATITO] (cifras ilustrativas).

3 · ¿Cuánto tendría que valer b para que ese mismo animal saliera gato, sin tocar w?

Respuesta correcta y cómo se resuelve

Respuesta: cualquier b mayor que 0,719 (por ejemplo 0,75).

Cómo se resuelve: necesitas s < 0, o sea 0,353 + 0,366 − b < 0, o sea b > 0,719. Con b = 0,75 el puntaje pasa a −0,031 y el modelo dice gato.

La relación que hay que nombrar: mover b dejando w fijo desplaza la recta en paralelo, sin girarla. Cambiar w la gira. Compruébalo con los dos deslizadores de arriba: uno inclina, el otro traslada. Y el corolario: subir b hace al modelo más exigente para declarar «perro» — declarará menos perros, se le escaparán perros de verdad, pero casi todos los que declare lo serán. Ese es el umbral que recorre la curva ROC.

Error típico: responder «b < 0,719» por invertir la desigualdad al despejar un término con signo menos.

Fuente: [DATITO] (cifras ilustrativas); el umbral como decisión: metricas_clasificacion.html.

8 · Qué cantidad describe qué objeto

Esto es una pregunta del Certamen 2 con nombre y apellido (ficha P4: certamen_2.html#p4). No pide calcular: pide clasificar la cantidad.

Cantidad¿Qué objeto describe?¿Existe si no hay clases?
Media, mediana, varianza, IQRuna variableSí
MAE, RMSE, R²un modelo de regresiónSí, si el target es numérico
VP, VN, FP, FN, exactitud, precisión, recall, FPR, F1, AUCun clasificadorNo
Impureza de Gini, entropíacriterio de entrenamiento de un árbolNo
Margen 2/‖w‖criterio de entrenamiento de un SVMNo
La distinción que decide la pregunta Una cantidad que describe un clasificador no existe fuera de un problema de clasificación: sin clases no hay «falso positivo».
Una cantidad que describe una variable —la varianza— existe con o sin clases, con o sin modelo, con o sin nada. Le basta una columna de números.
Por eso, ante «¿cuál de estas no es una métrica de evaluación de un clasificador?», la varianza se cae sola.

Ficha P4 en 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · certamen_2.html#p4.

¿Cuál de estas no describe a un clasificador: precisión, FPR, varianza, AUC?

Respuesta correcta y cómo se resuelve

Respuesta: la varianza.

Cómo se resuelve: pregunta a cada una si existiría sin clases. Precisión y FPR necesitan falsos positivos, que solo existen si hay una clase positiva; el AUC se arma con TPR y FPR. La varianza solo necesita una columna de números: describe una variable, no un modelo.

Error típico: elegir el AUC «porque es un área y no un porcentaje». Sigue siendo una medida del clasificador.

Fuente: [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, ficha P4].

Y una que se cuela seguido: la impureza de Gini necesita clases, sí, pero no es una métrica de evaluación — es lo que el árbol usa mientras se construye, para decidir por dónde cortar (el profesor la calculó en clase [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:22:15–1:22:31]). Evaluar y entrenar son momentos distintos del ciclo.

Tu profesor cerró la clase con la importancia de variables en un Random Forest, y la explicó contando, no con impureza:

«tengo que contar cuántas veces cada variable fue cogida por cada uno de los árboles como relevante al momento de separar» Clase del 7-ago · 1:32:59–1:33:04 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

Es lo mismo que dice la lámina 38: se estima la importancia «contando cuántas veces cada variable fue escogida por cada árbol como relevante» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_07_Clasificacion.md · lámina 38]. La importancia por reducción de impureza (la que entrega scikit-learn) es otra forma de medirla: viene de tu trabajo en los proyectos, no de la clase [INFERENCIA]. Más en arboles_y_ensambles.html#random-forest.

9 · Procedimiento para el papel

Cuatro pasos, para cuando te den un enunciado y tengas que decidir qué es.

  1. Escribe cuál es el target. Literalmente, la columna. No «predecir ventas»: la columna monto_venta.
  2. Pregúntale al target si tiene orden. ¿Puedes decir que un valor va antes que otro, y que entre dos hay un valor intermedio con sentido? Si sí → regresión. Si no → clasificación. Si son categorías con orden (bueno/regular/malo, frío/templado/caliente) → sigue siendo clasificación: el modelo elige una etiqueta (Certamen 1, P6); si te piden tratarlo de otra forma, declara el supuesto [DATITO].
  3. No mires las features para decidir esto. Features categóricas se codifican con one-hot y no cambian la tarea. Melbourne tiene tres y sigue siendo regresión.
  4. Declara la clase positiva antes de calcular nada. En binaria, escribe «positivo = X» en el margen de la hoja. Sin eso, precisión y recall no significan nada, y todas las preguntas siguientes se construyen sobre esa elección.

10 · Errores que este formato castiga

11 · Qué tendrías que producir para demostrar que entendiste

APLICAR — con material del curso

06_LABORATORIOS/2026_[P5]Clasificación(vacio).ipynb. Los primeros ejercicios son codificación de categóricas a mano, get_dummies y LabelEncoder.

La pregunta que importa mientras lo resuelves: LabelEncoder convierte tus categorías en 0, 1, 2. Acabas de ver que eso es peligroso. ¿En qué caso es inofensivo y en cuál no? Escribe la respuesta antes de seguir.

Respuesta correcta y cómo se resuelve

Respuesta: es inofensivo para codificar el target de un clasificador y peligroso para codificar una feature categórica sin orden.

Cómo se resuelve: un clasificador trata los valores del target como nombres de clases: le da lo mismo que «gato» sea 0 o 2, porque solo compara si acertó. En cambio, si codificas una feature (por ejemplo, fruta = 0, 1, 2, 3, 4) y se la pasas a un modelo que suma o mide distancias (regresión lineal, KNN), el modelo cree que la fruta 4 es «el doble» de la 2 y que la 1 está «entre» la 0 y la 2: un orden y una distancia inventados. Para features se usa one-hot (get_dummies). Y si con el target codificado calculas un MAE, reaparece el problema del §2.

Error típico: usar LabelEncoder en todas las columnas «porque es más corto».

Fuente: el propio P5 aconseja usarlo «solo en la variable objetivo» [FUENTE · Repo: 06_LABORATORIOS/_markdown/2026_P5_Clasificación_res_ _1.md · l.244]; la razón es [INFERENCIA] a partir del §2.

TRANSFERIR — otro dominio, sin galaxias ni casas

CONAF monitorea plantaciones de pino en la Región del Biobío con imágenes satelitales. Cada rodal tiene dos índices numéricos —vigor de la copa y humedad foliar— y se etiqueta en tres estados: sano, con plaga, con estrés hídrico. De 2.400 rodales, 2.050 están sanos.

Responde por escrito, para Datito:

  1. ¿Regresión o clasificación? Justifica desde el target, no desde las features.
  2. Un colega propone codificar sano=0, plaga=1, estrés=2 y evaluar con MAE. Dale un argumento cuantitativo de por qué no, del mismo tipo que el de Galaxy Zoo.
  3. Un modelo reporta 85 % de exactitud. ¿Por qué esa cifra, sola, no te deja dormir tranquilo? (La respuesta está en los 2.050.)
  4. Si tuvieras que elegir una clase positiva para armar una detección binaria, ¿cuál eliges y por qué esa decisión no es del modelo?
Respuesta correcta y cómo se resuelve

Respuesta en una frase: es clasificación de tres clases; el MAE depende de un orden arbitrario; el 85 % no supera a responder siempre «sano»; y la clase positiva la eliges tú según qué error cuesta más.

  1. Clasificación multiclase. El target es el estado del rodal (sano / plaga / estrés): no hay un «plaga y media» entre plaga y estrés, así que no tiene punto medio. Que los dos índices sean numéricos es irrelevante: la tarea la define el target.
  2. El MAE depende del orden que inventes. Con una matriz ilustrativa [DATITO] de 2.400 rodales donde los errores son sano→plaga 30, sano→estrés 20, plaga→sano 40, plaga→estrés 30, estrés→sano 25, estrés→plaga 35: con sano = 0, plaga = 1, estrés = 2, el par a distancia 2 es sano↔estrés (20 + 25 = 45) y MAE = (135 + 2·45)/2.400 ≈ 0,094. Con sano = 0, estrés = 1, plaga = 2, el par lejano pasa a ser sano↔plaga (30 + 40 = 70) y MAE = (110 + 2·70)/2.400 ≈ 0,104. Mismo modelo, mismas predicciones, 11 % de diferencia por una decisión sin significado ecológico.
  3. Porque 2.050/2.400 = 85,4 %. Un modelo que responde siempre «sano» ya saca 85 % sin aprender nada. El 85 % reportado no demuestra que el modelo detecte plagas ni estrés. Es el mismo mecanismo que hace que tu desafío se evalúe con F1-macro: la clase 2 de Galaxy Zoo es el 67,7 %.
  4. Positivo = «con plaga» (o «con estrés», según el objetivo). Depende del costo de cada error —no detectar una plaga cuesta hectáreas; una falsa alarma cuesta una inspección—, y ese costo lo pone la persona que decide, no el algoritmo.

Error típico: en 1, decir «regresión porque los índices son numéricos»; en 3, aceptar el 85 % sin compararlo con el modelo tonto.

Fuente: caso y cifras ilustrativas [DATITO]; el argumento del MAE es el del §2 con la matriz real de 08_PROYECTO_FCD/Desafio/REPORT.md.

PRODUCIR — explícaselo a alguien

Un compañero te dice: «si a perro, gato y conejo les pongo 0, 1 y 2, ya puedo usar el MAE como en Melbourne». Explícale en cinco líneas, sin fórmulas, por qué no.

Respuesta correcta y cómo se resuelve

Respuesta en una frase: no, porque el MAE resta los códigos y esa resta inventa un orden y una distancia que las categorías no tienen; el resultado depende de qué número le pusiste a cada animal.

Respuesta modelo [DATITO]: «El MAE mide cuánto te equivocaste restando lo que dijiste menos lo que era. Con precios eso tiene sentido: equivocarte por 10.000 es menos grave que por 100.000. Pero con animales no: si pones perro = 0, gato = 1, conejo = 2, el MAE dice que confundir perro con conejo es el doble de grave que confundirlo con gato, y eso lo decidiste tú al numerar. Cambia la numeración y cambia el MAE, aunque el modelo sea el mismo; en tu Galaxy Zoo pasa de 0,280 a 0,324. Para categorías se cuenta si acertaste o no: exactitud y, mejor, la matriz de confusión.»

Criterios para corregir la tuya: nombra la resta; dice que el orden de los códigos es arbitrario; da un ejemplo de que el número cambia sin que cambie el modelo; propone qué usar en su lugar.

Error típico: responder «porque no son números», sin decir qué operación falla. Sí son números después de codificar; lo que no tienen es orden ni distancia.

Fuente: argumento del profesor sobre el orden (cita del §2); cifras de Galaxy Zoo de 08_PROYECTO_FCD/Desafio/REPORT.md [INFERENCIA]; redacción [DATITO]. Si quieres que corrija tu versión, llévala a Datito.

Lo que sigue: una vez que aceptas que el error es un conteo y no una distancia, la pregunta obvia es qué clase de errores estás cometiendo. Ahí entra la matriz de confusión — matriz_confusion.html —, después las métricas que salen de ella — metricas_clasificacion.html — y el umbral recorrido entero — roc_auc.html.

Cierre de la Clase 11 · Clasificación: cuando la etiqueta no es un número

Qué aprendiste

  • Clasificar es predecir una categoría.
  • Una variable categórica no tiene orden entre sus valores.
  • El modelo puede entregar una probabilidad, no solo una clase.
  • Un modelo 100 % perfecto es sospechoso.

Qué no debes confundir

  • Categórica ≠ cualitativa.
  • Categoría ≠ discretización de un número.
  • Lo que define la tarea es el target, no las features.

Procedimiento para el papel

  1. Mira el target: ¿número o categoría?
  2. ¿Tiene orden? ¿Hay una variable numérica de fondo?
  3. Elige la tarea según para qué usarás la predicción.

Viene de: Clase 10 · Overfitting y underfitting · Sigue: Clase 12 · Matriz de confusión

Vuelve a tu activación: «Frío, templado, caliente»: ¿es un problema de clasificación o de regresión? ¿Cambiarías tu respuesta?

Pregunta final. Predecir la nota de 1 a 7 de un alumno: ¿regresión o clasificación?
Respuesta correcta y cómo se resuelve

Regresión si interesa el valor, porque es un número con distancia; clasificación si solo interesa aprobado o reprobado. Lo decide el uso de la predicción. [INFERENCIA] Así lo planteó el profesor a un grupo: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md · 1:57:26]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 12 · Matriz de confusión