Objetivo. Ante un problema nuevo, identificar qué concepto aplica y proponer el procedimiento para resolverlo.
- Evidencia de aprendizaje: Resuelve un problema de otro dominio descubriendo qué concepto aplica, sin que se lo nombren.
- Actividad final: Recorrer el triaje con tres problemas nuevos. El simulacro final integrado está pendiente de construir.
- Criterio de dominio: Identifica bien el tipo de problema y la validación adecuada en tres casos de dominios distintos.
¿Qué tipo de problema tengo delante?
El paso que va antes de todos los demás.
Fundamentos de Ciencia de Datos · UdeC
La mayoría de los errores en una prueba no vienen de calcular mal. Vienen de resolver el problema equivocado: aplicar validación cruzada donde correspondía un corte temporal, usar exactitud donde correspondía F1, o tratar como modelamiento algo que era limpieza.
Esta página entrena eso: reconocer, antes de resolver.
1 · ¿En qué etapa del ciclo estoy?
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «para nace»
Pulsa una etapa para ver qué se hace ahí y qué no:
Si estás decidiendo qué hacer con un dato que falta o está mal, es limpieza. Si estás decidiendo qué algoritmo usar o qué tan complejo hacerlo, es modelamiento. Excluir una columna puede ser cualquiera de las dos: si la excluyes porque está sucia, es limpieza; si la excluyes porque mete ruido en el modelo, es modelamiento.
2 · Triaje: responde y te digo qué tienes
3 · La tabla que resuelve la mayoría de los casos
| Si te piden… | Es… | Porque el target es… | Se mide con |
|---|---|---|---|
| El precio de una casa | Regresión | Un número continuo | MAE, RMSE, R² |
| Horas que tardará una entrega | Regresión | Un número continuo | MAE, RMSE, R² |
| Si un correo es spam | Clasificación binaria | Dos categorías | Matriz, precision, recall, F1, AUC |
| Si una galaxia es espiral, elíptica o ambigua | Clasificación multiclase | Tres categorías | F1-macro, matriz |
| Agrupar clientes parecidos, sin etiquetas previas | Segmentación | No hay target | Silueta, inercia |
| Calidad del material: baja, media o alta | Clasificación multiclase | Tres categorías ordenadas | F1-macro, matriz |
1, 2, 3, siguen siendo categorías.
Un target numérico no hace que el problema sea regresión: lo que importa es si
los valores intermedios significan algo. Entre «espiral» y «elíptica»
no hay un 1,5.
4 · ¿Cómo valido?
Segunda decisión que se equivoca seguido, y depende de una sola pregunta:
| ¿Los datos tienen orden temporal? | Entonces | Por qué |
|---|---|---|
| No — cada fila es independiente | Validación cruzada k-fold, con mezcla | Aprovecha todos los datos y da una estimación estable |
| Sí — hay fechas y vas a predecir el futuro | Corte temporal: entrenar con el pasado, evaluar en el futuro | Mezclar filtra información del futuro al entrenamiento |
| Sí, y además quieres elegir modelo | CV dentro del período de entrenamiento, y el futuro intacto | Elegir mirando el test lo quema |
La versión que guardaste en
99_ARCHIVO/_obsoleto_split_aleatorio/
usó split aleatorio y anunciaba «81 % Precisión». Un número más alto midiendo
mal.
5 · El procedimiento, para el papel
ANTE CUALQUIER PROBLEMA, EN ESTE ORDEN
1. ¿QUÉ ME PIDEN? predecir · describir · agrupar · decidir
2. ¿HAY TARGET? no → segmentación, y se acabó
3. ¿EL TARGET ES…? número continuo → REGRESIÓN
categoría → CLASIFICACIÓN
4. ¿CUÁNTAS CATEGORÍAS? dos → binaria · tres o más → multiclase
5. ¿HAY ORDEN TEMPORAL? sí → corte temporal · no → k-fold
6. ¿LAS CLASES ESTÁN…? equilibradas → exactitud sirve
desbalanceadas → F1, y decir por qué
7. ¿QUÉ MÉTRICA? la que corresponde al tipo, no la que recuerdo
8. RECIÉN AHORA calcular
6 · Errores de triaje que el formato castiga
| Error | Cómo se ve |
|---|---|
| Tratar clases numéricas como regresión | Proponer MAE para predecir «1, 2 o 3» |
| Split aleatorio con datos temporales | Métrica optimista que no mide lo que importa |
| Exactitud con clases desbalanceadas | Un modelo que no detecta nada parece excelente |
| Confundir limpieza con modelamiento | Justificar una exclusión con el argumento equivocado |
| Elegir el modelo mirando el test | Ya no queda estimación honesta del error |
| Usar validación cruzada como si fuera una métrica | «El CV dio 0,8» — CV es un método, no un número que se reporta |
Cierre de la Clase 22 · Transferencia: ¿qué problema tengo delante?
Qué aprendiste
- El primer paso ante un problema nuevo es clasificarlo: ¿qué se predice y cómo se validará?
- Reconocer la estructura es lo que permite transferir: el árbol de 45 cm y el agrónomo de 1.200 mm son el mismo problema.
Qué no debes confundir
- Un problema nuevo ≠ un concepto nuevo: casi siempre es uno que ya viste en otro dominio.
Procedimiento para el papel
- ¿Cuál es el target? ¿Es un número o una categoría?
- ¿Hay orden temporal? Eso decide la validación.
- ¿Las clases están balanceadas? Eso decide la métrica.
- ¿Se pide predecir fuera del rango? Eso es extrapolación.
Viene de: Clase 21 · Distinciones del Certamen 2 · Sigue: Clase 23 · Distinciones del Certamen 3
Vuelve a tu activación: Te dan un problema de otro dominio que nunca viste. ¿Cuál es la primera pregunta que te haces? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Clasificación binaria (falta o no falta). Hay orden temporal, así que se valida entrenando con el pasado y midiendo en el período más reciente; y como las faltas suelen ser minoría, se evalúa con precisión, recall o F1 en vez de exactitud. [DATITO]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.