Fundamentos de Ciencia de Datos
El curso de Datito · UdeC, T2-2026 · 23 clases en 6 unidades · todo funciona sin conexión
Bienvenido. Este es tu curso para el certamen presencial: las clases del profesor, ordenadas de lo que necesitas primero a lo que se apoya en eso, con preguntas que intentas antes de ver la respuesta.
Propósito. Que puedas resolver en papel, sin Internet, las preguntas que el profesor realmente hace: distinguir conceptos vecinos, calcular a mano e interpretar el resultado [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md].
Comenzar la Clase 1 → Seguir donde quedé Repaso del certamen Dudas resueltas
Tu avance (marcas de «Terminé esta clase» en este navegador): 0 de 22 clases disponibles.
<details>) y termina con la tarea de producción: explícaselo a Datito.
Leer sin responder no es estudiar.0 · El curso, clase por clase
El orden sigue los prerrequisitos del currículum y la secuencia real de las clases del profesor, y sube de
comprender a aplicar, analizar, evaluar y crear [FUENTE · Repo: 07_DATITO/clases.yaml]. Cada clase abre con
su objetivo, su ficha Bloom y una pregunta de activación, y cierra con qué aprendiste, qué no confundir, un
procedimiento y una pregunta final. «Requiere» son las clases que conviene tener antes; «Evidencia en Datito»
es el estado registrado en progreso.yaml al generar esta página.
Unidad 1 · Del problema a los datos
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 1 | Clase 1 · ¿Qué problema resuelve la ciencia de datos? | Comprender | — | ~45 min | NO_ESTUDIADO | |
| 2 | Clase 2 · Datos, filas, columnas, features y target | Analizar | C1 | ~50 min | NO_ESTUDIADO | |
| 3 | Clase 3 · EDA: conocer los datos antes de modelar | Analizar | C2 | ~55 min | NO_ESTUDIADO | |
| 4 | Clase 4 · Calidad, limpieza y preparación de datos | Evaluar | C3 | ~45 min | NO_ESTUDIADO |
Unidad 2 · Aprender una cantidad: regresión
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 5 | Clase 5 · Regresión: predecir una cantidad | Comprender | C2 | ~20 min | EN_ESTUDIO | |
| 6 | Clase 6 · Función de costo, error y R² | Aplicar | C2, C5 | ~15 min | EN_ESTUDIO |
Unidad 3 · Medir si el modelo sirve
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 7 | Clase 7 · Train, validation y test | Aplicar | C2 | ~25 min | COMPRENDIDO | |
| 8 | Clase 8 · Validación cruzada y selección de modelos | Evaluar | C7 | ~30 min | NO_ESTUDIADO | |
| 9 | Clase 9 · Generalización, extrapolación y datos no vistos | Evaluar | C7 | ~25 min | COMPRENSION_PARCIAL | |
| 10 | Clase 10 · Overfitting y underfitting | Analizar | C8, C9 | ~35 min | COMPRENSION_PARCIAL |
Unidad 4 · Clasificar y evaluar
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 11 | Clase 11 · Clasificación: cuando la etiqueta no es un número | Analizar | C5 | ~40 min | NO_ESTUDIADO | |
| 12 | Clase 12 · Matriz de confusión | Aplicar | C11 | ~30 min | NO_ESTUDIADO | |
| 13 | Clase 13 · Precisión, sensibilidad, exactitud y F1 | Analizar | C12 | ~45 min | NO_ESTUDIADO | |
| 14 | Clase 14 · ROC-AUC y elección del umbral | Evaluar | C13 | ~40 min | NO_ESTUDIADO |
Unidad 5 · Modelos más potentes
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 15 | Clase 15 · Árboles de decisión | Aplicar | C10 | ~35 min | NO_ESTUDIADO | |
| 16 | Clase 16 · Random Forest y ensambles | Analizar | C15 | ~35 min | NO_ESTUDIADO | |
| 17 | Clase 17 · Redes neuronales | Comprender | C16 | ~45 min | NO_ESTUDIADO | |
| 18 | Clase 18 · Deep learning, LLM y agentes | Analizar | C17 | ~55 min | NO_ESTUDIADO |
Unidad 6 · Integrar y rendir
| # | Clase | Bloom | Requiere | Tiempo | Evidencia en Datito | Tu marca |
|---|---|---|---|---|---|---|
| 19 | Clase 19 · Repaso integrado: el proyecto Melbourne (pendiente) | Crear | C2, C5, C7, C8, C9, C10, C16 | — | NO_ESTUDIADO | pendiente |
| 20 | Clase 20 · Distinciones del Certamen 1 | Evaluar | C1, C2, C3, C4 | ~25 min | NO_ESTUDIADO | |
| 21 | Clase 21 · Distinciones del Certamen 2 | Evaluar | C8, C9, C10, C11, C12, C13, C14, C16, C17, C18 | ~25 min | NO_ESTUDIADO | |
| 22 | Clase 22 · Transferencia: ¿qué problema tengo delante? | Crear | anteriores | ~5 min | — | |
| 23 | Clase 23 · Distinciones del Certamen 3 | Evaluar | C13, C14, C16, C17, C18 | ~20 min | NO_ESTUDIADO |
Conceptos cubiertos (21 de 21): Fundamentos de Ciencia de Datos (C1), Datos, filas, columnas, features y target (C2), Analisis exploratorio de datos (EDA) (C3), Limpieza y preparacion de datos (C4), Regresion (C5), Train / validation / test (C7), Validacion cruzada (C8), Generalizacion (C9), Overfitting y underfitting (C10), Clasificacion (C11), Matriz de confusion (C12), Accuracy, precision, recall y F1 (C13), ROC y AUC (C14), Arboles de decision (C15), Random Forest (C16), Gradient Boosting (C16), Ensembles (C16), Redes neuronales (C17), Deep learning (C18), Modelos de lenguaje (LLM) (C18), Agentes de IA (C18).
Conceptos sin clase: ninguno. Clases pendientes de construir: Clase 19 · Repaso integrado: el proyecto Melbourne.
1 · Repaso recomendado antes del certamen
El orden sigue tu pedido de repaso. El peso en el certamen viene de patron_evaluacion.md: sobreajuste, generalización y validación suman el 36 % del Certamen 2 y las métricas de clasificación otro 27 % [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md]. Cuando la importancia curricular y el peso en el certamen difieren, se marca ⚑ (G12): lo que menos se pregunta puede ser lo que más sostiene al resto.
| Concepto | Qué te llevas | Importancia curricular | Peso en certamen | Preguntas | Tramos de clase |
|---|---|---|---|---|---|
| Accuracy, precision, recall y F1 ⚑ tensión | Precisión, sensibilidad (recall), exactitud y F1: el denominador decide | 1 | alta | C2 P4 · C2 P8 · C3 P1A | 4 |
| Matriz de confusion ⚑ tensión | Construir y leer la matriz; el ejercicio de 100 pacientes del profesor | 2 | alta | C2 P8 · C3 P1A | 4 |
| ROC y AUC | Umbral, punto de operación, curva ROC y AUC: comparar modelos, no puntos | 0 | media | C2 P9 · C3 P1A · C3 P1B · C3 P1C · C3 P1D | 3 |
| Train / validation / test | Tres conjuntos: elegir con validación, medir con test | 11 | media | C2 P2 · C2 P7 | 7 |
| Validacion cruzada ⚑ tensión | Re-particionar para no depender de una partición con suerte | 9 | baja | C2 P3 | 7 |
| Generalizacion | Funcionar en datos no vistos; interpolar y extrapolar | 9 | media | C2 P2 · C2 P3 · C2 P7 | 3 |
| Overfitting y underfitting | La brecha, no un número: sobreajuste, subajuste, error alto | 8 | alta | C2 P2 · C2 P3 · C2 P7 · C3 P2A · C3 P2B | 5 |
| Regresion | Modelo lineal, costo, R²; el árbol y el radio del tronco | 4 | baja | C2 P7 · C3 P2A · C3 P2C | 7 |
| Limpieza y preparacion de datos ⚑ tensión | Calidad de datos: la 9B, centinelas, atípico ≠ error | 0 | alta | C1 P9A · C1 P9B · C3 P3B | 7 |
| Analisis exploratorio de datos (EDA) | Distribución, resumen, faltantes y atípicos antes de modelar | 1 | baja | C1 P9A · C2 P4 · C2 P11 · C3 P3A · C3 P3B | 3 |
También conviene repasar:
| Concepto | Qué te llevas | Importancia curricular | Peso en certamen | Preguntas | Tramos de clase |
|---|---|---|---|---|---|
| Fundamentos de Ciencia de Datos | 20 | media | C1 P1 · C1 P2 · C1 P3 · C1 P4 · C1 P7 · C1 P8 · C2 P10 · C2 P11 | 8 | |
| Datos, filas, columnas, features y target | 19 | media | C1 P6 · C1 P9A · C2 P3 | 7 | |
| Clasificacion | 3 | media | C1 P6 · C2 P4 | 5 | |
| Arboles de decision | 7 | baja | — | 2 | |
| Redes neuronales | 3 | baja | C2 P6 | 1 | |
| Deep learning | 2 | baja | C2 P6 | 3 |
2 · Dudas resueltas por Datito, en orden
Todo lo que se resolvió en una sesión queda aquí y en el visual del tema, con la respuesta correcta y cómo se resuelve (oculta hasta que la abras). Nada queda solo en la terminal. Fuente única: 07_DATITO/dudas.yaml.
| Fecha | Pregunta | Estado | Dónde está |
|---|---|---|---|
| 18-sep | En Melbourne, el MAE de validación cruzada en 2016 y el de test en 2017 fueron: baseline (mediana) 449.160 → 431.649 (mejora 17.511); árbol de decisión 219.821 →… | quedó abierta en la sesión: aquí está la respuesta | 07_generalizacion.html |
| 19-sep | Tres modelos con R² de entrenamiento / prueba: A 0,62 / 0,59 · B 0,98 / 0,54 · C 0,41 / 0,39. a) ¿Cuál sobreajusta, cuál subajusta y cuál está bien? b) Un compañero… | resuelta en la sesión | 08_overfitting_underfitting.html |
| 19-sep | Tres modelos de tiempo de entrega, métrica MAE (menos es mejor), entrenamiento / prueba: P 0,15 / 0,92 · Q 0,71 / 0,78 · R 1,84 / 1,90. a) ¿Cuál sobreajusta, cuál… | resuelta en la sesión | 08_overfitting_underfitting.html |
| 21-sep | Cortaste 20 árboles y ajustaste la recta: R² = 0,93. Tu jefe te pide predecir el peso de un árbol de radio 45 cm. Los 20 árboles tenían radios entre 8 y 22 cm. ¿Le… | resuelta en la sesión | ../../02_REFERENCIA/clase6_regresion.html |
| 21-sep | Un compañero dice: «si θ₁ es 82,13, entonces un árbol de radio cero pesaría 82 kilos». ¿Tiene razón? Justifícalo nombrando qué símbolo responde esa pregunta. | resuelta en la sesión | ../../02_REFERENCIA/clase6_regresion.html |
| 21-sep | (Transferencia) Un agrónomo ajustó una recta de rendimiento contra lluvia con datos entre 300 y 600 mm, y le piden predecir un año de 1.200 mm. ¿Qué le dices? | práctica: intenta antes de abrir la respuesta | 07_generalizacion.html |
2b · Distinciones que deciden el certamen
Cada pregunta real se resuelve separando dos conceptos vecinos. No evalúa definiciones: evalúa discriminación [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md §1].
| Pregunta | La distinción | Dónde se entrena |
|---|---|---|
| C2 P1 | Número de modelos ≠ diversidad de modelos | Ensembles |
| C2 P2 | Sobreajuste ≠ subajuste ≠ error alto | Overfitting y underfitting, Generalizacion |
| C2 P3 | Más filas (reduce sobreajuste) ≠ más columnas (lo aumenta) | Overfitting y underfitting, Datos, filas, columnas, features y target, Validacion cruzada |
| C2 P4 | Cantidad que describe un clasificador ≠ que describe una variable | Clasificacion, Analisis exploratorio de datos (EDA) |
| C2 P5 | Generar texto ≠ ejecutar acciones y observar su resultado | Agentes de IA, Modelos de lenguaje (LLM) |
| C2 P6 | Causa ≠ condición habilitante | Deep learning, Redes neuronales |
| C2 P7 | Error de entrenamiento ≠ calidad del modelo · bajar grado ≠ regularizar (²) | Overfitting y underfitting, Regresion |
| C2 P8 | Precisión (÷ predichos) ≠ sensibilidad (÷ reales) ≠ exactitud (÷ total) · FPR ≠ 1 − precisión | Accuracy, precision, recall y F1, Matriz de confusion |
| C2 P9 | Comparar punto de operación ≠ comparar modelo | ROC y AUC |
| C2 P10 | Declarar un vacío ≠ producir una respuesta plausible | Fundamentos de Ciencia de Datos |
| C2 P11 | Medido / supuesto / no disponible | Analisis exploratorio de datos (EDA), Fundamentos de Ciencia de Datos |
| C1 P1 | Campo interdisciplinario (V/F) | Fundamentos de Ciencia de Datos |
| C1 P2 | Organización data-driven (V/F) | Fundamentos de Ciencia de Datos |
| C1 P3 | Rol del líder y reclutamiento (V/F) | Fundamentos de Ciencia de Datos |
| C1 P4 | Ciclo de vida iterativo (V/F) | Fundamentos de Ciencia de Datos |
| C1 P5 | Webscraping (selección múltiple) | láminas 8–10 de FCD-04 |
| C1 P6 | Tipo de problema / tipo de variable | Datos, filas, columnas, features y target, Clasificacion |
| C1 P7 | Reclutamiento del equipo | Fundamentos de Ciencia de Datos |
| C1 P8 | Big Data: las V | Fundamentos de Ciencia de Datos |
| C1 P9A | Desarrollo con tabla: estructura y calidad | Datos, filas, columnas, features y target, Limpieza y preparacion de datos |
| C1 P9B | Desarrollo con tabla: consumo minero (2,0 pts) | Limpieza y preparacion de datos, Analisis exploratorio de datos (EDA) |
3 · Mapa por cadenas del currículum
De grafo.yaml: cada cadena es un camino de prerrequisitos.
- del error a la validacion: Regresion → Overfitting y underfitting → Generalizacion → Train / validation / test → Validacion cruzada
- de la clasificacion al AUC: Clasificacion → Matriz de confusion → Accuracy, precision, recall y F1 → ROC y AUC
- de un arbol a un ensamble: Arboles de decision → Random Forest → Gradient Boosting → Ensembles
- del dato al modelo: Datos, filas, columnas, features y target → Analisis exploratorio de datos (EDA) → Limpieza y preparacion de datos → Regresion
- hacia los sistemas actuales: Redes neuronales → Deep learning → Modelos de lenguaje (LLM) → Agentes de IA
Herramientas: triaje de problemas (¿qué tipo de problema tengo?) · laboratorio de la función de costo · simulador de predicción de falla (umbral, matriz y métricas) · Certamen 1 · Certamen 2 · Certamen 3 · guía escrita overfitting_underfitting.md · cuadernillo 01_sobreajuste_y_calidad_de_datos.md.
Certamen 3, leído desde las clases
La prueba sigue en su página. Esta tabla dice en qué clase está cada idea.
| Pregunta | Qué usa del examen | Dónde se vio |
|---|---|---|
| C3 P1a | De los conteos a la curva (FPR, TPR) | Clase 12 · Clase 13 · Clase 14 · simulador |
| C3 P1b | Qué curva es mejor | Clase 14 · punto y modelo · AUC |
| C3 P1c | Umbral para detectar a todos | Clase 14 · simulador |
| C3 P1d | Falsos positivos al mes | Clase 14 · de la tasa a personas |
| C3 P2a | Grado 10 y error de entrenamiento | Clase 5 · polinomio · Clase 10 · brecha |
| C3 P2b | Grado para datos nuevos | Clase 10 · brecha |
| C3 P2c | Media, desviación y RMSE | Clase 6 · costo |
| C3 P3a | Leer dos paneles de adopción | Clase 3 · la forma · integridad visual |
| C3 P3b | Histograma con dos montones | Clase 3 · Clase 4 · verificar |
| C3 P3c | Límites de un LLM aislado | Clase 18 · LLM |
| C3 P3d | Por qué la instrucción es de un agente | Clase 18 · agentes |
4 · Clases transcritas
La fuente citable de cada visual. Las transcripciones son automáticas y pueden errar en números y términos: el material oficial del curso manda. El profesor fue explícito sobre qué entra al certamen: «Entran solo mis clases. No entran las clases de Alejandra.» [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:18:16].
5 · Cómo leer las etiquetas
[FUENTE · Repo: ruta · marca] | Sale de un archivo del repositorio: lámina, práctico, transcripción (con marca de tiempo) o resultados. |
[INFERENCIA] | Se deriva de las fuentes, pero no está escrito en ninguna. |
[DATITO] | Explicación, analogía o cifra ilustrativa del tutor. Útil, pero no es del profesor. |
⟨ ⟩ | Corrección de un error de la transcripción automática dentro de una cita. |
⚠ | Cifra o término que la transcripción pudo alterar: contrastar con la lámina. |