Objetivo. Resolver el Certamen 1 en el formato del profesor, justificando cada respuesta con su distinción.
- Evidencia de aprendizaje: Responde cada pregunta con justificación y la contrasta con el análisis de la página.
- Actividad final: La 9B completa, en papel.
- Criterio de dominio: Justifica cada respuesta con un mecanismo o una fuente, no con intuición.
Certamen 1 · pregunta por pregunta
Fundamentos, adquisición y calidad de datos · Fundamentos de Ciencia de Datos · UdeC · 24 de julio de 2026
| Formato | Preguntas | Puntos |
|---|---|---|
| Verdadero o falso con justificación | 1–4 | 0,5 c/u |
| Selección múltiple, varias correctas | 5–8 | 0,5 c/u |
| Desarrollo con tabla de datos | 9 (variantes A y B) | 2,0 |
| Comentarios y supuestos | 10 | 0 |
La pregunta 9 vale 2,0 puntos: la mitad de las ocho cerradas juntas. Cada estudiante recibe preguntas sorteadas de un banco, así que conviene dominar el tipo de pregunta y no solo esta versión [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md · 0:05:42–0:05:55].
Parte 1 · Verdadero o falso con justificación
«La ciencia de datos es un campo interdisciplinario que utiliza métodos científicos, procesos y sistemas sobre datos provenientes de distintos dominios con el fin de obtener conocimiento relevante desde estos datos.»
Respuesta y análisis
- Interdisciplinario: la lámina 5 de FCD-03 la dibuja como la intersección de computación, matemáticas, estadística y conocimiento del dominio. Sin uno de los cuatro, el resultado tiene otro nombre (machine learning, investigación tradicional o desarrollo de software).
- «Distintos dominios» significa áreas de conocimiento, no fuentes de datos. El profesor lo aclaró durante el certamen:
Error típico: leer «distintos dominios» como «distintas fuentes» y buscar ahí una trampa que no existe.
Respuesta correcta y cómo se resuelve
Respuesta: machine learning, no ciencia de datos. En la lámina 5, la intersección de computación con matemáticas y estadística lleva ese nombre.
Error típico: «sigue siendo ciencia de datos, solo que más técnica». Quitar un círculo cambia la disciplina.
«Las organizaciones basadas en datos (data driven) se caracterizan por tener conocimiento de sus datos y usarlos en todos sus procesos.»
Respuesta y análisis
| # | Etapa | Definición en la lámina |
|---|---|---|
| 1 | Resistente a los datos | Se resiste activamente a usar datos |
| 2 | Consciente de los datos | Curiosa por los datos |
| 3 | Guiada por los datos | Comienza a usar datos en producción |
| 4 | Conocedora de datos | «Usa datos en todos sus procesos» |
| 5 | Basada en datos | «Empresa es data-first» |
Error típico: marcar «Verdadero» porque la frase suena a data-driven. Pregúntate qué le falta para ser la última etapa: que las decisiones se tomen en función de los datos.
Respuesta correcta y cómo se resuelve
Respuesta: etapa 4, Conocedora de datos. Le falta que las decisiones se tomen en función de los datos (etapa 5).
Error típico: ponerla en la 5 porque «todos usan dashboards». Usar datos no es decidir con ellos.
«Generalmente los proyectos basados en Ciencia de Datos requieren de colaboradores con distintas habilidades, y el jefe del proyecto debe preocuparse de que dentro del equipo hayan expertos en cada una de las áreas requeridas.»
Respuesta y análisis
- Primera parte (colaboradores con distintas habilidades): lámina 5 de FCD-03 y láminas 7–12, «Habilidades: ¿T, Π, Γ?» y «Proyectos interdisciplinarios complejos».
- Segunda parte (expertos en cada área): la conclusión de la clase lo dice casi con las mismas palabras:
El jefe es quien tiene alto conocimiento en su área y conocimiento moderado en las demás, porque «va a coordinar a todo el resto» y hace de «puente entre todo» [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:18:23–2:19:03].
Error típico: responder «Falso, el líder es un traductor». La palabra del curso es «puente», y que el líder coordine no contradice que deba asegurar expertos en cada área.
Respuesta correcta y cómo se resuelve
Respuesta: no. Cumple la profundidad (un experto por área), pero le falta el «nivel suficiente para poder comunicarse» y un líder que haga de puente.
Error típico: creer que basta juntar especialistas.
«Al momento de poner en marcha un modelo predictivo, no siempre se da por finalizado el proyecto. En ocasiones se debe volver al modelado o incluso tener que replantear el objetivo inicial.»
Respuesta y análisis
| # | Etapa |
|---|---|
| 1 | Requerimientos del negocio o preguntas a responder |
| 2 | Recolección de datos |
| 3 | Limpieza de datos |
| 4 | Exploración de datos |
| 5 | Modelamiento de datos |
| 6 | Visualización y comunicación |
| 7 | Puesta en marcha e integración |
El profesor contó un caso real: un modelo en producción rindió peor que el anterior y en un día volvieron de la puesta en marcha a la exploración [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:03:53–0:05:26]. La lámina 22 da la razón: en el laboratorio se trabaja con supuestos y en un ambiente controlado; en la práctica esos supuestos dejan de valer.
Error típico: justificar con marcos externos (CRISP-DM, OSEMN) en vez del ciclo de siete etapas del curso.
Respuesta correcta y cómo se resuelve
Respuesta: la señal es que el error sobre ventas nuevas supere lo medido en 2017 (MAE 188.218 AUD). Primero se vuelve a la recolección de ventas recientes; después a exploración y modelamiento.
Error típico: cambiar de algoritmo con los mismos datos de 2016: un algoritmo nuevo no sabe nada de 2020. MAE: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json].
Parte 2 · Selección múltiple
- Es una herramienta muy útil para obtener datos desde páginas que no entreguen acceso directo a sus datos.
- Se puede hacer sobre cualquier tipo de página web.
- Es más simple que acceder a los datos a través de una API.
- Se pueden usar librerías de Scrapping para extraer datos de archivos HTML y XML.
Respuesta y análisis
| # | Veredicto | Lo que dice la lámina |
|---|---|---|
| 1 | Correcta | Lámina 9: páginas de gobierno antiguas o noticieros pequeños «no tengan APIs», ni RSS, ni bases de datos para descargar |
| 2 | Falsa | Lámina 10: «¿Deberías hacerlo? ¿Estás violando los términos de servicio? ¿Hay problemas de privacidad?». Hay límites legales y éticos |
| 3 | Falsa | Lámina 9: se scrapea porque no hay API o no se quiere pagar por ella, no porque sea más simple |
| 4 | Correcta | Lámina 9, textual: «Librerías de Scrapping para extraer datos de archivos HTML y XML (Ej: BeautifulSoup)» |
Error típico: marcar la 2 porque técnicamente casi todo se puede descargar. La lámina 10 separa poder de deber.
Respuesta correcta y cómo se resuelve
Respuesta: «¿debería hacerlo?»: términos de servicio y privacidad. Para un producto publicado el riesgo es mayor y corresponde pagar la API.
Error típico: responder solo desde lo técnico («se puede, así que sí»).
Respuesta y análisis
- ¿Predecir o análisis? Predecir: se quiere la calidad de un caso nuevo.
- ¿Se tienen datos? Sí: insumos históricos con su calidad resultante.
- ¿Numérico o categórico? Categórico: la salida es una etiqueta.
- ¿Binario o no binario? No binario: son tres clases.
- Hoja: clasificación multi-clase.
Lo que fija el tipo de modelo es la salida. Las entradas pueden ser numéricas y el problema sigue siendo de clasificación.
Error típico: responder «regresión» porque «bueno, regular, malo» tiene orden. Tener orden no lo convierte en un número.
Respuesta correcta y cómo se resuelve
Respuesta: Predecir → Se tienen datos → Numérico → Estático → Regresión. Se separa del caso anterior en la bifurcación numérico / categórico.
Error típico: quedarse en clasificación porque es la misma máquina: el tipo de modelo lo fija la salida.
Respuesta y análisis
- Llegarán muchos candidatos, pero pocos con la experiencia necesaria.
- Hay que partir de las habilidades que le faltan a la organización o al equipo.
- El candidato debe adaptarse a problemas de distintos dominios.
| Consideración | Lámina |
|---|---|
| Muchos candidatos, pocos con experiencia | Lámina 20: «Muchos están dispuestos a postular pero pocos tienen la experiencia necesaria (~5 %)» |
| Habilidades que faltan en el equipo | Lámina 20: «¿Qué tipo de llave necesito?» |
| Adaptación a distintos dominios | Lámina 21: «Entrevista enfocada a adaptación a distintos dominios» |
No corresponden: buscar un especialista en un solo tema (contradice la adaptación a distintos dominios) ni exigir una lista fija de tecnologías (las herramientas son un catálogo, no el criterio de selección).
La lámina 21 completa las sugerencias: prueba técnica hecha por especialistas, ejemplos reales, entrevista con el equipo y experiencia previa demostrada.
Error típico: marcar una lista de tecnologías como requisito.
Respuesta correcta y cómo se resuelve
Respuesta: la amplitud (barra horizontal) la verifica la entrevista de adaptación a distintos dominios; la profundidad (barra vertical), la prueba técnica hecha por especialistas y la experiencia previa.
Error típico: asignar la prueba técnica a la amplitud: mide dominio de un área.
Respuesta y análisis
| V | Qué mide | Ejemplo de clase |
|---|---|---|
| Volumen | Cuántos datos hay | Un megabyte cabe en un pendrive; un petabyte obliga a otra infraestructura |
| Velocidad | A qué ritmo llegan y hay que procesarlos | Lote, periódico, casi tiempo real, tiempo real |
| Variedad | Cuántos formatos conviven | Una tabla frente a Instagram: video, imagen, texto |
| Veracidad | Cuánto se puede confiar en ellos | Un sensor que falla el 10 % de las veces |
Error típico: definir Big Data por un número de filas o de terabytes.
Respuesta correcta y cómo se resuelve
Respuesta: no: un computador personal lo procesa en segundos. Sería Big Data si alguna V creciera hasta superar la infraestructura disponible, por ejemplo tasar en tiempo real cada aviso del país con fotos y texto [DATITO].
Error típico: responder «no, porque son pocas filas». La conclusión es correcta, el criterio no.
Parte 3 · Desarrollo
| Nombre | Apellido | Matrícula | 17/9/2017 | 19/10/2017 | 22/11/2017 |
|---|---|---|---|---|---|
| Juanita | Pérez | 0101 | (vacío) | 5.6 | 7.5 |
| Pedrito | Gutiérrez | 1203 | 1.2 | N/A | N/A |
| Marcia | Navarro | N/A | 6.7 | 7.0 | 5.5 |
| Diego | Hernández | 4309 | 3.2 | 2.7 | 7.0 |
Respuesta y análisis
| Pregunta | Respuesta |
|---|---|
| ¿Qué evento se mide? | Una evaluación: la nota de un alumno en una fecha |
| ¿Cuáles son las variables? | Alumno (matrícula), Fecha y Nota |
- Los encabezados ocultan la variable Fecha.
17/9/2017es un valor de Fecha, no una variable, y la Nota queda repartida en tres columnas. Lámina 25: «cada encabezado de columna representa un único valor en lugar de una variable». - La matrícula no funciona como identificador: Marcia tiene
N/A. Sin identificador no se puede unir con otra tabla ni detectar duplicados. - Los faltantes están codificados de dos formas: celda vacía y el texto
N/A. Se unifican como nulos, y se declara en la pregunta 10 que se asume que significan lo mismo.
| ID | Matrícula | Nombre | Apellido | Fecha | Nota |
|---|---|---|---|---|---|
| 1 | 0101 | Juanita | Pérez | 2017-09-17 | nulo |
| 2 | 0101 | Juanita | Pérez | 2017-10-19 | 5.6 |
| 3 | 0101 | Juanita | Pérez | 2017-11-22 | 7.5 |
| … 4 alumnos × 3 fechas = 12 filas | |||||
Error típico: reemplazar los faltantes por 0. Un 0 es una nota real y baja el promedio.
N/A por cero?
Calcula el efecto en el promedio de la columna 19/10/2017.Respuesta correcta y cómo se resuelve
Respuesta: porque un 0 es una nota real. Sin el N/A: (5.6 + 7.0 + 2.7) / 3 = 5,10. Con el N/A convertido en 0: 15.3 / 4 = 3,83. Un alumno sin nota baja el promedio del curso más de un punto.
Error típico: tratar la ausencia de medición como una medición.
| CONSUMO | CANTIDAD |
|---|---|
| El Lunes | (vacío) |
| Camión 1 | 200 |
| Camión 2 | 200 |
| Camión 3 | 2900 |
| Camión 4 | 200 |
| El Martes | (vacío) |
| Camión 1 | 200 |
| Camión 2 (Conductor enfermo) | 0 |
| Camión 3 (en mantenimiento) | −999 |
| Camión 4 | 200 |
| El Miércoles | (vacío) |
| Camión 1 | 200 |
| Camión 2 | 200 |
| Camión 3 (en mantenimiento) | −999 |
| Camión 4 | 200 |
Respuesta y análisis
- El día está escondido en filas separadoras. «El Lunes» es un valor de la variable Día, que no tiene columna.
- La columna CONSUMO mezcla tres cosas: días, camiones y estados («conductor enfermo», «en mantenimiento»).
- El −999 es un código centinela: significa «no hubo medición», escrito como número. Entra en los cálculos como si fuera un consumo.
- El 0 del conductor enfermo es una medición real: el camión no salió y consumió cero. Se conserva, igual que el profesor conserva los ceros en la lámina 28.
- El 2900 es un valor atípico: se marca para verificar con la operación (digitación, sensor o un camión distinto), no se borra.
| Valor | Qué es | Qué se hace |
|---|---|---|
−999 | Ausencia de medición (mantención) | Pasa a nulo, con el motivo en una columna Estado |
0 | Consumo real igual a cero | Se conserva |
2900 | Valor atípico | Se marca «a verificar» y se deja fuera de los promedios hasta confirmarlo |
| ID | Día | Camión | Consumo | Estado |
|---|---|---|---|---|
| 1 | Lunes | 1 | 200 | operativo |
| 3 | Lunes | 3 | 2900 | operativo · a verificar |
| 6 | Martes | 2 | 0 | conductor enfermo |
| 7 | Martes | 3 | nulo | en mantenimiento |
| … 12 filas | ||||
Dos mejoras que el profesor pidió en clase: usar la fecha exacta en vez de «Lunes» («hay muchos miércoles») [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:13:21–1:13:36], y que Camión sea un ID numérico enlazado a una tabla con la descripción de cada camión [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:11:44–1:12:00]. Si la tabla no trae fechas, el supuesto se declara en la pregunta 10.
| Cálculo | Media | Lectura |
|---|---|---|
| 12 filas tal cual | 208,50 | Parece razonable porque los errores se compensan: +225 del 2900, −199,83 de los −999, −16,67 del 0 |
| Quitando solo los −999 | 450,00 | Peor: el 2900 queda sin contrapeso |
| Sin −999 y con el 2900 apartado | 177,78 | La limpieza correcta: el 0 se conserva |
0) ≠ un código
que significa «no hay medición» (−999). Los dos son números; solo el contexto los separa, y aquí está
escrito entre paréntesis.Error típico: eliminar juntos el −999 y el 0 «porque son datos malos», o afirmar que el 2900 es un error sin haberlo verificado.
Respuesta correcta y cómo se resuelve
Respuesta: no. El −999 sale (a nulo, con su estado), pero el 0 se queda.
- Las 12 filas suman 8 × 200 + 2.900 + 0 − 999 − 999 = 2.502 → media 208,50.
- Quitando los −999 y el 0 y dejando el 2900: 4.500 / 9 = 500,00, más del doble de lo típico.
- Limpieza correcta (−999 a nulo, 0 conservado, 2900 apartado): 1.600 / 9 = 177,78.
Error típico: meter en el mismo saco un código de ausencia y una medición que vale cero.
Respuesta y análisis
El profesor pidió usar este espacio para los supuestos: si hacían «algún supuesto que no están seguros», que lo pusieran «en la pregunta 10» [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md · 0:22:49–0:22:54].
Las trampas de este certamen
| Trampa | Dónde | Pregunta que la desarma |
|---|---|---|
| La etapa penúltima con el nombre de la última | 2 | ¿Qué le falta para ser la última etapa? |
| Enunciado de dos partes | 3 | ¿Es verdadera cada mitad por separado? |
| Absolutos: «cualquier», «siempre» | 5 | ¿Existe un contraejemplo? |
| Categorías con orden | 6 | ¿Existe el punto medio? Si no, no es regresión |
| Características que no son de los datos | 8 | ¿Describe una propiedad de los datos que desborda la infraestructura? |
| Variable escondida en encabezados o filas | 9A, 9B | ¿Qué evento se mide? ¿Cuáles son las variables? |
| Números que en realidad son códigos | 9B | ¿Qué significaría este valor si fuera un consumo real? |
Cierre de la Clase 20 · Distinciones del Certamen 1
Qué aprendiste
- Cada pregunta se resuelve separando dos conceptos vecinos.
- La 9B (2,0 puntos) se gana con procedimiento: fila, problemas, clasificación, tratamiento.
Qué no debes confundir
- Recordar una definición ≠ discriminar entre dos conceptos.
- Cada certamen se arma sorteando preguntas de un banco: domina el tipo de pregunta, no solo esta versión.
Procedimiento para el papel
- Lee el enunciado dos veces y subraya la cláusula que acota.
- Nombra la distinción que decide.
- Responde y justifica con el mecanismo.
Viene de: Clase 18 · Deep learning, LLM y agentes · Sigue: Clase 21 · Distinciones del Certamen 2
Vuelve a tu activación: Antes de abrir cada pregunta: escribe tu respuesta y la distinción que la decide. ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Usar datos ≠ decidir a partir de los datos: la escala de cinco etapas hacia data-driven. [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.