Unidad 6 · Integrar y rendirClase 20 de 23
Clase 20 · Distinciones del Certamen 1

Objetivo. Resolver el Certamen 1 en el formato del profesor, justificando cada respuesta con su distinción.

Ficha Bloom · Evaluar
  • Evidencia de aprendizaje: Responde cada pregunta con justificación y la contrasta con el análisis de la página.
  • Actividad final: La 9B completa, en papel.
  • Criterio de dominio: Justifica cada respuesta con un mecanismo o una fuente, no con intuición.
Activación. Antes de abrir cada pregunta: escribe tu respuesta y la distinción que la decide. Escribe tu respuesta antes de seguir: la retomas en el cierre.

Certamen 1 · pregunta por pregunta

Fundamentos, adquisición y calidad de datos · Fundamentos de Ciencia de Datos · UdeC · 24 de julio de 2026

Cómo usar esta página. Lee el enunciado, responde en papel y recién después abre Respuesta y análisis. Cada análisis da la respuesta, la justifica con las láminas y clases del curso, nombra la distinción que decide la pregunta y el error típico.
FormatoPreguntasPuntos
Verdadero o falso con justificación1–40,5 c/u
Selección múltiple, varias correctas5–80,5 c/u
Desarrollo con tabla de datos9 (variantes A y B)2,0
Comentarios y supuestos100

La pregunta 9 vale 2,0 puntos: la mitad de las ocho cerradas juntas. Cada estudiante recibe preguntas sorteadas de un banco, así que conviene dominar el tipo de pregunta y no solo esta versión [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md · 0:05:42–0:05:55].

Parte 1 · Verdadero o falso con justificación

1
Ciencia de datos como campo
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«La ciencia de datos es un campo interdisciplinario que utiliza métodos científicos, procesos y sistemas sobre datos provenientes de distintos dominios con el fin de obtener conocimiento relevante desde estos datos.»
Respuesta y análisis
Respuesta
Verdadero. Es la definición del curso: método científico aplicado a datos de cualquier dominio para obtener conocimiento.
Análisis
  1. Interdisciplinario: la lámina 5 de FCD-03 la dibuja como la intersección de computación, matemáticas, estadística y conocimiento del dominio. Sin uno de los cuatro, el resultado tiene otro nombre (machine learning, investigación tradicional o desarrollo de software).
  2. «Distintos dominios» significa áreas de conocimiento, no fuentes de datos. El profesor lo aclaró durante el certamen:
«Estamos hablando de los distintos dominios, no las fuentes de los datos. Entonces, cuando digo dominio, no sé, un dominio podría ser la zoología. Otro dominio podría ser la física cuántica» Certamen 1, 24-jul · 0:22:23–0:22:34 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md]
Qué decide la pregunta: dominio del conocimiento (zoología, física, minería) ≠ fuente de datos (un sensor, una API, una planilla).

Error típico: leer «distintos dominios» como «distintas fuentes» y buscar ahí una trampa que no existe.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 5]. Repasar: Clase 1 · fundamentos
Practica: si quitas el conocimiento del dominio y te quedas con computación, matemáticas y estadística, ¿qué obtienes según el diagrama?
Respuesta correcta y cómo se resuelve

Respuesta: machine learning, no ciencia de datos. En la lámina 5, la intersección de computación con matemáticas y estadística lleva ese nombre.

Error típico: «sigue siendo ciencia de datos, solo que más técnica». Quitar un círculo cambia la disciplina.

2
Organización data-driven
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«Las organizaciones basadas en datos (data driven) se caracterizan por tener conocimiento de sus datos y usarlos en todos sus procesos.»
Respuesta y análisis
Respuesta
Falso. «Usar datos en todos sus procesos» define la etapa Conocedora de datos, la penúltima de la escala. Una organización Basada en datos es data-first: toma sus decisiones en función de los datos.
La escala del curso (lámina 6 de FCD-02)
#EtapaDefinición en la lámina
1Resistente a los datosSe resiste activamente a usar datos
2Consciente de los datosCuriosa por los datos
3Guiada por los datosComienza a usar datos en producción
4Conocedora de datos«Usa datos en todos sus procesos»
5Basada en datos«Empresa es data-first»
«conocedora de los datos que ocupan estos datos en todos sus procesos pero que existen algunos procesos en los cuales todavía estos datos no se utilizan para las decisiones» Clase del 26-jun · 1:51:16–1:51:26 · [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md]
Qué decide la pregunta: usar datos (etapa 4) ≠ decidir con datos (etapa 5). El enunciado describe la etapa 4 y le pone el nombre de la 5.

Error típico: marcar «Verdadero» porque la frase suena a data-driven. Pregúntate qué le falta para ser la última etapa: que las decisiones se tomen en función de los datos.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 6 y 7]. Repasar: Clase 1 · la escala de cinco etapas
Practica: una empresa usa dashboards en todas sus áreas, pero cuando el dato contradice al gerente, gana el gerente. ¿En qué etapa está y qué le falta?
Respuesta correcta y cómo se resuelve

Respuesta: etapa 4, Conocedora de datos. Le falta que las decisiones se tomen en función de los datos (etapa 5).

Error típico: ponerla en la 5 porque «todos usan dashboards». Usar datos no es decidir con ellos.

3
Equipo y jefe de proyecto
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«Generalmente los proyectos basados en Ciencia de Datos requieren de colaboradores con distintas habilidades, y el jefe del proyecto debe preocuparse de que dentro del equipo hayan expertos en cada una de las áreas requeridas.»
Respuesta y análisis
Respuesta
Verdadero. Es lo que se enseñó en la clase del 26-jun: como casi nunca una persona reúne todas las habilidades, el equipo se arma con personas de alto conocimiento en cada área que el proyecto requiere, y el jefe coordina y hace de puente entre todos.
Análisis
  1. Primera parte (colaboradores con distintas habilidades): lámina 5 de FCD-03 y láminas 7–12, «Habilidades: ¿T, Π, Γ?» y «Proyectos interdisciplinarios complejos».
  2. Segunda parte (expertos en cada área): la conclusión de la clase lo dice casi con las mismas palabras:
«comúnmente lo que tenemos que buscar es tener personas con alto nivel de conocimiento en cada una de las áreas […] que necesitamos para cumplir este proyecto pero que tengan al mismo tiempo un nivel suficiente para poder comunicarse» Clase del 26-jun · 2:16:58–2:17:14 · [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md]

El jefe es quien tiene alto conocimiento en su área y conocimiento moderado en las demás, porque «va a coordinar a todo el resto» y hace de «puente entre todo» [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:18:23–2:19:03].

Qué decide la pregunta: evaluar cada mitad del enunciado por separado; las dos son verdaderas. Agrega en la justificación el matiz de clase: los expertos también deben poder comunicarse.

Error típico: responder «Falso, el líder es un traductor». La palabra del curso es «puente», y que el líder coordine no contradice que deba asegurar expertos en cada área.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 5–12]. Repasar: Clase 1 · el equipo y el líder
Practica: un equipo tiene un experto en cada área, pero ninguno entiende el vocabulario de los demás. ¿Cumple lo pedido en clase?
Respuesta correcta y cómo se resuelve

Respuesta: no. Cumple la profundidad (un experto por área), pero le falta el «nivel suficiente para poder comunicarse» y un líder que haga de puente.

Error típico: creer que basta juntar especialistas.

4
Ciclo de vida iterativo
0,5Evaluar
Enunciado Verdadero o falso. En caso de ser falso, justifique su respuesta.
«Al momento de poner en marcha un modelo predictivo, no siempre se da por finalizado el proyecto. En ocasiones se debe volver al modelado o incluso tener que replantear el objetivo inicial.»
Respuesta y análisis
Respuesta
Verdadero. El proceso del curso es un ciclo: la puesta en marcha conecta de vuelta con el requerimiento, y cualquier etapa puede devolverse a una anterior.
Las siete etapas (láminas 16–22 de FCD-02)
#Etapa
1Requerimientos del negocio o preguntas a responder
2Recolección de datos
3Limpieza de datos
4Exploración de datos
5Modelamiento de datos
6Visualización y comunicación
7Puesta en marcha e integración
«después volvemos al requerimiento pregunta. Y como siempre decimos la flechita ⟨apunta⟩ a los dos lados porque a veces uno está modelando y de repente se ⟨da⟩ cuenta que el modelo no funciona bien y tiene que volver a explorar los datos» Clase del 7-ago · 0:01:07–0:01:17 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md]

El profesor contó un caso real: un modelo en producción rindió peor que el anterior y en un día volvieron de la puesta en marcha a la exploración [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:03:53–0:05:26]. La lámina 22 da la razón: en el laboratorio se trabaja con supuestos y en un ambiente controlado; en la práctica esos supuestos dejan de valer.

Qué decide la pregunta: el proceso es un ciclo, no una línea que termina en la puesta en marcha.

Error típico: justificar con marcos externos (CRISP-DM, OSEMN) en vez del ciclo de siete etapas del curso.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 16–22]. Repasar: Clase 1 · el ciclo
Practica: el modelo de Melbourne se entrenó con 2016 y se evaluó en 2017. Si siguiera en uso hasta 2020, ¿qué señal te avisaría y a qué etapa volverías primero?
Respuesta correcta y cómo se resuelve

Respuesta: la señal es que el error sobre ventas nuevas supere lo medido en 2017 (MAE 188.218 AUD). Primero se vuelve a la recolección de ventas recientes; después a exploración y modelamiento.

Error típico: cambiar de algoritmo con los mismos datos de 2016: un algoritmo nuevo no sabe nada de 2020. MAE: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json].

Parte 2 · Selección múltiple

5
Webscraping
0,5Analizar
Enunciado Respecto a webscraping, ¿cuál o cuáles de las siguientes afirmaciones son correctas?
  1. Es una herramienta muy útil para obtener datos desde páginas que no entreguen acceso directo a sus datos.
  2. Se puede hacer sobre cualquier tipo de página web.
  3. Es más simple que acceder a los datos a través de una API.
  4. Se pueden usar librerías de Scrapping para extraer datos de archivos HTML y XML.
Respuesta y análisis
Respuesta
Correctas: 1 y 4.
Análisis
#VeredictoLo que dice la lámina
1CorrectaLámina 9: páginas de gobierno antiguas o noticieros pequeños «no tengan APIs», ni RSS, ni bases de datos para descargar
2FalsaLámina 10: «¿Deberías hacerlo? ¿Estás violando los términos de servicio? ¿Hay problemas de privacidad?». Hay límites legales y éticos
3FalsaLámina 9: se scrapea porque no hay API o no se quiere pagar por ella, no porque sea más simple
4CorrectaLámina 9, textual: «Librerías de Scrapping para extraer datos de archivos HTML y XML (Ej: BeautifulSoup)»
Qué decide la pregunta: por qué se hace scraping (no hay API o cuesta dinero) ≠ que sea más fácil. Y desconfía de los absolutos («cualquier tipo de página»).

Error típico: marcar la 2 porque técnicamente casi todo se puede descargar. La lámina 10 separa poder de deber.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_04_CalidadDeDatos.md · láminas 8–10]. Repasar: Clase 1 · recolección
Practica: un sitio tiene API de pago y también se puede scrapear. ¿Qué te preguntas antes de scrapear, y cambia la respuesta si es para explorar o para un producto publicado?
Respuesta correcta y cómo se resuelve

Respuesta: «¿debería hacerlo?»: términos de servicio y privacidad. Para un producto publicado el riesgo es mayor y corresponde pagar la API.

Error típico: responder solo desde lo técnico («se puede, así que sí»).

6
Tipo de problema
0,5Analizar
Enunciado Considere que Ud. debe realizar un modelo para predecir la calidad del material que producirá una máquina en función de los insumos de entrada de la máquina. La salida del modelo debe ser «bueno», «regular», o «malo». En términos del tipo de datos de entrada y salida, ¿qué tipo de modelo debe generar?
Respuesta y análisis
Respuesta
Clasificación multi-clase.
Análisis: el Mapa Metodológico (lámina 23 de FCD-03)
  1. ¿Predecir o análisis? Predecir: se quiere la calidad de un caso nuevo.
  2. ¿Se tienen datos? Sí: insumos históricos con su calidad resultante.
  3. ¿Numérico o categórico? Categórico: la salida es una etiqueta.
  4. ¿Binario o no binario? No binario: son tres clases.
  5. Hoja: clasificación multi-clase.

Lo que fija el tipo de modelo es la salida. Las entradas pueden ser numéricas y el problema sigue siendo de clasificación.

Qué decide la pregunta: tres categorías ≠ un número continuo. Entre «regular» y «bueno» no existe un punto medio.

Error típico: responder «regresión» porque «bueno, regular, malo» tiene orden. Tener orden no lo convierte en un número.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 23]; [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_04_CalidadDeDatos.md · lámina 20]. Repasar: Clase 22 · triaje de problemas · Clase 11 · clasificación
Practica: si en vez de «bueno, regular, malo» hubiera que predecir el porcentaje exacto de impurezas, ¿por qué rama del mapa bajarías?
Respuesta correcta y cómo se resuelve

Respuesta: Predecir → Se tienen datos → Numérico → Estático → Regresión. Se separa del caso anterior en la bifurcación numérico / categórico.

Error típico: quedarse en clasificación porque es la misma máquina: el tipo de modelo lo fija la salida.

7
Reclutar un data scientist
0,5Analizar
Enunciado ¿Cuáles de las siguientes consideraciones se deben tomar en cuenta al momento de reclutar a un data scientist?
Respuesta y análisis
Respuesta
Se marcan las tres consideraciones de las láminas 20 y 21:
  1. Llegarán muchos candidatos, pero pocos con la experiencia necesaria.
  2. Hay que partir de las habilidades que le faltan a la organización o al equipo.
  3. El candidato debe adaptarse a problemas de distintos dominios.
Análisis
ConsideraciónLámina
Muchos candidatos, pocos con experienciaLámina 20: «Muchos están dispuestos a postular pero pocos tienen la experiencia necesaria (~5 %)»
Habilidades que faltan en el equipoLámina 20: «¿Qué tipo de llave necesito?»
Adaptación a distintos dominiosLámina 21: «Entrevista enfocada a adaptación a distintos dominios»

No corresponden: buscar un especialista en un solo tema (contradice la adaptación a distintos dominios) ni exigir una lista fija de tecnologías (las herramientas son un catálogo, no el criterio de selección).

La lámina 21 completa las sugerencias: prueba técnica hecha por especialistas, ejemplos reales, entrevista con el equipo y experiencia previa demostrada.

Qué decide la pregunta: se contrata a quien completa el equipo, no «al mejor» en abstracto.

Error típico: marcar una lista de tecnologías como requisito.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 20 y 21]. Repasar: Clase 1 · el equipo
Practica: de las sugerencias de la lámina 21, ¿cuál verifica la amplitud del perfil en T y cuál la profundidad?
Respuesta correcta y cómo se resuelve

Respuesta: la amplitud (barra horizontal) la verifica la entrevista de adaptación a distintos dominios; la profundidad (barra vertical), la prueba técnica hecha por especialistas y la experiencia previa.

Error típico: asignar la prueba técnica a la amplitud: mide dominio de un área.

8
Big Data
0,5Analizar
Enunciado ¿Cuál o cuáles de las siguientes características de los datos tienen relación con el concepto de «Big Data»?
Respuesta y análisis
Respuesta
Volumen, Velocidad y Variedad (las tres V de la clase), y Veracidad, que el profesor presentó como cuarta V. No corresponden el entendimiento del dominio (es una competencia de la persona) ni el webscraping (es un método de adquisición).
Análisis
«esto acá es lo que se llaman las tres ⟨V⟩ volumen velocidad y variedad […] cuando un proyecto es de big data es cuando la infraestructura que yo tengo actualmente no es lo suficientemente buena para resolver el problema» Clase del 19-jun · 0:54:24–0:54:47 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md]
VQué mideEjemplo de clase
VolumenCuántos datos hayUn megabyte cabe en un pendrive; un petabyte obliga a otra infraestructura
VelocidadA qué ritmo llegan y hay que procesarlosLote, periódico, casi tiempo real, tiempo real
VariedadCuántos formatos convivenUna tabla frente a Instagram: video, imagen, texto
VeracidadCuánto se puede confiar en ellosUn sensor que falla el 10 % de las veces
Qué decide la pregunta: una característica es de Big Data si describe una propiedad de los datos que hace que la infraestructura actual deje de alcanzar. Con ese criterio se resuelve cualquier lista de alternativas.

Error típico: definir Big Data por un número de filas o de terabytes.

Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:52–0:57:14]. Repasar: Clase 1 · las tres V
Practica: el dataset de Melbourne tiene unas 13.580 filas. ¿Es Big Data? Responde con el criterio de la infraestructura.
Respuesta correcta y cómo se resuelve

Respuesta: no: un computador personal lo procesa en segundos. Sería Big Data si alguna V creciera hasta superar la infraestructura disponible, por ejemplo tasar en tiempo real cada aviso del país con fotos y texto [DATITO].

Error típico: responder «no, porque son pocas filas». La conclusión es correcta, el criterio no.

Parte 3 · Desarrollo

9A
Estructura de datos tabulares
2,0Analizar + Crear
Enunciado Analice el siguiente conjunto de datos:
NombreApellidoMatrícula17/9/201719/10/201722/11/2017
JuanitaPérez0101(vacío)5.67.5
PedritoGutiérrez12031.2N/AN/A
MarciaNavarroN/A6.77.05.5
DiegoHernández43093.22.77.0
Respuesta y análisis
Método del profesor (láminas 23–27 de FCD-04)
PreguntaRespuesta
¿Qué evento se mide?Una evaluación: la nota de un alumno en una fecha
¿Cuáles son las variables?Alumno (matrícula), Fecha y Nota
Problemas
  1. Los encabezados ocultan la variable Fecha. 17/9/2017 es un valor de Fecha, no una variable, y la Nota queda repartida en tres columnas. Lámina 25: «cada encabezado de columna representa un único valor en lugar de una variable».
  2. La matrícula no funciona como identificador: Marcia tiene N/A. Sin identificador no se puede unir con otra tabla ni detectar duplicados.
  3. Los faltantes están codificados de dos formas: celda vacía y el texto N/A. Se unifican como nulos, y se declara en la pregunta 10 que se asume que significan lo mismo.
Estructura correcta: una fila por alumno y fecha
IDMatrículaNombreApellidoFechaNota
10101JuanitaPérez2017-09-17nulo
20101JuanitaPérez2017-10-195.6
30101JuanitaPérez2017-11-227.5
… 4 alumnos × 3 fechas = 12 filas
Qué decide la pregunta: encontrar la variable escondida en los encabezados con las dos preguntas del profesor: qué evento se mide y cuáles son las variables.

Error típico: reemplazar los faltantes por 0. Un 0 es una nota real y baja el promedio.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_04_CalidadDeDatos.md · láminas 23–27]. Repasar: Clase 4 · limpieza · Clase 2 · filas, columnas y variables
Practica: ¿por qué no basta con reemplazar los N/A por cero? Calcula el efecto en el promedio de la columna 19/10/2017.
Respuesta correcta y cómo se resuelve

Respuesta: porque un 0 es una nota real. Sin el N/A: (5.6 + 7.0 + 2.7) / 3 = 5,10. Con el N/A convertido en 0: 15.3 / 4 = 3,83. Un alumno sin nota baja el promedio del curso más de un punto.

Error típico: tratar la ausencia de medición como una medición.

9B
Consumo de combustible en minería
2,0Analizar + Crear
Enunciado Análisis del registro semanal de camiones:
CONSUMOCANTIDAD
El Lunes(vacío)
Camión 1200
Camión 2200
Camión 32900
Camión 4200
El Martes(vacío)
Camión 1200
Camión 2 (Conductor enfermo)0
Camión 3 (en mantenimiento)−999
Camión 4200
El Miércoles(vacío)
Camión 1200
Camión 2200
Camión 3 (en mantenimiento)−999
Camión 4200
Respuesta y análisis
Es el ejercicio de la lámina 27 de FCD-04, resuelto por el profesor en la lámina 28 y en vivo el 15-jul. Variables: Día, Camión, Consumo. Evento medido: el consumo por día y por camión [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:11:28–1:11:38].
Problemas
  1. El día está escondido en filas separadoras. «El Lunes» es un valor de la variable Día, que no tiene columna.
  2. La columna CONSUMO mezcla tres cosas: días, camiones y estados («conductor enfermo», «en mantenimiento»).
  3. El −999 es un código centinela: significa «no hubo medición», escrito como número. Entra en los cálculos como si fuera un consumo.
  4. El 0 del conductor enfermo es una medición real: el camión no salió y consumió cero. Se conserva, igual que el profesor conserva los ceros en la lámina 28.
  5. El 2900 es un valor atípico: se marca para verificar con la operación (digitación, sensor o un camión distinto), no se borra.
Tratamiento de cada valor
ValorQué esQué se hace
−999Ausencia de medición (mantención)Pasa a nulo, con el motivo en una columna Estado
0Consumo real igual a ceroSe conserva
2900Valor atípicoSe marca «a verificar» y se deja fuera de los promedios hasta confirmarlo
Estructura correcta: una fila por camión y día
IDDíaCamiónConsumoEstado
1Lunes1200operativo
3Lunes32900operativo · a verificar
6Martes20conductor enfermo
7Martes3nuloen mantenimiento
… 12 filas

Dos mejoras que el profesor pidió en clase: usar la fecha exacta en vez de «Lunes» («hay muchos miércoles») [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:13:21–1:13:36], y que Camión sea un ID numérico enlazado a una tabla con la descripción de cada camión [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 1:11:44–1:12:00]. Si la tabla no trae fechas, el supuesto se declara en la pregunta 10.

El efecto en la media
CálculoMediaLectura
12 filas tal cual208,50Parece razonable porque los errores se compensan: +225 del 2900, −199,83 de los −999, −16,67 del 0
Quitando solo los −999450,00Peor: el 2900 queda sin contrapeso
Sin −999 y con el 2900 apartado177,78La limpieza correcta: el 0 se conserva
Qué decide la pregunta: un valor medido que vale cero (0) ≠ un código que significa «no hay medición» (−999). Los dos son números; solo el contexto los separa, y aquí está escrito entre paréntesis.

Error típico: eliminar juntos el −999 y el 0 «porque son datos malos», o afirmar que el 2900 es un error sin haberlo verificado.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_04_CalidadDeDatos.md · láminas 27 y 28]. Repasar: Clase 4 · esta tabla, manipulable · Clase 3 · ceros y atípicos en un gráfico
Practica: alguien propone eliminar el −999 y el 0 porque «ensucian el promedio». ¿Es correcto? Da la cifra que lo demuestra.
Respuesta correcta y cómo se resuelve

Respuesta: no. El −999 sale (a nulo, con su estado), pero el 0 se queda.

  1. Las 12 filas suman 8 × 200 + 2.900 + 0 − 999 − 999 = 2.502 → media 208,50.
  2. Quitando los −999 y el 0 y dejando el 2900: 4.500 / 9 = 500,00, más del doble de lo típico.
  3. Limpieza correcta (−999 a nulo, 0 conservado, 2900 apartado): 1.600 / 9 = 177,78.

Error típico: meter en el mismo saco un código de ausencia y una medición que vale cero.

10
Comentarios y supuestos
0
Enunciado Espacio de retroalimentación.
Respuesta y análisis

El profesor pidió usar este espacio para los supuestos: si hacían «algún supuesto que no están seguros», que lo pusieran «en la pregunta 10» [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md · 0:22:49–0:22:54].

Respuesta modelo «En la 9A asumí que la celda vacía y el N/A significan lo mismo (nota no registrada). En la 9B asumí que Lunes, Martes y Miércoles son días consecutivos de la misma semana; con las fechas exactas, las usaría en la columna Día.»

Las trampas de este certamen

TrampaDóndePregunta que la desarma
La etapa penúltima con el nombre de la última2¿Qué le falta para ser la última etapa?
Enunciado de dos partes3¿Es verdadera cada mitad por separado?
Absolutos: «cualquier», «siempre»5¿Existe un contraejemplo?
Categorías con orden6¿Existe el punto medio? Si no, no es regresión
Características que no son de los datos8¿Describe una propiedad de los datos que desborda la infraestructura?
Variable escondida en encabezados o filas9A, 9B¿Qué evento se mide? ¿Cuáles son las variables?
Números que en realidad son códigos9B¿Qué significaría este valor si fuera un consumo real?

Cierre de la Clase 20 · Distinciones del Certamen 1

Qué aprendiste

  • Cada pregunta se resuelve separando dos conceptos vecinos.
  • La 9B (2,0 puntos) se gana con procedimiento: fila, problemas, clasificación, tratamiento.

Qué no debes confundir

  • Recordar una definición ≠ discriminar entre dos conceptos.
  • Cada certamen se arma sorteando preguntas de un banco: domina el tipo de pregunta, no solo esta versión.

Procedimiento para el papel

  1. Lee el enunciado dos veces y subraya la cláusula que acota.
  2. Nombra la distinción que decide.
  3. Responde y justifica con el mecanismo.

Viene de: Clase 18 · Deep learning, LLM y agentes · Sigue: Clase 21 · Distinciones del Certamen 2

Vuelve a tu activación: Antes de abrir cada pregunta: escribe tu respuesta y la distinción que la decide. ¿Cambiarías tu respuesta?

Pregunta final. ¿Qué distinción decide la P2 del Certamen 1?
Respuesta correcta y cómo se resuelve

Usar datos ≠ decidir a partir de los datos: la escala de cinco etapas hacia data-driven. [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 21 · Distinciones del Certamen 2