Objetivo. Explicar qué problema resuelve la ciencia de datos, ubicar una organización en la escala data-driven y decidir cuándo no hace falta un modelo.
- Evidencia de aprendizaje: Explica con sus palabras la definición (interdisciplinario, conocimiento, datos) y ubica tres organizaciones en la escala de cinco etapas.
- Actividad final: Reconstruir la ruta de retroceso del ciclo que contó el profesor: de puesta en marcha a exploración.
- Criterio de dominio: Ubica bien los tres casos y justifica con el criterio de la escala (¿los datos guían decisiones?), no con «usan muchos datos».
Fundamentos de Ciencia de Datos
Qué es esto, antes de que exista un modelo.
Fundamentos de Ciencia de Datos · UdeC · T2-2026
Aun así, también puntúa. En el Certamen 1 las preguntas 1 a 4, la 7 y la 8 salen de aquí: campo interdisciplinario, organización data-driven, rol del líder, ciclo de vida iterativo, reclutamiento y Big Data. Seis preguntas cerradas de 0,5 puntos cada una (3,0 en total). Auditoría pregunta por pregunta en certamen_1.html. [FUENTE · Repo:
01_DOCUMENTACION/06_CERTAMEN1/00_LEEME.md]
1 · La definición, palabra por palabra
El profesor titular dio esta definición en la clase del 19-jun y dijo de dónde la sacó: de Wikipedia [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:13–0:49:21]. Lo importante no es la definición completa, sino las tres palabras que él mismo marcó.
⟨⟩ = corrección de transcripción [INFERENCIA]
Y enseguida marcó sus tres palabras: «interdisciplinario conocimiento y datos» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:37]. Más tarde el segundo docente repitió una versión de Wikipedia al presentar la rueda y subrayó las mismas ideas [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:59:12–2:00:35].
| Palabra | Qué obliga | Qué se dijo en clase |
|---|---|---|
| Interdisciplinario | El científico de datos no puede resolver el problema solo. Necesita al experto del dominio para saber qué pregunta vale la pena. | El segundo docente puso el ejemplo de minería: él sabe mucho de ciencia de datos pero no tanto de minería, así que necesita colaborar de forma constante con los expertos del área. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:59:54–2:00:03] |
| Conocimiento | El producto no es el modelo, ni el gráfico, ni el dashboard. Es una decisión mejor tomada. Si nadie decide distinto, no hubo conocimiento. | El segundo docente: se usan datos para extraer conocimiento útil para tomar decisiones. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:00:27–2:00:42] |
| Datos | Y añade: potencialmente ruidosos. El ruido no es un accidente que se pueda limpiar del todo — es parte de la definición. Vuelve en la sección 8. | Está en la cita de arriba, en boca del profesor titular: datos «potencialmente ruidoso», estructurados o no. |
2 · Lo que la ciencia de datos no es
La pregunta 1 del Certamen 1 es verdadero/falso sobre el campo interdisciplinario. Ese formato se resuelve separando vecinos, no recitando la definición.
| Vecino | Qué hace | Qué le falta para ser ciencia de datos |
|---|---|---|
| Estadística | Cuantifica incertidumbre y contrasta hipótesis sobre una muestra. | No se hace cargo de recolectar, limpiar, poner en marcha ni comunicar. |
| Inteligencia artificial / ML | Algoritmos que aprenden una función desde ejemplos. | Es una etapa del proceso —el modelamiento—, no el proceso. |
| Ingeniería de datos | Construye las tuberías: ingestión, almacenamiento, disponibilidad. | Deja el dato disponible; no responde la pregunta de negocio. |
| Business Intelligence | Reporta lo que pasó, en tableros y KPIs. | Describe el pasado. No experimenta, no predice, no itera sobre hipótesis. |
| Big Data | Nombra una condición de escala, velocidad y variedad. | Es un adjetivo del problema, no una disciplina. Ver sección 5. |
Autocomprobación · dos V/F al estilo del profesor [DATITO]
(a) «Un equipo formado por tres ingenieros civiles informáticos que dominan estadística, programación y visualización constituye un equipo interdisciplinario de ciencia de datos.» ¿V o F, y por qué?
(b) «Todo proyecto de ciencia de datos incluye una etapa de modelamiento con inteligencia artificial.» ¿V o F, y por qué?
Respuesta correcta y cómo se resuelve
Respuesta: las dos son falsas.
(a) Falso. Tienen varias herramientas, no varias disciplinas. Pasos: (1) subraya «interdisciplinario»; (2) cuenta disciplinas, no habilidades: los tres son de la misma, informática; (3) nombra lo que falta: quien conozca el dominio del problema —el geólogo, el médico, el forestal—, que es quien sabe si la pregunta tiene sentido y si el resultado es plausible. Sin experto de dominio nadie valida la pregunta, solo el cálculo.
(b) Falso. Pasos: (1) subraya el cuantificador «todo»; (2) busca un contraejemplo: un proyecto que termina en la exploración porque la respuesta ya está en un gráfico de barras, o porque los datos no permiten responder. El modelamiento es una etapa disponible, no obligatoria; el mapa metodológico tiene ramas enteras de análisis sin modelo predictivo (ver abajo).
Error típico: en (a), confundir «sabe muchas cosas» con «viene de varias disciplinas»; en (b), creer que ciencia de datos es sinónimo de modelo.
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 5] (interdisciplina: computación, matemáticas, estadística y dominio) y [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 23] (mapa metodológico). La justificación paso a paso es [INFERENCIA].
Qué problema resuelve, y cuándo no hace falta ningún modelo
El problema que resuelve la ciencia de datos no es «tener datos» ni «tener un modelo»: es convertir datos en una decisión mejor tomada. El profesor titular lo cerró así, después de una discusión sobre por qué Uber vale lo que vale:
Y la lámina sobre cómo cambiar la cultura organizacional lo dice en forma de consejo: enfocarse en «qué problemas puedo solucionar con datos» en lugar de «qué datos necesito» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 8]. El Mapa Metodológico del curso empieza con la misma bifurcación: ¿Predecir o Análisis? Del lado del análisis quedan la segmentación, la agregación, la descripción y lo geoespacial; del lado de predecir sin datos queda el A/B test [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 23 y 25]. Es decir: hay ramas enteras del mapa donde no se entrena ningún modelo predictivo.
Procedimiento: ¿hace falta un modelo? [INFERENCIA, sobre la lámina 23 de FCD-03]
- Escribe la decisión y quién la toma. Si no hay decisión, no hay requerimiento: la rueda ni siquiera arranca.
- ¿Se pregunta por lo que ya pasó o por casos que aún no ves? Lo que ya pasó (un total, un promedio por grupo, un mapa) es Análisis: una agregación o un gráfico lo responde. Sin modelo.
- Si hay que predecir, ¿tienes datos con la respuesta? Si no los tienes, el mapa manda a un A/B test: primero se experimenta y se recolecta. Todavía sin modelo.
- Si tienes datos, ¿qué tipo de salida? Número → regresión; categoría → clasificación. Recién aquí hay modelo (ver triaje_de_problemas.html).
- Compara contra lo simple. Un modelo solo se justifica si le gana a un baseline (la mediana, una regla) en algo que cambie la decisión.
Ejercicio de aplicación y transferencia · ¿modelo, agregación o experimento?
Para cada pedido, di en qué rama del mapa cae y si hace falta un modelo predictivo. Los casos (c) a (e) son de otros dominios, a propósito [DATITO].
- Melbourne: «¿cuál fue el precio mediano de 2017 por tipo de vivienda: casa, departamento, townhouse?»
- Melbourne: «estimar el precio de las 7.244 propiedades vendidas en 2017 con lo aprendido de las 6.336 de 2016».
- Forestal: «¿cuántas hectáreas se cosecharon el año pasado en cada comuna?»
- Transporte: una empresa de buses quiere saber si un horario nuevo sube los pasajeros. Nunca lo ha probado.
- Minería: con cinco años de historial de mantenciones, «¿qué camiones fallarán la próxima semana?»
Respuesta correcta y cómo se resuelve
Respuesta: hace falta modelo solo en (b) —regresión— y en (e) —clasificación binaria—. (a) y (c) se resuelven con una agregación y (d) con un experimento A/B.
Pasos: aplica el procedimiento de arriba a cada pedido: ¿análisis o predicción? → si es predicción, ¿hay datos con la respuesta? → si los hay, ¿número o categoría?
(a) Análisis → agregación. Es un valor calculado sobre un grupo
(tipo de vivienda). Un groupby lo responde. Sin modelo.
(b) Predecir → se tienen datos → numérico → regresión. Es lo
que hizo tu proyecto: HistGradientBoosting sobre log1p(Price)
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json].
Aquí sí hay modelo — y la pregunta de si le gana a un tasador humano queda para
la sección 9.
(c) Análisis → agregación geográfica. Suma por comuna. Sin modelo.
(d) Predecir → no se tienen datos → A/B test. No hay historial del horario nuevo: primero se prueba en algunas líneas y se compara. Entrenar un modelo sin ese dato sería inventar la respuesta.
(e) Predecir → se tienen datos → categórico binario → clasificación binaria. Falla / no falla. Aquí sí hay modelo, y la clase positiva es rara: ver metricas_clasificacion.html.
Error típico: responder (a) o (c) con «entrenaría un modelo», o (d) con «entreno un modelo con los datos de pasajeros»: no hay datos del horario nuevo, así que el modelo no tiene de dónde aprender el efecto. Tres de los cinco pedidos se resuelven sin ningún modelo.
Fuente: ramas del [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 23 y 25]; clasificación de cada caso [INFERENCIA]; casos (c) a (e) [DATITO].
3 · Organización data-driven
El segundo docente abrió su parte de la clase del 19-jun con esto, antes que con cualquier técnica. Y su definición es más estrecha de lo que suena: son organizaciones «cuyo proceso, cuyo valor los generan a partir de los datos», y de las que ponía de ejemplo dijo que todo lo que deciden, en general, lo deciden a partir de los datos [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:31:31–1:33:01]. La lámina 7 de FCD-02 lo dice en su columna Data Driven: «Toman decisiones en función de los datos» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 7].
Un compañero que trabaja en minería lo dijo en esa misma clase, cuando el segundo docente pidió ejemplos: en minería existe la idea de que las decisiones salen solo de la experiencia, y lo que él intenta es respaldar lo que se dice con datos en vez del «siempre se ha hecho así». [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:30:41–1:31:08]
El marco oficial: la escala de cinco etapas
Este es el marco que el curso usa para data-driven, y el que decide la pregunta 2 del Certamen 1. Está en la lámina 6 de FCD-02; el segundo docente la enseñó el 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:44:31–1:47:47] y la repasó el 26-jun [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:48:43–1:51:52].
| # | Etapa (lámina) | Descriptor en la lámina | Eje |
|---|---|---|---|
| 1 | Resistente a los datos | Se resiste activamente a usar datos | — |
| 2 | Consciente de los datos | Curiosa por los datos | DATOS |
| 3 | Guiada por los datos | Comienza a usar datos en producción | ANÁLISIS |
| 4 | Conocedora de datos | Usa datos en todos sus procesos | VISIÓN |
| 5 | Basada en Datos | Empresa es data-first | ESTRATEGIA |
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 6]
⟨⟩ = corrección de transcripción [INFERENCIA]
Ejercicio de interpretación y transferencia · V/F con justificación, formato C1 P2 [DATITO]
(a) «Una organización que almacena todos sus datos en un servidor centralizado ya es una organización basada en datos.»
(b) «Una empresa que tiene tableros en todas sus áreas y los usa a diario, pero cuyo gerente decide por intuición cuando el dato le incomoda, está en la etapa 5.»
(c) Transferencia, salud. «Un hospital que registra cada signo vital en fichas electrónicas, pero asigna camas por orden de llegada sin mirar esos registros, es data-driven.»
Respuesta correcta y cómo se resuelve
Respuesta: las tres son falsas. Pasos para cada una: (1) ubica a la organización en la escala de cinco etapas; (2) pregunta quién decide y con qué; (3) justifica con lo que le falta para subir.
(a) Falso. Almacenar no es generar valor. Es literalmente la frase del profesor titular citada en la sección 2: no sirve dejarlo almacenado en un servidor, hay que ser capaz de generar valor desde esos datos. En la escala, acumular sin saber cómo usarlo se parece a la etapa 2, la de la organización curiosa que tiene los datos «almacenados en alguna parte» pero no los hace llegar al resto [INFERENCIA] sobre [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:50:38–1:51:08].
(b) Falso. Usa datos en todos sus procesos (etapa 4, Conocedora), pero hay decisiones que no se toman con ellos. Le falta exactamente lo que define la 5.
(c) Falso. Registrar es tener datos, no decidir con ellos. La lámina 7 pone del lado No Data Driven a quien toma decisiones «en función de la intuición y experiencia» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 7].
Error típico: confundir tener o usar datos con decidir con ellos. Las tres organizaciones tienen datos; ninguna deja que los datos decidan. Es el mismo error que castiga la pregunta 2 del Certamen 1.
Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 6 y 7]; ubicación de cada caso en la escala [INFERENCIA].
Fuera del temario: tres posturas, con vocabulario externo
[DATITO] Este comparador usa la palabra data-informed, que no es vocabulario del curso (ver la nota de abajo). Sirve como intuición para una idea que la escala sí contiene: cambia quién decide, no cuántos datos hay. Caso forestal: una empresa decide si adelanta la cosecha de un rodal de pino radiata con un modelo de crecimiento alimentado con inventarios, precios de madera y pronóstico de lluvia.
01_DOCUMENTACION/06_CERTAMEN1/00_LEEME.md]. Data-informed
no aparece en ninguna de las 14 transcripciones disponibles al 2026-09-21 ni en las
láminas FCD de 05_CLASES/11_PRESENTACIÓN/_markdown/
[INFERENCIA, por búsqueda de «informed» e «informad»].Consecuencia práctica: justifica con la escala de cinco etapas —la del curso— y, si usas data-informed, decláralo como vocabulario externo. Separar lo que viene del curso de lo que traes de fuera es la conducta que premian las preguntas 10 y 11 del Certamen 2 (certamen_2.html#p11).
4 · Por qué ahora y no antes
Dato de la lámina 5 de FCD-02, citando a Cindi Howson: solo el 20 % de las empresas está empoderando a los trabajadores de primera línea con datos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 5]. El segundo docente aclaró que «primera línea» son los que interactúan a diario con el cliente [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:36:32–1:36:36]. La brecha no es tecnológica.
La explicación del segundo docente de por qué ahora sí se puede, en dos piezas: abundancia de datos (internet masivo) y modelos capaces de extraerles información [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:33:22–1:34:42]. Y de por qué las empresas antiguas no logran la transformación, en otras dos: lo operativo y lo humano [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:41:21–1:43:27]. Las startups tienen ventaja —dice la lámina 5— y según él la ventaja es que no tienen una forma establecida de hacer las cosas que desmontar [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:39:42–1:39:51].
5 · Big Data: las tres V, y la cuarta
Aquí está la distinción más cara del bloque, y el profesor titular la dijo con todas las letras en la clase del 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:52–0:57:14]. Primero recorrió volumen, velocidad y variedad con ejemplos (un megabyte en un pendrive frente a un petabyte; un lote frente a tiempo real; una tabla frente a Instagram) y las llamó «las tres ⟨V⟩» que se asocian a big data [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:54:24–0:54:32] —la transcripción dice «las tres de corta»; ⟨⟩ = corrección de transcripción [INFERENCIA]—. Después dio el criterio:
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «data de quien»
Una central meteorológica recibe cada noche 40 TB por lote y su clúster los procesa sin apuro. Mañana le exigen procesar los mismos 40 TB en tiempo real. El volumen no cambió. ¿Pasa a ser un problema de big data?
Respuesta correcta y cómo se resuelve
Respuesta: depende de la infraestructura; si el clúster que hoy procesa esos 40 TB por lote no alcanza a procesarlos en tiempo real, sí pasa a ser un problema de big data, aunque el volumen no haya cambiado.
Pasos: (1) identifica qué V cambió: no el volumen, la velocidad —de lote nocturno a tiempo real—; (2) aplica el criterio del profesor: es big data cuando la infraestructura que tienes no alcanza para resolver el problema; (3) concluye: con el clúster actual, pensado para lotes, lo más probable es que no alcance, y entonces sí lo es; si la organización invierte y lo resuelve, deja de serlo.
Error típico: responder «no, porque el volumen es el mismo». Eso trata big data como sinónimo de «muchos datos» y olvida que velocidad y variedad cuentan igual.
Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:54:40–0:55:27]; el caso de la central meteorológica es [DATITO].
Mueve las tres V y, después, mueve la capacidad. La línea negra vertical es lo que tu infraestructura aguanta hoy.
La regla del simulador —es big data si al menos una dimensión supera la capacidad— es un dispositivo didáctico [DATITO]. El criterio es del profesor; el umbral por dimensión lo puse yo para que puedas moverlo.
La cuarta V no se arregla con más servidores
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «de corta» y «verás»
Volumen, velocidad y variedad son problemas de capacidad: se atacan con infraestructura. La veracidad es un problema de confianza: duplicar el clúster no la mejora en nada. Por eso está aparte en el simulador — y por eso desemboca en calidad de datos, que en el Certamen 1 vale 2,0 puntos en una sola pregunta.
Autocomprobación · selección múltiple, formato del profesor [DATITO]
¿Cuál de estas afirmaciones sobre Big Data es incorrecta?
- Un proyecto deja de ser big data cuando la organización mejora su infraestructura.
- Un conjunto de datos de 50 TB es, por su tamaño, un problema de big data.
- La variedad se refiere a que los datos llegan en formatos heterogéneos: texto, imagen, señales, tablas.
- La veracidad apunta a la confiabilidad del dato, por ejemplo cuando un sensor falla intermitentemente.
Respuesta correcta y cómo se resuelve
Respuesta: la incorrecta es la (b).
Pasos: (1) busca el absoluto escondido: «por su tamaño»; (2) contrástalo con el criterio del profesor: big data es una relación entre el dato y la infraestructura, no un umbral; (3) contraejemplo: 50 TB pueden ser rutina para una organización con el clúster adecuado y un colapso para otra.
Error típico: marcar la (a) por sonar raro. Es tratar una relación (dato frente a infraestructura) como una cantidad. La (c) y la (d) son correctas: variedad y veracidad tal como las explicó.
Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:52:55–0:56:02].
La (a) suena a trampa y no lo es: es el final de la cita de arriba —una vez resuelto con mejor infraestructura, «ya no sería un problema de ⟨big data⟩».
Esta es la pregunta 8 del Certamen 1: ver certamen_1.html#p8.
6 · La ruedita: el ciclo es iterativo, no lineal
El segundo docente la presentó en la clase del 19-jun como «la figura más importante de este de este trimestre en este curso» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:58:59–1:59:04], y el profesor titular la repasó al abrir las clases del 15-jul y del 7-ago [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:00:46–0:02:26] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:00:43–0:01:17].
Siete etapas, en sentido horario [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 16–22]:
Requerimiento / pregunta →
Recolección →
Limpieza →
Exploración →
Modelamiento →
Visualización y comunicación →
Puesta en marcha → y vuelta al requerimiento
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «me voy a contar»
Un retroceso real, contado por el profesor
El profesor titular abrió la clase del 15-jul con lo que le había pasado ese mismo día en su trabajo, con un modelo que clasifica lo que observan los telescopios:
Lo que omite el […] es la ruta completa, etapa por etapa: de la puesta en marcha volvieron a la visualización (revisar los gráficos que ya tenían), de ahí al modelamiento (los modelos eran casi iguales; cambiaban los datos de entrenamiento), de ahí a la exploración, y sospechan que el origen está en la recolección o en la limpieza —quizá borraron lo que no debían— [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:04:00–0:05:49]. Nada de eso fue un fracaso: es el ciclo funcionando.
Ejercicio de producción · explícaselo a alguien. Sin mirar el párrafo de arriba, reconstruye por escrito la ruta hacia atrás del caso del profesor: en qué etapa se detectó el problema, a qué etapas volvieron y qué revisaron en cada una, y dónde creen que está el origen. Después explícale a un compañero que no vino a clase por qué ese viaje hacia atrás confirma que la respuesta de la pregunta 4 es «Verdadero». Llévalo a Datito para que lo revise.
Respuesta correcta y cómo se resuelve
Respuesta en una frase: el problema se detectó en la puesta en marcha y volvieron hacia atrás por visualización → modelamiento → exploración, con la sospecha puesta en la recolección o la limpieza.
Respuesta modelo (explicación a un compañero): «El profesor tenía un modelo en producción clasificando lo que ven los telescopios. Un día notaron que el modelo nuevo rendía peor que el anterior: eso se detectó en la puesta en marcha. Primero volvieron a la visualización y revisaron los gráficos que ya tenían para entender el modelo; vieron cosas raras. Entonces volvieron al modelamiento y compararon los modelos: eran casi iguales, y la diferencia era que se habían entrenado con datos distintos. Por eso volvieron a la exploración, a mirar esos datos otra vez. Lo que sabían era que el modelo nuevo rendía peor; lo que sospechaban era que algo se hizo mal al recolectar los datos, o que en la limpieza borraron cosas que no debían. Y todo eso pasó en un solo día. Por eso la pregunta 4 del Certamen 1 es verdadera: poner un modelo en marcha no da por terminado el proyecto; desde ahí se puede volver al modelado o más atrás.»
Criterios para revisar la tuya: etapas con los nombres de la rueda; el orden hacia atrás sin saltarse la visualización; qué se buscó en cada etapa, no solo su nombre; la separación entre lo que se sabía y lo que se sospechaba; la conexión con el enunciado.
Error típico: contar la historia como un fracaso («se equivocaron y tuvieron que rehacer»). Para el curso, volver atrás es el modo normal del ciclo, no un error del equipo.
Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:03:27–0:05:58].
Tres cifras que se confunden: 90 %, 80 % y 80 %
| Cifra | Qué mide | Quién y cuándo |
|---|---|---|
| 90 % | De las veces que retrocede porque el modelo no da lo esperado, cuántas el problema está en la limpieza. | Segundo docente, clase del 26-jun [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:54:12] |
| 80 % | Del tiempo de un proyecto ya resuelto por otros, cuánto se va en recolección y limpieza. | Segundo docente, clase del 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:13:44–2:13:54] |
| 80 % | Del tiempo total, cuánto se va entre recolección, limpieza y exploración. | Profesor titular, clase del 15-jul [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:06:18–0:06:30] |
⚠ Las tres son estimaciones dichas de palabra («yo diría», «aproximadamente»), no datos medidos, y no aparecen en las láminas FCD. Úsalas como órdenes de magnitud atribuidos, no como cifras duras [INFERENCIA].
¿A qué etapa vuelves?
Cinco síntomas. Para cada uno, elige la etapa a la que hay que retroceder. Se puede fallar sin costo: la idea es ver de qué depende la respuesta.
Respuesta correcta y cómo se resuelve
Respuesta: 1 → Limpieza · 2 → Requerimiento · 3 → Comunicación · 4 → Puesta en marcha (detecta) y de ahí recolección o requerimiento · 5 → Limpieza.
Pasos: para cada síntoma, pregunta dónde nació el problema, no dónde lo viste. (1) Landsize 0 y 40.000 m² son valores fuera de rango: nacieron al limpiar mal. (2) El dato al nivel de camión y turno no existe: la pregunta no es respondible tal como está, así que se refina el requerimiento. (3) El modelo funciona; lo que falla es traducirlo a la decisión de gerencia. (4) Nadie tocó el código y el modelo se degrada: lo detecta el monitoreo de la puesta en marcha, y la causa probable es que cambió el mundo, así que se vuelve a recolectar o a replantear. (5) Una columna con litros, IDs, texto y un −999 es sobrecarga semántica y un centinela: limpieza.
Error típico: elegir la etapa donde apareció el síntoma («modelamiento», porque ahí se vio el precio absurdo) en vez de la etapa donde nació. Retroceder no es fallar: es el ciclo.
Fuente: la rueda y sus flechas en [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 16–22] y [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:02:10–2:05:18]; los cinco casos son [DATITO].
Dónde está la puesta en marcha en tu propio proyecto
La pregunta 4 del Certamen 1 junta «ciclo iterativo» con «puesta en producción». No es casualidad: la puesta en marcha es la etapa que más gente omite al describir el ciclo, porque es la única que no produce un archivo bonito.
09_RESULTADOS/06_ENTREGABLES/INFORME_MODELO_FCD_P3.md]
7 · El equipo: líder, reclutamiento, y por qué importa
Dos preguntas del Certamen 1 —la 3 y la 7— van sobre personas, no sobre técnica. Se contestan desde la palabra interdisciplinario.
El marco de clase son las habilidades en forma de letra —T, Π y Γ: cuántas habilidades tienes y qué tan profundo en cada una—, en las láminas 7 a 12 de FCD-03 y explicado por el segundo docente el 26-jun [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 7–12] [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:10:29–2:12:45]. Su conclusión para proyectos complejos: como casi nadie reúne todo, se buscan personas con alto conocimiento en cada una de las áreas que el proyecto necesita, que además puedan comunicarse con el resto en el mismo lenguaje [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:16:18–2:17:16]. Esa frase pesa directamente sobre la pregunta 3: ver certamen_1.html#p3.
| Rol | Qué aporta | Qué NO le corresponde |
|---|---|---|
| Líder del proyecto | Coordinar a todo el equipo. Según el segundo docente, alguien con alto conocimiento en su área y conocimiento moderado en todas las demás, para saber qué hace cada uno y ser «el puente entre todo» [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:18:23–2:18:59]. | Ser el mejor modelador del equipo. Si su valor es escribir el modelo, el equipo no tiene líder, tiene un modelador más. |
| Experto de dominio | Saber si la pregunta vale la pena, si el dato es plausible y si el resultado es físicamente posible. | Escribir el código. Puede no programar nada y ser imprescindible. |
| Científico de datos | Recolectar, limpiar, explorar, modelar, evaluar. Según el segundo docente, en casi todo el ciclo —salvo el requerimiento y quizá la puesta en marcha— «debe meter las manos en el código» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:06:11–2:06:34]. | Decidir solo qué se hace con el hallazgo. |
| Ingeniero de datos / plataforma | Que el dato exista, llegue a tiempo y se pueda reproducir. | Responder la pregunta de negocio. |
8 · La ecuación: Y = f(X) + ε
La definición dijo «datos potencialmente ruidosos». Esto es esa frase, escrita. Antes de la notación, la versión con palabras que dio el segundo docente —y fíjate en el ejemplo que eligió:
La «función» es f; los «datos» son X; la «respuesta que
yo quiero» es Y. Lo que la frase no dice —y la ecuación sí— es que
la respuesta real nunca es exactamente la función: siempre queda un resto,
ε. Esa descomposición es el marco estándar del área, no una
lámina del curso [DATITO].
| Símbolo | Qué es | Quién lo pone | En Melbourne |
|---|---|---|---|
Y | El target: lo que quieres saber. | lo decide la persona | Price, el precio de venta. |
X | Las features: lo que sí tienes anotado. | viene del dato y lo decide la persona al elegir cuáles usar | 9 numéricas + 3 categóricas. Suburb, Date y
otras seis quedaron fuera. |
f | La relación verdadera entre X e Y. Existe, y nunca la vas a ver. | — | Cómo el mercado de Melbourne fija un precio. |
f̂ (efe gorro) | Tu aproximación a f.
Eso es «el modelo». |
lo aprende el modelo | HistGradientBoosting sobre log1p(Price). |
ε | Todo lo que mueve a Y y
no está en X. Error irreducible. |
— | El estado de la cocina, la urgencia del vendedor, quién más fue a ese remate ese sábado. |
Qué problema resuelve. Separa dos cosas que un alumno mezcla todo el tiempo: el error que cometes por tener mal el modelo (reducible: mejor algoritmo, mejores features, más datos) y el error que cometes porque el mundo no está en la tabla (irreducible: no hay algoritmo que lo baje).
Vas a subir ε, el ruido. El modelo
perfecto —el que acertara f exactamente— ¿qué error
tendría?
Respuesta correcta y cómo se resuelve
Respuesta: el error del modelo perfecto sube con el ruido: es exactamente el tamaño de ε.
Pasos: (1) el modelo perfecto predice f(X); (2) lo
observado es Y = f(X) + ε; (3) su error es
Y − f(X) = ε; (4) si ε crece, su error crece, aunque el
modelo no cometa ningún error propio. Con números de juguete: si
f(X) = 900 mil y la casa se vendió en 950 mil, el modelo perfecto
se equivoca en 50 mil, y esos 50 mil son todo ruido
[DATITO, cifras ilustrativas].
Error típico: responder «cero, porque es perfecto». Perfecto
respecto de f, no respecto de Y.
Fuente: la descomposición Y = f(X) + ε es
el marco estándar del área, no una lámina del curso [DATITO]; la idea de modelo
como función en
[FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:51:44–2:52:00].
Miles de AUD. La curva
negra es f; los puntos son f(X)+ε; la curva azul
punteada es f̂, un modelo bueno pero no exacto.
Fíjate en la tercera cifra: con ε bajo, casi todo tu error es culpa tuya y
se puede arreglar; con ε alto, la parte reducible se encoge
y mejorar el modelo deja de pagar.
[DATITO] — datos simulados con la escala de
Melbourne, no sus filas reales.
El camino inverso: te dan la ecuación, reconstruye el fenómeno
En una prueba escrita te la van a entregar ya escrita. Desármala al revés.
Te dan: Y = f(X) + ε, y te dicen que un modelo
alcanza MAE 188.218 AUD sobre una mediana de 910.000.
Ejercicio de cálculo e interpretación: ¿qué se puede afirmar, y qué no, solo con eso? Calcula a mano qué fracción de la mediana es el error típico.
Respuesta correcta y cómo se resuelve
Respuesta: se puede afirmar que el error típico es un 20,7 % de la mediana y que tiene una parte reducible y otra irreducible; no se puede afirmar cuánto vale cada parte.
Se puede afirmar: el error típico equivale a un 20,7 % de la
mediana (188.218 / 910.000). Y que ese error tiene dos partes sumadas: lo que se
podría mejorar cambiando el modelo o las features, y lo que no se puede bajar
porque depende de cosas que no están en X.
No se puede afirmar: cuánto vale cada parte. ε
no es observable — si lo fuera, lo meterías en X y
dejaría de ser ε. Nadie puede decirte «de esos 188.218, tantos son
irreducibles».
Lo que sí da una cota útil: comparar contra un baseline. El
baseline de mediana de tu propio proyecto da MAE 431.649. Tu modelo baja a
188.218 — recortó 243.431 AUD de error reducible. Que quede más por
recortar, y cuánto, no lo sabes.
[FUENTE · Repo:
09_RESULTADOS/resultados_temporal.json]
Cálculo a mano: 188.218 / 910.000 = 0,2068… ≈ 20,7 %. 431.649 − 188.218 = 243.431.
Error típico: decir «el 20,7 % es ruido» o «el modelo podría
bajar a cero». Ninguna de las dos cosas se sabe: ε no se
observa.
Fuente: cifras de
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]; la lectura con
ε es [INFERENCIA].
ε: es error reducible mal repartido —el modelo
ajustó detalles de 2016 que no se repiten en 2017. Confundir una cosa con la otra
es el atajo por el que se cuela la palabra «sobreajuste» como etiqueta de cualquier
empeoramiento.
9 · La pregunta que te va a hacer Datito
Tu modelo predice el precio de una casa en Melbourne. Un tasador humano también lo hace.
¿Qué aporta el modelo que el tasador no, y qué aporta el tasador que el modelo no?
Pista de método, no de contenido: la respuesta floja compara exactitud. La respuesta que vale compara escala, consistencia, trazabilidad y qué pasa con lo que no está en la tabla — es decir, usa la sección 8.
Respuesta correcta y cómo se resuelve
Respuesta en una frase: el modelo aporta escala, consistencia, trazabilidad y un error medido; el tasador aporta lo que no está en la tabla y criterio en los casos que el modelo nunca vio. No compiten en exactitud: cubren errores distintos.
Pasos: (1) escribe Y = f(X) + ε para el
modelo; (2) pregunta qué sabe cada uno de X y de ε; (3)
compara en escala, consistencia, trazabilidad y casos nuevos, no solo en
exactitud.
Respuesta modelo: «El modelo tasa las 7.244 propiedades de 2017 en segundos, da siempre el mismo precio para la misma ficha, y su error está medido fuera de muestra: MAE de 188.218 AUD y R² de 0,757 sobre ventas de un año que no vio. Además se puede auditar qué variables usó. El tasador, en cambio, ve lo que para el modelo es ε: el estado de la cocina, la humedad, la vista, la urgencia del vendedor. Y tiene criterio donde el modelo es más débil: el 29,1 % de las propiedades de 2017 estaban en suburbios que no aparecían en el entrenamiento. Lo que no puedo afirmar es cuál de los dos acierta más, porque no tengo medido el error del tasador.»
Error típico: responder «el modelo es más exacto» o «el tasador es más exacto». Ninguna comparación de exactitud está medida en tu proyecto; afirmarla es rellenar un vacío con algo plausible.
Fuente: cifras de [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]; la comparación es [INFERENCIA]; los ejemplos de lo que no está en la tabla son [DATITO]. Es la pregunta diagnóstica del currículum: Datito te la va a hacer igual, y lo que evalúa es tu razonamiento, no que repitas esta respuesta.
10 · Procedimiento para el papel
El Certamen 1 abre con cuatro verdadero/falso con justificación. Ese formato tiene un método.
- Subraya el cuantificador. siempre, nunca, solo, todo, basta con, es suficiente. Una afirmación absoluta cae con un solo contraejemplo.
- Traduce a mecanismo. Reescribe la frase como «X ocurre porque Y». Si no puedes, la afirmación está vacía y probablemente es falsa.
- Busca el contraejemplo concreto. Uno, con nombre: un rodal, un camión, tu propio proyecto.
- Justifica nombrando el mecanismo, no repitiendo la afirmación en otras palabras. «Es falso porque no es interdisciplinario» no justifica nada; «es falso porque no hay experto de dominio que valide la pregunta» sí.
- Si el dato no está, dilo. Declarar un vacío puntúa; rellenar con algo plausible, no.
- Ancla en el marco del curso. La escala de cinco etapas, la rueda de siete, las tres V más la veracidad, el mapa metodológico. Si usas vocabulario de fuera (data-informed, CRISP-DM, «traductor»), decláralo como externo.
11 · Errores que el formato castiga
- Definir Big Data por tamaño. Es una relación con la infraestructura, no un umbral de terabytes.
- Llamar interdisciplinario a un equipo polivalente. Varias herramientas ≠ varias disciplinas.
- Decir que una organización es data-driven porque usa muchos datos. Lo que define es quién tiene la última palabra.
- Confundir la etapa 4 con la 5. «Usa datos en todos sus procesos» es Conocedora de datos; Basada en datos es data-first.
- Presentar data-informed como escala del curso. No aparece en las láminas ni en las transcripciones.
- Mezclar el 90 % con los 80 %. Uno es causa de retrocesos; los otros, tiempo invertido.
- Confundir dominios con fuentes en la definición de ciencia de datos.
- Describir el ciclo como una cascada. Las flechas hacia atrás son el modo normal, no la excepción; y el destino más frecuente es la limpieza.
- Omitir la puesta en marcha al enumerar las etapas.
- Confundir ciencia de datos con la etapa de modelamiento. El modelo es una etapa, y no siempre hace falta.
- Tratar
εcomo algo que se limpia. Es lo que no está enX: no se limpia, se acepta o se mide con nuevas features. - Justificar un V/F repitiendo el enunciado. Hay que nombrar el mecanismo.
Cierre de la Clase 1 · ¿Qué problema resuelve la ciencia de datos?
Qué aprendiste
- La ciencia de datos extrae conocimiento accionable desde datos, combinando varias disciplinas.
- Tener datos no es ser data-driven: la escala de cinco etapas mide si los datos guían las decisiones.
- El ciclo es iterativo: cuando algo falla se vuelve a una etapa anterior.
- Big Data es una relación con la infraestructura disponible, no un número de terabytes.
Qué no debes confundir
- Usar muchos datos ≠ decidir a partir de los datos (C1 P2).
- Dominios distintos ≠ fuentes de datos distintas (C1 P1).
- Causa de los retrocesos (limpieza) ≠ tiempo invertido (recolección, limpieza, exploración).
Procedimiento para el papel
- ¿Cuál es el requerimiento o pregunta? Sin él no hay ciencia de datos.
- ¿Hay datos que la respondan? ¿Hace falta un modelo o basta un resumen?
- Ubica la organización en la escala: ¿los datos guían decisiones o solo tareas puntuales?
- Si algo falla en producción, identifica a qué etapa del ciclo volver.
Viene de: el inicio del curso · Sigue: Clase 2 · Datos, filas, columnas, features y target
Vuelve a tu activación: Una minera guarda cada día millones de registros de sus camiones. ¿Eso la convierte en una organización data-driven? Responde antes de leer. ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Falso. Registrar datos es una etapa temprana de la escala; data-driven exige que las decisiones se tomen a partir de los datos. [FUENTE · Repo: 07_DATITO/01_CONCEPTOS/visual/01_fundamentos.html §3]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.