Unidad 1 · Del problema a los datosClase 1 de 23
Clase 1 · ¿Qué problema resuelve la ciencia de datos?

Objetivo. Explicar qué problema resuelve la ciencia de datos, ubicar una organización en la escala data-driven y decidir cuándo no hace falta un modelo.

prerrequisitosninguna: es el punto de partida
habilitaClase 2 · Datos, filas, columnas, features y target
tiempo estimado~45 min
Ficha Bloom · Comprender
  • Evidencia de aprendizaje: Explica con sus palabras la definición (interdisciplinario, conocimiento, datos) y ubica tres organizaciones en la escala de cinco etapas.
  • Actividad final: Reconstruir la ruta de retroceso del ciclo que contó el profesor: de puesta en marcha a exploración.
  • Criterio de dominio: Ubica bien los tres casos y justifica con el criterio de la escala (¿los datos guían decisiones?), no con «usan muchos datos».
Activación. Una minera guarda cada día millones de registros de sus camiones. ¿Eso la convierte en una organización data-driven? Responde antes de leer. Escribe tu respuesta antes de seguir: la retomas en el cierre.

Fundamentos de Ciencia de Datos

Qué es esto, antes de que exista un modelo.
Fundamentos de Ciencia de Datos · UdeC · T2-2026

Fundamentos → Datos, features y target → EDA → …y 18 conceptos más
Dónde estás. Este concepto no tiene prerrequisitos: es la raíz del grafo. Los otros veinte cuelgan de él. No se estudia para puntuar una pregunta: se estudia porque define de qué están hablando todos los demás.

Aun así, también puntúa. En el Certamen 1 las preguntas 1 a 4, la 7 y la 8 salen de aquí: campo interdisciplinario, organización data-driven, rol del líder, ciclo de vida iterativo, reclutamiento y Big Data. Seis preguntas cerradas de 0,5 puntos cada una (3,0 en total). Auditoría pregunta por pregunta en certamen_1.html. [FUENTE · Repo: 01_DOCUMENTACION/06_CERTAMEN1/00_LEEME.md]
Quién dijo qué. La clase del 19-jun la abrió el profesor titular: IA, Uber, la definición de ciencia de datos y Big Data (0:28:57–0:57:14). Desde ~1:28 la dictó un segundo docente en su representación: organización data-driven, la escala de cinco etapas, la rueda del proceso, los 9 años colaborando, «meter las manos en el código». La parte de clase del 26-jun (desde ~1:46) también es del segundo docente. Aquí «el profesor» es siempre el titular. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:28:57–0:57:14] · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:28:56–1:30:19]

1 · La definición, palabra por palabra

El profesor titular dio esta definición en la clase del 19-jun y dijo de dónde la sacó: de Wikipedia [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:13–0:49:21]. Lo importante no es la definición completa, sino las tres palabras que él mismo marcó.

«la ciencia de datos es un campo académico interdisciplinario que utiliza estadística computación ⟨método⟩ científico procesamiento visualización científica algoritmos y sistemas para extraer o extrapolar conocimiento desde los datos que son potencialmente ruidoso estructurado no estructurado» Clase del 19-jun · 0:48:22–0:48:44 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md]
⟨⟩ = corrección de transcripción [INFERENCIA]

Y enseguida marcó sus tres palabras: «interdisciplinario conocimiento y datos» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:37]. Más tarde el segundo docente repitió una versión de Wikipedia al presentar la rueda y subrayó las mismas ideas [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:59:12–2:00:35].

PalabraQué obligaQué se dijo en clase
Interdisciplinario El científico de datos no puede resolver el problema solo. Necesita al experto del dominio para saber qué pregunta vale la pena. El segundo docente puso el ejemplo de minería: él sabe mucho de ciencia de datos pero no tanto de minería, así que necesita colaborar de forma constante con los expertos del área. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:59:54–2:00:03]
Conocimiento El producto no es el modelo, ni el gráfico, ni el dashboard. Es una decisión mejor tomada. Si nadie decide distinto, no hubo conocimiento. El segundo docente: se usan datos para extraer conocimiento útil para tomar decisiones. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:00:27–2:00:42]
Datos Y añade: potencialmente ruidosos. El ruido no es un accidente que se pueda limpiar del todo — es parte de la definición. Vuelve en la sección 8. Está en la cita de arriba, en boca del profesor titular: datos «potencialmente ruidoso», estructurados o no.
La trampa de la palabra «interdisciplinario». No significa «usa varias herramientas». Significa involucra personas de disciplinas distintas. Un solo ingeniero que sabe SQL, Python y estadística no es un equipo interdisciplinario: es un ingeniero polivalente. El profesor lo repitió al armar los grupos del proyecto: la ciencia de datos «es un área interdisciplinaria», así que necesita gente de distintas disciplinas. [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:14:48–1:14:54]
Distinción de certamen (C1 P1). «Datos de distintos dominios» ≠ «datos de distintas fuentes». Durante el Certamen 1, ante la duda de un compañero, el profesor aclaró que se hablaba de dominios del conocimiento —puso como ejemplos la zoología y la física cuántica—, no de fuentes de datos. [FUENTE · Repo: 05_CLASES/transcripciones/05Certamen_Fundamentos_en_Ciencia_de_Datos_24_Julio.md · 0:22:23–0:22:38] Ver certamen_1.html#p1.

2 · Lo que la ciencia de datos no es

La pregunta 1 del Certamen 1 es verdadero/falso sobre el campo interdisciplinario. Ese formato se resuelve separando vecinos, no recitando la definición.

VecinoQué haceQué le falta para ser ciencia de datos
Estadística Cuantifica incertidumbre y contrasta hipótesis sobre una muestra. No se hace cargo de recolectar, limpiar, poner en marcha ni comunicar.
Inteligencia artificial / ML Algoritmos que aprenden una función desde ejemplos. Es una etapa del proceso —el modelamiento—, no el proceso.
Ingeniería de datos Construye las tuberías: ingestión, almacenamiento, disponibilidad. Deja el dato disponible; no responde la pregunta de negocio.
Business Intelligence Reporta lo que pasó, en tableros y KPIs. Describe el pasado. No experimenta, no predice, no itera sobre hipótesis.
Big Data Nombra una condición de escala, velocidad y variedad. Es un adjetivo del problema, no una disciplina. Ver sección 5.

Autocomprobación · dos V/F al estilo del profesor [DATITO]

(a) «Un equipo formado por tres ingenieros civiles informáticos que dominan estadística, programación y visualización constituye un equipo interdisciplinario de ciencia de datos.» ¿V o F, y por qué?

(b) «Todo proyecto de ciencia de datos incluye una etapa de modelamiento con inteligencia artificial.» ¿V o F, y por qué?

Respuesta correcta y cómo se resuelve

Respuesta: las dos son falsas.

(a) Falso. Tienen varias herramientas, no varias disciplinas. Pasos: (1) subraya «interdisciplinario»; (2) cuenta disciplinas, no habilidades: los tres son de la misma, informática; (3) nombra lo que falta: quien conozca el dominio del problema —el geólogo, el médico, el forestal—, que es quien sabe si la pregunta tiene sentido y si el resultado es plausible. Sin experto de dominio nadie valida la pregunta, solo el cálculo.

(b) Falso. Pasos: (1) subraya el cuantificador «todo»; (2) busca un contraejemplo: un proyecto que termina en la exploración porque la respuesta ya está en un gráfico de barras, o porque los datos no permiten responder. El modelamiento es una etapa disponible, no obligatoria; el mapa metodológico tiene ramas enteras de análisis sin modelo predictivo (ver abajo).

Error típico: en (a), confundir «sabe muchas cosas» con «viene de varias disciplinas»; en (b), creer que ciencia de datos es sinónimo de modelo.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 5] (interdisciplina: computación, matemáticas, estadística y dominio) y [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · lámina 23] (mapa metodológico). La justificación paso a paso es [INFERENCIA].

Qué problema resuelve, y cuándo no hace falta ningún modelo

El problema que resuelve la ciencia de datos no es «tener datos» ni «tener un modelo»: es convertir datos en una decisión mejor tomada. El profesor titular lo cerró así, después de una discusión sobre por qué Uber vale lo que vale:

«en realidad no no solamente no solamente necesito datos para hacer crecer mi negocio sino que a la vez tengo que ser capaz de generar valor desde esos datos no me sirve dejarlo almacenado en un superservidor en alguna parte» Clase del 19-jun · 0:47:43–0:47:56 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md]

Y la lámina sobre cómo cambiar la cultura organizacional lo dice en forma de consejo: enfocarse en «qué problemas puedo solucionar con datos» en lugar de «qué datos necesito» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 8]. El Mapa Metodológico del curso empieza con la misma bifurcación: ¿Predecir o Análisis? Del lado del análisis quedan la segmentación, la agregación, la descripción y lo geoespacial; del lado de predecir sin datos queda el A/B test [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 23 y 25]. Es decir: hay ramas enteras del mapa donde no se entrena ningún modelo predictivo.

Procedimiento: ¿hace falta un modelo? [INFERENCIA, sobre la lámina 23 de FCD-03]

  1. Escribe la decisión y quién la toma. Si no hay decisión, no hay requerimiento: la rueda ni siquiera arranca.
  2. ¿Se pregunta por lo que ya pasó o por casos que aún no ves? Lo que ya pasó (un total, un promedio por grupo, un mapa) es Análisis: una agregación o un gráfico lo responde. Sin modelo.
  3. Si hay que predecir, ¿tienes datos con la respuesta? Si no los tienes, el mapa manda a un A/B test: primero se experimenta y se recolecta. Todavía sin modelo.
  4. Si tienes datos, ¿qué tipo de salida? Número → regresión; categoría → clasificación. Recién aquí hay modelo (ver triaje_de_problemas.html).
  5. Compara contra lo simple. Un modelo solo se justifica si le gana a un baseline (la mediana, una regla) en algo que cambie la decisión.

Ejercicio de aplicación y transferencia · ¿modelo, agregación o experimento?

Para cada pedido, di en qué rama del mapa cae y si hace falta un modelo predictivo. Los casos (c) a (e) son de otros dominios, a propósito [DATITO].

  1. Melbourne: «¿cuál fue el precio mediano de 2017 por tipo de vivienda: casa, departamento, townhouse?»
  2. Melbourne: «estimar el precio de las 7.244 propiedades vendidas en 2017 con lo aprendido de las 6.336 de 2016».
  3. Forestal: «¿cuántas hectáreas se cosecharon el año pasado en cada comuna?»
  4. Transporte: una empresa de buses quiere saber si un horario nuevo sube los pasajeros. Nunca lo ha probado.
  5. Minería: con cinco años de historial de mantenciones, «¿qué camiones fallarán la próxima semana?»
Respuesta correcta y cómo se resuelve

Respuesta: hace falta modelo solo en (b) —regresión— y en (e) —clasificación binaria—. (a) y (c) se resuelven con una agregación y (d) con un experimento A/B.

Pasos: aplica el procedimiento de arriba a cada pedido: ¿análisis o predicción? → si es predicción, ¿hay datos con la respuesta? → si los hay, ¿número o categoría?

(a) Análisis → agregación. Es un valor calculado sobre un grupo (tipo de vivienda). Un groupby lo responde. Sin modelo.

(b) Predecir → se tienen datos → numérico → regresión. Es lo que hizo tu proyecto: HistGradientBoosting sobre log1p(Price) [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]. Aquí sí hay modelo — y la pregunta de si le gana a un tasador humano queda para la sección 9.

(c) Análisis → agregación geográfica. Suma por comuna. Sin modelo.

(d) Predecir → no se tienen datos → A/B test. No hay historial del horario nuevo: primero se prueba en algunas líneas y se compara. Entrenar un modelo sin ese dato sería inventar la respuesta.

(e) Predecir → se tienen datos → categórico binario → clasificación binaria. Falla / no falla. Aquí sí hay modelo, y la clase positiva es rara: ver metricas_clasificacion.html.

Error típico: responder (a) o (c) con «entrenaría un modelo», o (d) con «entreno un modelo con los datos de pasajeros»: no hay datos del horario nuevo, así que el modelo no tiene de dónde aprender el efecto. Tres de los cinco pedidos se resuelven sin ningún modelo.

Fuente: ramas del [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 23 y 25]; clasificación de cada caso [INFERENCIA]; casos (c) a (e) [DATITO].

3 · Organización data-driven

El segundo docente abrió su parte de la clase del 19-jun con esto, antes que con cualquier técnica. Y su definición es más estrecha de lo que suena: son organizaciones «cuyo proceso, cuyo valor los generan a partir de los datos», y de las que ponía de ejemplo dijo que todo lo que deciden, en general, lo deciden a partir de los datos [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:31:31–1:33:01]. La lámina 7 de FCD-02 lo dice en su columna Data Driven: «Toman decisiones en función de los datos» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 7].

La distinción que decide la pregunta. «Usamos muchos datos» no es data-driven. Una minera que llena tableros de Power BI y después decide por antigüedad del jefe de turno usa datos; no es data-driven. Lo que define el término es quién tiene la última palabra, no cuántos datos entran.

Un compañero que trabaja en minería lo dijo en esa misma clase, cuando el segundo docente pidió ejemplos: en minería existe la idea de que las decisiones salen solo de la experiencia, y lo que él intenta es respaldar lo que se dice con datos en vez del «siempre se ha hecho así». [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:30:41–1:31:08]

El marco oficial: la escala de cinco etapas

Este es el marco que el curso usa para data-driven, y el que decide la pregunta 2 del Certamen 1. Está en la lámina 6 de FCD-02; el segundo docente la enseñó el 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:44:31–1:47:47] y la repasó el 26-jun [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:48:43–1:51:52].

#Etapa (lámina)Descriptor en la láminaEje
1Resistente a los datosSe resiste activamente a usar datos—
2Consciente de los datosCuriosa por los datosDATOS
3Guiada por los datosComienza a usar datos en producciónANÁLISIS
4Conocedora de datosUsa datos en todos sus procesosVISIÓN
5Basada en DatosEmpresa es data-firstESTRATEGIA

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 6]

«conocedora de los datos que ocupan estos datos en todos sus procesos pero que existen algunos procesos en los cuales todavía estos datos no se utilizan para las decisiones […] estas organizaciones ⟨basadas⟩ en datos […] las decisiones son guiadas a partir de los datos» Clase del 26-jun · 1:51:16–1:51:38 · segundo docente (clase del 26-jun) · [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md]
⟨⟩ = corrección de transcripción [INFERENCIA]
Distinción de certamen (C1 P2). Conocedora de datos (etapa 4: usa datos en todos sus procesos, pero aún hay decisiones que no se toman con ellos) ≠ Basada en datos (etapa 5: data-first, las decisiones se guían por los datos). «Usar datos en todos sus procesos» describe el peldaño 4, no el 5. Ver certamen_1.html#p2.

Ejercicio de interpretación y transferencia · V/F con justificación, formato C1 P2 [DATITO]

(a) «Una organización que almacena todos sus datos en un servidor centralizado ya es una organización basada en datos.»

(b) «Una empresa que tiene tableros en todas sus áreas y los usa a diario, pero cuyo gerente decide por intuición cuando el dato le incomoda, está en la etapa 5.»

(c) Transferencia, salud. «Un hospital que registra cada signo vital en fichas electrónicas, pero asigna camas por orden de llegada sin mirar esos registros, es data-driven.»

Respuesta correcta y cómo se resuelve

Respuesta: las tres son falsas. Pasos para cada una: (1) ubica a la organización en la escala de cinco etapas; (2) pregunta quién decide y con qué; (3) justifica con lo que le falta para subir.

(a) Falso. Almacenar no es generar valor. Es literalmente la frase del profesor titular citada en la sección 2: no sirve dejarlo almacenado en un servidor, hay que ser capaz de generar valor desde esos datos. En la escala, acumular sin saber cómo usarlo se parece a la etapa 2, la de la organización curiosa que tiene los datos «almacenados en alguna parte» pero no los hace llegar al resto [INFERENCIA] sobre [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:50:38–1:51:08].

(b) Falso. Usa datos en todos sus procesos (etapa 4, Conocedora), pero hay decisiones que no se toman con ellos. Le falta exactamente lo que define la 5.

(c) Falso. Registrar es tener datos, no decidir con ellos. La lámina 7 pone del lado No Data Driven a quien toma decisiones «en función de la intuición y experiencia» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 7].

Error típico: confundir tener o usar datos con decidir con ellos. Las tres organizaciones tienen datos; ninguna deja que los datos decidan. Es el mismo error que castiga la pregunta 2 del Certamen 1.

Fuente: [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 6 y 7]; ubicación de cada caso en la escala [INFERENCIA].

Fuera del temario: tres posturas, con vocabulario externo

[DATITO] Este comparador usa la palabra data-informed, que no es vocabulario del curso (ver la nota de abajo). Sirve como intuición para una idea que la escala sí contiene: cambia quién decide, no cuántos datos hay. Caso forestal: una empresa decide si adelanta la cosecha de un rodal de pino radiata con un modelo de crecimiento alimentado con inventarios, precios de madera y pronóstico de lluvia.

Honestidad de fuente. El enunciado de la pregunta 2 del Certamen 1 no menciona data-informed: dice «tener conocimiento de sus datos y usarlos en todos sus procesos». La palabra aparece en la justificación del compañero y en la etiqueta temática del expediente [FUENTE · Repo: 01_DOCUMENTACION/06_CERTAMEN1/00_LEEME.md]. Data-informed no aparece en ninguna de las 14 transcripciones disponibles al 2026-09-21 ni en las láminas FCD de 05_CLASES/11_PRESENTACIÓN/_markdown/ [INFERENCIA, por búsqueda de «informed» e «informad»].

Consecuencia práctica: justifica con la escala de cinco etapas —la del curso— y, si usas data-informed, decláralo como vocabulario externo. Separar lo que viene del curso de lo que traes de fuera es la conducta que premian las preguntas 10 y 11 del Certamen 2 (certamen_2.html#p11).

4 · Por qué ahora y no antes

Dato de la lámina 5 de FCD-02, citando a Cindi Howson: solo el 20 % de las empresas está empoderando a los trabajadores de primera línea con datos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · lámina 5]. El segundo docente aclaró que «primera línea» son los que interactúan a diario con el cliente [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:36:32–1:36:36]. La brecha no es tecnológica.

La explicación del segundo docente de por qué ahora sí se puede, en dos piezas: abundancia de datos (internet masivo) y modelos capaces de extraerles información [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:33:22–1:34:42]. Y de por qué las empresas antiguas no logran la transformación, en otras dos: lo operativo y lo humano [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:41:21–1:43:27]. Las startups tienen ventaja —dice la lámina 5— y según él la ventaja es que no tienen una forma establecida de hacer las cosas que desmontar [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:39:42–1:39:51].

5 · Big Data: las tres V, y la cuarta

Aquí está la distinción más cara del bloque, y el profesor titular la dijo con todas las letras en la clase del 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:49:52–0:57:14]. Primero recorrió volumen, velocidad y variedad con ejemplos (un megabyte en un pendrive frente a un petabyte; un lote frente a tiempo real; una tabla frente a Instagram) y las llamó «las tres ⟨V⟩» que se asocian a big data [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:54:24–0:54:32] —la transcripción dice «las tres de corta»; ⟨⟩ = corrección de transcripción [INFERENCIA]—. Después dio el criterio:

«cuando un proyecto es de big data es cuando la infraestructura que yo tengo actualmente no es lo suficientemente buena para resolver el problema […] seguramente pues lo voy a resolver […] ya no sería un problema de ⟨big data⟩» Clase del 19-jun · 0:54:40–0:55:27 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md]
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «data de quien»
Big Data no es una cantidad. Es una relación. No hay un umbral de terabytes que convierta un problema en big data. El mismo problema lo es para una empresa y no lo es para otra, y deja de serlo para la misma empresa cuando mejora su infraestructura. Big data es un diagnóstico sobre la distancia entre la exigencia del dato y lo que tu infraestructura aguanta.
Antes de mover nada, predice.

Una central meteorológica recibe cada noche 40 TB por lote y su clúster los procesa sin apuro. Mañana le exigen procesar los mismos 40 TB en tiempo real. El volumen no cambió. ¿Pasa a ser un problema de big data?

Respuesta correcta y cómo se resuelve

Respuesta: depende de la infraestructura; si el clúster que hoy procesa esos 40 TB por lote no alcanza a procesarlos en tiempo real, sí pasa a ser un problema de big data, aunque el volumen no haya cambiado.

Pasos: (1) identifica qué V cambió: no el volumen, la velocidad —de lote nocturno a tiempo real—; (2) aplica el criterio del profesor: es big data cuando la infraestructura que tienes no alcanza para resolver el problema; (3) concluye: con el clúster actual, pensado para lotes, lo más probable es que no alcance, y entonces sí lo es; si la organización invierte y lo resuelve, deja de serlo.

Error típico: responder «no, porque el volumen es el mismo». Eso trata big data como sinónimo de «muchos datos» y olvida que velocidad y variedad cuentan igual.

Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:54:40–0:55:27]; el caso de la central meteorológica es [DATITO].

Mueve las tres V y, después, mueve la capacidad. La línea negra vertical es lo que tu infraestructura aguanta hoy.

Volumen
Velocidad
Variedad

La regla del simulador —es big data si al menos una dimensión supera la capacidad— es un dispositivo didáctico [DATITO]. El criterio es del profesor; el umbral por dimensión lo puse yo para que puedas moverlo.

La cuarta V no se arregla con más servidores

«hay una cuarta ⟨V⟩ que se le llama la veracidad que es básicamente estar seguro de que el dato que se está generando ⟨es veraz⟩ […] imaginemos que el sensor falla el 10 por ciento las veces» Clase del 19-jun · 0:55:27–0:55:54 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md]
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «de corta» y «verás»

Volumen, velocidad y variedad son problemas de capacidad: se atacan con infraestructura. La veracidad es un problema de confianza: duplicar el clúster no la mejora en nada. Por eso está aparte en el simulador — y por eso desemboca en calidad de datos, que en el Certamen 1 vale 2,0 puntos en una sola pregunta.

Autocomprobación · selección múltiple, formato del profesor [DATITO]

¿Cuál de estas afirmaciones sobre Big Data es incorrecta?

  1. Un proyecto deja de ser big data cuando la organización mejora su infraestructura.
  2. Un conjunto de datos de 50 TB es, por su tamaño, un problema de big data.
  3. La variedad se refiere a que los datos llegan en formatos heterogéneos: texto, imagen, señales, tablas.
  4. La veracidad apunta a la confiabilidad del dato, por ejemplo cuando un sensor falla intermitentemente.
Respuesta correcta y cómo se resuelve

Respuesta: la incorrecta es la (b).

Pasos: (1) busca el absoluto escondido: «por su tamaño»; (2) contrástalo con el criterio del profesor: big data es una relación entre el dato y la infraestructura, no un umbral; (3) contraejemplo: 50 TB pueden ser rutina para una organización con el clúster adecuado y un colapso para otra.

Error típico: marcar la (a) por sonar raro. Es tratar una relación (dato frente a infraestructura) como una cantidad. La (c) y la (d) son correctas: variedad y veracidad tal como las explicó.

Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 0:52:55–0:56:02].

La (a) suena a trampa y no lo es: es el final de la cita de arriba —una vez resuelto con mejor infraestructura, «ya no sería un problema de ⟨big data⟩».

Esta es la pregunta 8 del Certamen 1: ver certamen_1.html#p8.

6 · La ruedita: el ciclo es iterativo, no lineal

El segundo docente la presentó en la clase del 19-jun como «la figura más importante de este de este trimestre en este curso» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:58:59–1:59:04], y el profesor titular la repasó al abrir las clases del 15-jul y del 7-ago [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:00:46–0:02:26] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 0:00:43–0:01:17].

Siete etapas, en sentido horario [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 16–22]:

Requerimiento / pregunta → Recolección → Limpieza → Exploración → Modelamiento → Visualización y comunicación → Puesta en marcha → y vuelta al requerimiento

El detalle de qué se hace y qué no se hace en cada etapa ya está en otro artefacto tuyo: triaje_de_problemas.html, sección 1. Aquí no repito la rueda — aquí trabajamos las flechas hacia atrás, que es lo que evalúa la pregunta 4.
La distinción del certamen: iterativo ≠ lineal. Un proceso en cascada avanza y no vuelve. El ciclo de ciencia de datos tiene flecha en los dos sentidos entre etapas vecinas, y retroceder no es señal de que algo salió mal: es el modo normal de operación.
«estas flechitas que están acá no están porque sea algo que podría pasar, es porque es habitual […] y la mayoría de las veces yo diría el 90% me voy a ⟨encontrar con⟩ que tiene que ver […] con la limpieza de los datos» Clase del 26-jun · 1:53:22–1:54:16 · segundo docente (clase del 26-jun) · [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md]
⟨⟩ = corrección de transcripción [INFERENCIA]: el ASR dice «me voy a contar»

Un retroceso real, contado por el profesor

El profesor titular abrió la clase del 15-jul con lo que le había pasado ese mismo día en su trabajo, con un modelo que clasifica lo que observan los telescopios:

«estaba en producción y de repente nos dimos cuenta que en producción tenía peor calidad que el modelo anterior […] fíjense que hoy día en un día pasamos de la puesta en marcha nos devolvimos hacia la exploración de nuevo» Clase del 15-jul · 0:03:53–0:05:26 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md]

Lo que omite el […] es la ruta completa, etapa por etapa: de la puesta en marcha volvieron a la visualización (revisar los gráficos que ya tenían), de ahí al modelamiento (los modelos eran casi iguales; cambiaban los datos de entrenamiento), de ahí a la exploración, y sospechan que el origen está en la recolección o en la limpieza —quizá borraron lo que no debían— [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:04:00–0:05:49]. Nada de eso fue un fracaso: es el ciclo funcionando.

Distinción de certamen (C1 P4). Poner un modelo en marcha ≠ terminar el proyecto. Desde producción se puede volver al modelado o incluso al requerimiento. Ver certamen_1.html#p4.

Ejercicio de producción · explícaselo a alguien. Sin mirar el párrafo de arriba, reconstruye por escrito la ruta hacia atrás del caso del profesor: en qué etapa se detectó el problema, a qué etapas volvieron y qué revisaron en cada una, y dónde creen que está el origen. Después explícale a un compañero que no vino a clase por qué ese viaje hacia atrás confirma que la respuesta de la pregunta 4 es «Verdadero». Llévalo a Datito para que lo revise.

Respuesta correcta y cómo se resuelve

Respuesta en una frase: el problema se detectó en la puesta en marcha y volvieron hacia atrás por visualización → modelamiento → exploración, con la sospecha puesta en la recolección o la limpieza.

Respuesta modelo (explicación a un compañero): «El profesor tenía un modelo en producción clasificando lo que ven los telescopios. Un día notaron que el modelo nuevo rendía peor que el anterior: eso se detectó en la puesta en marcha. Primero volvieron a la visualización y revisaron los gráficos que ya tenían para entender el modelo; vieron cosas raras. Entonces volvieron al modelamiento y compararon los modelos: eran casi iguales, y la diferencia era que se habían entrenado con datos distintos. Por eso volvieron a la exploración, a mirar esos datos otra vez. Lo que sabían era que el modelo nuevo rendía peor; lo que sospechaban era que algo se hizo mal al recolectar los datos, o que en la limpieza borraron cosas que no debían. Y todo eso pasó en un solo día. Por eso la pregunta 4 del Certamen 1 es verdadera: poner un modelo en marcha no da por terminado el proyecto; desde ahí se puede volver al modelado o más atrás.»

Criterios para revisar la tuya: etapas con los nombres de la rueda; el orden hacia atrás sin saltarse la visualización; qué se buscó en cada etapa, no solo su nombre; la separación entre lo que se sabía y lo que se sospechaba; la conexión con el enunciado.

Error típico: contar la historia como un fracaso («se equivocaron y tuvieron que rehacer»). Para el curso, volver atrás es el modo normal del ciclo, no un error del equipo.

Fuente: [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:03:27–0:05:58].

Tres cifras que se confunden: 90 %, 80 % y 80 %

CifraQué mideQuién y cuándo
90 % De las veces que retrocede porque el modelo no da lo esperado, cuántas el problema está en la limpieza. Segundo docente, clase del 26-jun [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 1:54:12]
80 % Del tiempo de un proyecto ya resuelto por otros, cuánto se va en recolección y limpieza. Segundo docente, clase del 19-jun [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:13:44–2:13:54]
80 % Del tiempo total, cuánto se va entre recolección, limpieza y exploración. Profesor titular, clase del 15-jul [FUENTE · Repo: 05_CLASES/transcripciones/03Clase_Recuperación_Fundamentos_en_Ciencia_de_Datos_15_julio.md · 0:06:18–0:06:30]
Causa de retrocesos ≠ tiempo invertido. El 90 % responde «cuando algo falla, ¿dónde está el error?». Los dos 80 % responden «¿en qué se me va el tiempo?». Una etapa puede comerse el tiempo sin ser la causa de los fallos, y al revés. Tampoco los dos 80 % son iguales: uno cuenta dos etapas y el otro tres. Si en una prueba escribes «el 90 % del tiempo se va en limpieza», mezclaste dos afirmaciones distintas de dos personas distintas.

⚠ Las tres son estimaciones dichas de palabra («yo diría», «aproximadamente»), no datos medidos, y no aparecen en las láminas FCD. Úsalas como órdenes de magnitud atribuidos, no como cifras duras [INFERENCIA].

¿A qué etapa vuelves?

Cinco síntomas. Para cada uno, elige la etapa a la que hay que retroceder. Se puede fallar sin costo: la idea es ver de qué depende la respuesta.

Respuesta correcta y cómo se resuelve

Respuesta: 1 → Limpieza · 2 → Requerimiento · 3 → Comunicación · 4 → Puesta en marcha (detecta) y de ahí recolección o requerimiento · 5 → Limpieza.

Pasos: para cada síntoma, pregunta dónde nació el problema, no dónde lo viste. (1) Landsize 0 y 40.000 m² son valores fuera de rango: nacieron al limpiar mal. (2) El dato al nivel de camión y turno no existe: la pregunta no es respondible tal como está, así que se refina el requerimiento. (3) El modelo funciona; lo que falla es traducirlo a la decisión de gerencia. (4) Nadie tocó el código y el modelo se degrada: lo detecta el monitoreo de la puesta en marcha, y la causa probable es que cambió el mundo, así que se vuelve a recolectar o a replantear. (5) Una columna con litros, IDs, texto y un −999 es sobrecarga semántica y un centinela: limpieza.

Error típico: elegir la etapa donde apareció el síntoma («modelamiento», porque ahí se vio el precio absurdo) en vez de la etapa donde nació. Retroceder no es fallar: es el ciclo.

Fuente: la rueda y sus flechas en [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_02_CienciaDeDatos.md · láminas 16–22] y [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:02:10–2:05:18]; los cinco casos son [DATITO].

Dónde está la puesta en marcha en tu propio proyecto

La pregunta 4 del Certamen 1 junta «ciclo iterativo» con «puesta en producción». No es casualidad: la puesta en marcha es la etapa que más gente omite al describir el ciclo, porque es la única que no produce un archivo bonito.

Tu proyecto de Melbourne llega hasta la comunicación, no hasta la puesta en marcha. Entregaste métricas, gráficos y un informe. Nadie está tasando casas con tu modelo en producción. Eso no es un defecto del trabajo —el curso pide hasta ahí— pero sí es la respuesta honesta si te preguntan en qué etapa del ciclo quedó. [INFERENCIA, sobre 09_RESULTADOS/06_ENTREGABLES/INFORME_MODELO_FCD_P3.md]

7 · El equipo: líder, reclutamiento, y por qué importa

Dos preguntas del Certamen 1 —la 3 y la 7— van sobre personas, no sobre técnica. Se contestan desde la palabra interdisciplinario.

El marco de clase son las habilidades en forma de letra —T, Π y Γ: cuántas habilidades tienes y qué tan profundo en cada una—, en las láminas 7 a 12 de FCD-03 y explicado por el segundo docente el 26-jun [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_03_CienciaDeDatosEnLaPráctica.md · láminas 7–12] [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:10:29–2:12:45]. Su conclusión para proyectos complejos: como casi nadie reúne todo, se buscan personas con alto conocimiento en cada una de las áreas que el proyecto necesita, que además puedan comunicarse con el resto en el mismo lenguaje [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:16:18–2:17:16]. Esa frase pesa directamente sobre la pregunta 3: ver certamen_1.html#p3.

RolQué aportaQué NO le corresponde
Líder del proyecto Coordinar a todo el equipo. Según el segundo docente, alguien con alto conocimiento en su área y conocimiento moderado en todas las demás, para saber qué hace cada uno y ser «el puente entre todo» [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:18:23–2:18:59]. Ser el mejor modelador del equipo. Si su valor es escribir el modelo, el equipo no tiene líder, tiene un modelador más.
Experto de dominio Saber si la pregunta vale la pena, si el dato es plausible y si el resultado es físicamente posible. Escribir el código. Puede no programar nada y ser imprescindible.
Científico de datos Recolectar, limpiar, explorar, modelar, evaluar. Según el segundo docente, en casi todo el ciclo —salvo el requerimiento y quizá la puesta en marcha— «debe meter las manos en el código» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:06:11–2:06:34]. Decidir solo qué se hace con el hallazgo.
Ingeniero de datos / plataforma Que el dato exista, llegue a tiempo y se pueda reproducir. Responder la pregunta de negocio.
Sobre reclutar (pregunta 7). El segundo docente lo enmarcó así: «necesitamos gente que tenga buenas preguntas que queramos responder a partir de los datos y que sean capaces de generar valor» [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 2:01:40–2:01:45]. El criterio dominante no es el catálogo de algoritmos: es formular la pregunta correcta y comunicar el resultado. Él mismo contó que en unos 9 años como científico de datos nunca ha abordado un problema sin trabajar con especialistas de otra área —astronomía, medicina, ciencia forestal, minería— [FUENTE · Repo: 05_CLASES/transcripciones/01Clase_Bienvenida_Fundamentos_en_Ciencia_de_Datos_19_Junio.md · 1:52:48–1:53:12]. Las láminas 20 y 21 de FCD-03 tienen las sugerencias de reclutamiento: ver certamen_1.html#p7.

8 · La ecuación: Y = f(X) + ε

La definición dijo «datos potencialmente ruidosos». Esto es esa frase, escrita. Antes de la notación, la versión con palabras que dio el segundo docente —y fíjate en el ejemplo que eligió:

«un modelo es una función matemática que me ayuda a llegar de datos a una respuesta que yo quiero entonces por ejemplo la respuesta que yo quiero es cuál es el precio de una casa dada las características de la casa» Clase del 26-jun · 2:51:44–2:52:00 · segundo docente (clase del 26-jun) · [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md]

La «función» es f; los «datos» son X; la «respuesta que yo quiero» es Y. Lo que la frase no dice —y la ecuación sí— es que la respuesta real nunca es exactamente la función: siempre queda un resto, ε. Esa descomposición es el marco estándar del área, no una lámina del curso [DATITO].

Y  =  f(X)  +  ε
SímboloQué esQuién lo poneEn Melbourne
YEl target: lo que quieres saber. lo decide la persona Price, el precio de venta.
XLas features: lo que sí tienes anotado. viene del dato y lo decide la persona al elegir cuáles usar 9 numéricas + 3 categóricas. Suburb, Date y otras seis quedaron fuera.
fLa relación verdadera entre X e Y. Existe, y nunca la vas a ver. — Cómo el mercado de Melbourne fija un precio.
f̂ (efe gorro)Tu aproximación a f. Eso es «el modelo». lo aprende el modelo HistGradientBoosting sobre log1p(Price).
εTodo lo que mueve a Y y no está en X. Error irreducible. — El estado de la cocina, la urgencia del vendedor, quién más fue a ese remate ese sábado.

Qué problema resuelve. Separa dos cosas que un alumno mezcla todo el tiempo: el error que cometes por tener mal el modelo (reducible: mejor algoritmo, mejores features, más datos) y el error que cometes porque el mundo no está en la tabla (irreducible: no hay algoritmo que lo baje).

Predice antes de tocar el deslizador.

Vas a subir ε, el ruido. El modelo perfecto —el que acertara f exactamente— ¿qué error tendría?

Respuesta correcta y cómo se resuelve

Respuesta: el error del modelo perfecto sube con el ruido: es exactamente el tamaño de ε.

Pasos: (1) el modelo perfecto predice f(X); (2) lo observado es Y = f(X) + ε; (3) su error es Y − f(X) = ε; (4) si ε crece, su error crece, aunque el modelo no cometa ningún error propio. Con números de juguete: si f(X) = 900 mil y la casa se vendió en 950 mil, el modelo perfecto se equivoca en 50 mil, y esos 50 mil son todo ruido [DATITO, cifras ilustrativas].

Error típico: responder «cero, porque es perfecto». Perfecto respecto de f, no respecto de Y.

Fuente: la descomposición Y = f(X) + ε es el marco estándar del área, no una lámina del curso [DATITO]; la idea de modelo como función en [FUENTE · Repo: 05_CLASES/transcripciones/02Clase_y_Ayudantía_Fundamentos_en_Ciencia_de_Datos_26_Junio.md · 2:51:44–2:52:00].

—
MAE del modelo perfecto
—
MAE de un modelo razonable
—
Parte reducible

Miles de AUD. La curva negra es f; los puntos son f(X)+ε; la curva azul punteada es f̂, un modelo bueno pero no exacto.
Fíjate en la tercera cifra: con ε bajo, casi todo tu error es culpa tuya y se puede arreglar; con ε alto, la parte reducible se encoge y mejorar el modelo deja de pagar. [DATITO] — datos simulados con la escala de Melbourne, no sus filas reales.

El camino inverso: te dan la ecuación, reconstruye el fenómeno

En una prueba escrita te la van a entregar ya escrita. Desármala al revés.

Te dan: Y = f(X) + ε, y te dicen que un modelo alcanza MAE 188.218 AUD sobre una mediana de 910.000.

Ejercicio de cálculo e interpretación: ¿qué se puede afirmar, y qué no, solo con eso? Calcula a mano qué fracción de la mediana es el error típico.

Respuesta correcta y cómo se resuelve

Respuesta: se puede afirmar que el error típico es un 20,7 % de la mediana y que tiene una parte reducible y otra irreducible; no se puede afirmar cuánto vale cada parte.

Se puede afirmar: el error típico equivale a un 20,7 % de la mediana (188.218 / 910.000). Y que ese error tiene dos partes sumadas: lo que se podría mejorar cambiando el modelo o las features, y lo que no se puede bajar porque depende de cosas que no están en X.

No se puede afirmar: cuánto vale cada parte. ε no es observable — si lo fuera, lo meterías en X y dejaría de ser ε. Nadie puede decirte «de esos 188.218, tantos son irreducibles».

Lo que sí da una cota útil: comparar contra un baseline. El baseline de mediana de tu propio proyecto da MAE 431.649. Tu modelo baja a 188.218 — recortó 243.431 AUD de error reducible. Que quede más por recortar, y cuánto, no lo sabes. [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]

Cálculo a mano: 188.218 / 910.000 = 0,2068… ≈ 20,7 %. 431.649 − 188.218 = 243.431.

Error típico: decir «el 20,7 % es ruido» o «el modelo podría bajar a cero». Ninguna de las dos cosas se sabe: ε no se observa.

Fuente: cifras de [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]; la lectura con ε es [INFERENCIA].

Conexión con lo que ya trabajaste. La brecha train/test de tu modelo final es 0,17 de R² (0,927 en 2016 contra 0,757 en 2017). Esa brecha no es ε: es error reducible mal repartido —el modelo ajustó detalles de 2016 que no se repiten en 2017. Confundir una cosa con la otra es el atajo por el que se cuela la palabra «sobreajuste» como etiqueta de cualquier empeoramiento.

9 · La pregunta que te va a hacer Datito

Respóndela por escrito antes de abrir la respuesta de abajo.

Tu modelo predice el precio de una casa en Melbourne. Un tasador humano también lo hace.

¿Qué aporta el modelo que el tasador no, y qué aporta el tasador que el modelo no?

Pista de método, no de contenido: la respuesta floja compara exactitud. La respuesta que vale compara escala, consistencia, trazabilidad y qué pasa con lo que no está en la tabla — es decir, usa la sección 8.
Respuesta correcta y cómo se resuelve

Respuesta en una frase: el modelo aporta escala, consistencia, trazabilidad y un error medido; el tasador aporta lo que no está en la tabla y criterio en los casos que el modelo nunca vio. No compiten en exactitud: cubren errores distintos.

Pasos: (1) escribe Y = f(X) + ε para el modelo; (2) pregunta qué sabe cada uno de X y de ε; (3) compara en escala, consistencia, trazabilidad y casos nuevos, no solo en exactitud.

Respuesta modelo: «El modelo tasa las 7.244 propiedades de 2017 en segundos, da siempre el mismo precio para la misma ficha, y su error está medido fuera de muestra: MAE de 188.218 AUD y R² de 0,757 sobre ventas de un año que no vio. Además se puede auditar qué variables usó. El tasador, en cambio, ve lo que para el modelo es ε: el estado de la cocina, la humedad, la vista, la urgencia del vendedor. Y tiene criterio donde el modelo es más débil: el 29,1 % de las propiedades de 2017 estaban en suburbios que no aparecían en el entrenamiento. Lo que no puedo afirmar es cuál de los dos acierta más, porque no tengo medido el error del tasador.»

Error típico: responder «el modelo es más exacto» o «el tasador es más exacto». Ninguna comparación de exactitud está medida en tu proyecto; afirmarla es rellenar un vacío con algo plausible.

Fuente: cifras de [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]; la comparación es [INFERENCIA]; los ejemplos de lo que no está en la tabla son [DATITO]. Es la pregunta diagnóstica del currículum: Datito te la va a hacer igual, y lo que evalúa es tu razonamiento, no que repitas esta respuesta.

10 · Procedimiento para el papel

El Certamen 1 abre con cuatro verdadero/falso con justificación. Ese formato tiene un método.

  1. Subraya el cuantificador. siempre, nunca, solo, todo, basta con, es suficiente. Una afirmación absoluta cae con un solo contraejemplo.
  2. Traduce a mecanismo. Reescribe la frase como «X ocurre porque Y». Si no puedes, la afirmación está vacía y probablemente es falsa.
  3. Busca el contraejemplo concreto. Uno, con nombre: un rodal, un camión, tu propio proyecto.
  4. Justifica nombrando el mecanismo, no repitiendo la afirmación en otras palabras. «Es falso porque no es interdisciplinario» no justifica nada; «es falso porque no hay experto de dominio que valide la pregunta» sí.
  5. Si el dato no está, dilo. Declarar un vacío puntúa; rellenar con algo plausible, no.
  6. Ancla en el marco del curso. La escala de cinco etapas, la rueda de siete, las tres V más la veracidad, el mapa metodológico. Si usas vocabulario de fuera (data-informed, CRISP-DM, «traductor»), decláralo como externo.
Para seguir. Qué tipo de problema tienes delante y en qué etapa estás: triaje_de_problemas.html. El siguiente concepto del grafo, qué es una fila, una feature y un target: datos_features_target.html. Las preguntas 1 a 8 del Certamen 1 auditadas: certamen_1.html.

11 · Errores que el formato castiga

Cierre de la Clase 1 · ¿Qué problema resuelve la ciencia de datos?

Qué aprendiste

  • La ciencia de datos extrae conocimiento accionable desde datos, combinando varias disciplinas.
  • Tener datos no es ser data-driven: la escala de cinco etapas mide si los datos guían las decisiones.
  • El ciclo es iterativo: cuando algo falla se vuelve a una etapa anterior.
  • Big Data es una relación con la infraestructura disponible, no un número de terabytes.

Qué no debes confundir

  • Usar muchos datos ≠ decidir a partir de los datos (C1 P2).
  • Dominios distintos ≠ fuentes de datos distintas (C1 P1).
  • Causa de los retrocesos (limpieza) ≠ tiempo invertido (recolección, limpieza, exploración).

Procedimiento para el papel

  1. ¿Cuál es el requerimiento o pregunta? Sin él no hay ciencia de datos.
  2. ¿Hay datos que la respondan? ¿Hace falta un modelo o basta un resumen?
  3. Ubica la organización en la escala: ¿los datos guían decisiones o solo tareas puntuales?
  4. Si algo falla en producción, identifica a qué etapa del ciclo volver.

Viene de: el inicio del curso · Sigue: Clase 2 · Datos, filas, columnas, features y target

Vuelve a tu activación: Una minera guarda cada día millones de registros de sus camiones. ¿Eso la convierte en una organización data-driven? Responde antes de leer. ¿Cambiarías tu respuesta?

Pregunta final. Verdadero o falso: una empresa que registra todo en bases de datos ya es data-driven. Justifica.
Respuesta correcta y cómo se resuelve

Falso. Registrar datos es una etapa temprana de la escala; data-driven exige que las decisiones se tomen a partir de los datos. [FUENTE · Repo: 07_DATITO/01_CONCEPTOS/visual/01_fundamentos.html §3]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 2 · Datos, filas, columnas, features y target