Unidad 1 · Del problema a los datosClase 3 de 23
Clase 3 · EDA: conocer los datos antes de modelar

Objetivo. Leer la distribución de una variable y detectar faltantes, atípicos y dificultades del problema antes de modelar.

Ficha Bloom · Analizar
  • Evidencia de aprendizaje: Interpreta un resumen (media, mediana, desviación, percentiles) y dice qué revela y qué no revela sobre la forma y la calidad.
  • Actividad final: Camino inverso: reconstruir la forma de una distribución a partir de cinco números, sin gráfico.
  • Criterio de dominio: Distingue media de mediana ante asimetría y detecta un cero o centinela sospechoso con un argumento de calidad, no de estética.
Activación. En la clase de EDA, el histograma de consumo de camiones tenía muchísimos ceros. ¿Son camiones inactivos o reportes que faltan? ¿Cómo lo decidirías? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Análisis exploratorio de datos

Mirar los datos antes de modelarlos. Qué te dicen los resúmenes, y sobre todo qué te esconden.

Datos, features y target → EDA → Limpieza y preparación

Primero tienes que saber qué es una fila y qué es una columna (datos, features y target). Después de esto viene decidir qué haces con lo que encontraste (limpieza y preparación). El EDA no arregla nada: encuentra. [FUENTE · Repo: 07_DATITO/curriculum.yaml, campo prerrequisitos]

1 · Para qué sirve, según tu profesor

Abrió la clase sin gráficos. Si mides personas y la altura media es 1,8 metros, ¿qué te dice eso? El curso respondió que serían adultos; con una media de 0,9 metros, que podrían ser niños. Y ahí se detuvo:

«Yo digo el primer dataset corresponde a un dataset de alturas de adultos. Eso es una hipótesis. Yo no lo sé porque no sé qué midió esto ni si son adultos o no. Pero es una hipótesis.» Clase del 17-jul · 0:10:24–0:10:39 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]
Medido ≠ supuesto. «La media es 1,8 m» es una medición: sale de los datos. «Son adultos» es una hipótesis: la pusiste tú. El EDA produce las dos cosas y tu trabajo es no mezclarlas. Es la distinción que el Certamen 2 cobró en su última ficha (P11: medido / supuesto / no disponible). [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md, §1]

Su ejemplo durante toda la clase es una máquina con sensores de voltaje, presión, rotación y vibración, más las fechas de mantención y de falla [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 5]. La vibración va más o menos entre 30 y 60, y el histograma tiene una cola hacia la derecha: pocos valores altos, poco probables, que igual ocurren. Esa cola es justo lo que le interesa: son los momentos de las fallas [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:18:41–0:20:43].

Predice antes de abrir: en el gráfico de vibración del profesor, cada falla coincide con un alza de vibración. ¿Basta entonces con vigilar la vibración para anticipar las fallas sin falsas alarmas? Responde sí o no, y por qué.
Respuesta correcta y cómo se resuelve

Respuesta correcta: no. Que toda falla venga con alza de vibración no implica que toda alza venga con falla. Vigilando solo la vibración detectarías las fallas, pero también darías alarmas en alzas que no terminan en nada.

Separó dos afirmaciones que suenan iguales y no lo son:

«siempre que hay una falla hay una alza en vibraciones pero no siempre que hay una alza en vibraciones es la máquina falla […] la vibración me ayuda a detectar las fallas pero no es suficiente necesito algo más» Clase del 17-jul · 0:16:09–0:16:36 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]

Falla → alza: en estos datos la vibración alta acompaña a toda falla. Alza → falla: no siempre. La vibración es una buena feature, pero no suficiente: sola daría falsas alarmas, y hay que buscar otras variables (él mismo aceptó la fecha de mantención como candidata [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:17:44–0:17:56]). Esas falsas alarmas son los falsos positivos que vas a medir en métricas de clasificación [INFERENCIA]. Y la forma del razonamiento es pariente de la ficha P6 del Certamen 2, causa ≠ condición habilitante (certamen_2.html#p6).

Error típico: leer la flecha al revés. «Falla → alza» es una condición necesaria (sin alza no hubo falla); para anticipar sin falsas alarmas harías falta «alza → falla», que es suficiente, y los datos del profesor muestran alzas sin falla. Contestar «sí, porque siempre coinciden» es justo confundir las dos. [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:16:09–0:16:36]; los nombres «necesaria / suficiente» son [DATITO].

En la lámina 21 el profesor resume para qué sirve visualizar, y lo contó con el ejemplo de los camiones que verás en la sección 3:

Para quéQué significa
Identificar patronesPatrones ocultos y tendencias que no se ven en las estadísticas
Formular hipótesis«hay muchos ceros → hay muchos camiones inactivos» (sección 3)
Decidir el siguiente pasoDe análisis o de modelamiento
ComunicarPresentar, proveer evidencia… e influenciar y persuadir. Ojo con esto último (sección 10)

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 21] [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:45–0:46:29]

La frase que ordena la unidad completa: el EDA existe porque los números resumen y al resumir borran. Todo lo que viene ahora es aprender qué se borró.

2 · El resumen no determina la forma

Tu profesor puso cuatro conjuntos de datos en pantalla. Cada uno tiene dos variables, x e y, y once filas. Y los cuatro tienen exactamente el mismo resumen:

9,00
media de x
7,50
media de y
3,32
desv. est. de x
2,03
desv. est. de y
0,816
correlación
y = 3 + 0,5x
recta ajustada

Estos seis números no cambian al apretar los botones de abajo. Medias y desviaciones: las que el profesor leyó en clase [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:42:14–0:42:44]. Correlación y recta: valores canónicos del cuarteto de Anscombe, que en clase no se leyeron en voz alta [INFERENCIA]. Láminas 18 y 19.

Antes de apretar nada, decide: si los cuatro conjuntos tienen la misma media, la misma desviación estándar, la misma correlación y la misma recta ajustada… ¿los cuatro gráficos se van a parecer entre sí? Contesta sí o no en voz alta. Después mira.

Respuesta correcta y cómo se resuelve

Respuesta correcta: no. Los cuatro gráficos no se parecen en nada, aunque compartan media, desviación estándar, correlación y recta ajustada. El resumen no fija la forma.

Si dijiste que sí, acabas de descubrir el motivo por el que existe esta unidad. Los cuatro conjuntos son radicalmente distintos:

La conclusión del profesor frente a los cuatro gráficos: media, mediana, desviación estándar y percentiles ayudan, pero no bastan para darte el contexto real de lo que estás midiendo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:43:15–0:43:25].

Error típico: razonar «mismos números → mismos datos». Seis números no pueden guardar once pares de puntos: al resumir se pierde información, y muchas nubes distintas caben en el mismo resumen. Por eso, en una prueba, «¿se parecen?» se contesta con «no se puede saber sin graficar», nunca con «sí» [INFERENCIA].

Lo que esto te habilita a decir: un resumen estadístico es una proyección de los datos, y muchas nubes de puntos distintas proyectan lo mismo. Por eso se grafica: no por estética, sino porque el resumen es matemáticamente incapaz de distinguirlas.

3 · Lo que el EDA destapa: ceros que quizá no son ceros

Justo después de Anscombe, el profesor planteó esto. Las cifras están escritas en la lámina, así que no dependen de la transcripción:

«Si yo les digo que el consumo medio de gasolina de los camiones de la compañía es 1440 litros, pero los camiones que Ud. administra gastan sobre 2500 litros, qué me sugiere?» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 20]
Antes de tocar los botones: eres el administrador. Tu jefe te pone delante el 1.440 y tus 2.500. ¿Qué gráfico le pedirías antes de aceptar que tus camiones gastan de más? Y si en ese gráfico aparecen muchos ceros, ¿qué dos cosas distintas podrían significar?
Respuesta correcta y cómo se resuelve

Respuesta: pides la distribución del consumo camión por camión (un histograma), no solo el promedio. Si aparecen muchos ceros, pueden ser (1) camiones inactivos, un cero real, o (2) consumos que nadie reportó, un faltante disfrazado de cero. Con la planilla sola no se decide cuál.

Cómo se resuelve, con los 25 camiones ilustrativos del panel [DATITO]:

  1. 15 camiones trabajando suman 36.000 L → su media es 36.000 / 15 = 2.400 L.
  2. Si los 10 ceros son consumo real: 36.000 / 25 = 1.440 L, la cifra de la lámina. Tus 2.500 quedan 2.500 / 1.440 − 1 ≈ 74 % arriba.
  3. Si los 10 ceros son reportes que faltan, salen del cálculo: la media es 2.400 L y tus 2.500 quedan solo 2.500 / 2.400 − 1 ≈ 4 % arriba.
  4. Misma planilla, dos conclusiones opuestas. Lo que decide no es la estadística: es ir a ver quién anotó los datos y dónde estaban los camiones, que fue el siguiente paso que propuso el profesor [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:45:28–0:45:38].

Error típico: aceptar 1.440 L como «lo que gasta un camión» y concluir que tus camiones gastan 74 % de más. La media de 1.440 no describe a ninguno: cae en el hueco entre los parados y los que trabajan. El otro error es elegir una de las dos lecturas sin decir que es un supuesto.

Origen: 1.440 y 2.500 L, [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 20]; las dos lecturas de los ceros, [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:12–0:45:23]; el reparto 15 + 10 es ilustrativo [DATITO].

media mediana tus camiones: 2.500 L

25 camiones, cifras ilustrativas construidas para reproducir la media de 1.440 L de la lámina 20: 10 camiones en 0 y 15 entre 2.100 y 2.700 L. [DATITO]

Lo que pasó en clase: con la distribución a la vista, el problema es la barra del cero.

«hay un valor anómalo muy grande acá entonces hay muchos ceros ¿qué es lo que puede significar esto? muchos camiones inactivos […] si no hay ningún camión inactivo […] a lo mejor la gente no está reportando el consumo de gasolina» Clase del 17-jul · 0:44:12–0:45:23 · profesor; «muchos camiones inactivos» lo responde el curso · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]
Cómo leer «un valor anómalo muy grande». La figura no está en el texto de la lámina, pero por lo que sigue («entonces hay muchos ceros») lo anómalo parece ser la barra del cero: demasiados camiones en 0, no un camión que gasta muchísimo [INFERENCIA].

Fíjate en la estructura del razonamiento, porque es el EDA completo en miniatura:

  1. Distribución. La media de 1.440 no describe a ningún camión: casi todos están en 0 o cerca de 2.400. Cae en el hueco entre los parados y los que trabajan.
  2. Calidad. Un cero puede ser una medición real (camión inactivo) o un faltante disfrazado de cero (nadie anotó el consumo). En la tabla se ven idénticos.
  3. Hipótesis. El curso propuso «camiones inactivos»; el profesor puso al lado la alternativa: no se está reportando.
  4. Siguiente paso. Ninguna de las dos se decide con estadística. Él propuso ir a ver quién anotó los datos y dónde estaban los camiones [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:45:28–0:45:38].
El precedente en tu Certamen 1. La pregunta 9B es este mismo registro de camiones, con un 0 (conductor enfermo: medición real, se queda), un −999 (en mantenimiento: faltante escrito como número) y un 2900 frente a 200 (atípico, no necesariamente error). Si los tratas igual, te equivocas en al menos uno. Qué hacer con cada uno ya es limpieza y preparación; al EDA le toca encontrarlos y decir qué supone de cada uno. [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html, ficha 9B]

4 · Centralidad: dónde está el medio

EstadísticoCómo se calculaCuándo lo usas
Media (promedio)Sumas todo y divides por n Distribución simétrica y sin valores extremos
MedianaOrdenas y tomas el del medio (o el promedio de los dos del medio) Hay cola o valores anómalos. Es el percentil 50
ModaEl valor que aparece más seguido Variable categórica: única opción disponible

La razón por la que la moda existe

La lámina 11 lo dice en una línea: para variables categóricas ni la media ni la mediana tienen sentido; se usa la moda, el valor que aparece más seguido [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 11]. En clase lo explicó por el orden: una categórica no se puede ordenar, así que no hay histograma por rangos, solo frecuencias [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:25:29–0:25:43]. Su ejemplo para que se entendiera: nadie puede decir que el ornitorrinco viene antes que el conejo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:27:48–0:28:00].

En la máquina: ¿qué componente falló? Componente 1, 2, 3 o 4. No hay orden —la 3 no es «más» que la 2—, así que no hay histograma, no hay media, no hay desviación estándar. Solo frecuencias, y la moda fue la componente 2.

Esta es la distinción que arrastra todo lo demás: variable numérica → tiene orden → histograma, media, desviación. Variable categórica → no tiene orden → frecuencias, moda, gráfico de barras. Si te ves promediando los códigos de una categórica de varios niveles (región 1, 2, 3), algo se rompió antes. Hay una excepción útil, las binarias 0/1: la ves en las secciones 9 y 13.
El corolario: barras frente a líneas. El profesor mostró los mismos datos en barras y en líneas (hombre/mujer; 10 y 12 años) y preguntó cuál era mejor. Un compañero respondió que en las edades sí se puede interpolar y en las categorías no; el profesor lo confirmó y lo ilustró: puedes imaginar a alguien de 11 años entre los de 10 y 12, pero entre hombre y mujer no hay algo al medio. Categórica → barras. Numérica ordenada → línea. [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:06:14–1:07:41]

5 · Extensión: qué tan representativo es ese medio

Saber dónde está el centro no basta. Dos distribuciones con la misma mediana pueden ser una compacta y la otra desparramada, y en ese caso la mediana significa cosas distintas en cada una.

MedidaFórmulaQué aportaQué le falta
Rangomáx − mínEl ancho total, en un númeroLo fija un solo dato en cada extremo
Varianzas²Desviación media al cuadradoUnidades al cuadrado: no se puede interpretar
Desviación estándars = √s²En las unidades de la variableNo dice hacia qué lado
PercentilesP5, P25, P50…Sí dicen el ladoHay que calcular varios

La varianza, desarmada

s² = 1 n − 1 · ∑i=1n (xi − x̄)² varianza muestral
PiezaQué es
xiDato. El valor de la observación i. Lo mediste
x̄Se calcula desde los datos. La media. No la eliges
nDato. Cuántas observaciones tienes
(xi − x̄)La distancia de cada dato al centro. Es lo que queremos promediar
El cuadradoDos razones, abajo
n − 1Corrección de sesgo, abajo
Qué decides túQué variable medir, y si al final reportas s o percentiles

¿Por qué el cuadrado, y no el valor absoluto?

El profesor dio dos razones y la segunda es la que se olvida [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:31:20–0:32:26] (la lámina 13 la resume: al cuadrado, la varianza queda más sensible a outliers):

  1. Para que sea positivo. Si sumaras las distancias con signo, las de arriba cancelarían las de abajo y siempre te daría cero. El cuadrado es «como una excusa» —palabras suyas— para volverlas positivas. El valor absoluto también serviría para esto.
  2. Para hacerla más sensible a los valores anómalos, a propósito. Una distancia grande al cuadrado crece mucho más rápido que la misma distancia sin elevar. Un dato lejano pesa desproporcionadamente, y eso es deliberado: se quiere que un valor extremo grite.

¿Por qué n − 1 y no n?

«si tú divides por n entonces este estimador que es la varianza se sesga […] cuando tengo datos infinito converge a la varianza real pero si yo no le pongo el menos uno entonces se sesga» Clase del 17-jul · 0:32:54–0:35:21 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]

La idea: no tienes acceso a la varianza real de la población, solo a una muestra. La fórmula es un estimador. Con n − 1, al crecer la muestra converge al valor real; con n, converge a un valor equivocado aunque tuvieras datos infinitos. Con n grande la diferencia es despreciable; con n chico es enorme.

¿Por qué la raíz?

Unidades. Si mides vibración en mm/s, la varianza queda en mm²/s², que no significa nada físico. La raíz devuelve la cantidad a mm/s, y recién ahí puedes decir «la mayoría de las máquinas están a ±6 mm/s del promedio» [DATITO: unidades y cifra ilustrativas]. El profesor la llamó un truco para recuperar las unidades de la variable (láminas 13 y 14) [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:35:46–0:36:39].

Ejemplo numérico chico — hazlo a mano antes de abrir

Vibración de cinco máquinas: 38, 40, 41, 42, 44.

  1. Media: (38+40+41+42+44) / 5 = 205 / 5 = 41
  2. Desviaciones: −3, −1, 0, +1, +3  →  suman 0 (siempre suman 0, por eso el cuadrado)
  3. Cuadrados: 9, 1, 0, 1, 9  →  suma = 20
  4. Varianza: 20 / (5 − 1) = 5  [mm²/s²]
  5. Desviación estándar: √5 = 2,24  [mm/s]

Ahora cambia el 44 por un 74 —una máquina a punto de fallar—:

Un solo dato multiplicó la desviación estándar por casi 7. Fíjate en el 729: ese único término aporta el 79 % de la suma. Eso es la sensibilidad a los anómalos de la que habla el profesor, y aquí se ve el número exacto.

6 · La desviación estándar no tiene lado. Los percentiles sí

Este es el hallazgo central de la clase, y es lo que hace que los percentiles no sean un adorno.

«la ⟨desviación⟩ estándar no te dice hacia que lado esta va la ⟨asimetría⟩ de la distribución o sea no me dice tengo una cola más larga hacia la derecha o hacia la izquierda» ⟨⟩ = corrección de transcripción [INFERENCIA] Clase del 17-jul · 0:38:01–0:38:11 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]

Lo que sí se puede hacer, siguió, es calcular los percentiles. Y dio el método concreto para leerlos: compara la distancia de media − s a P5 con la distancia de media + s a P95. Si una es mucho mayor que la otra, por ese lado está la cola [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:39:44–0:40:45].

Predice antes de mover el control: vas a estirar la cola de la distribución de vibración hacia la derecha. Luego vas a apretar «reflejar», que da vuelta la distribución como un espejo: la cola queda a la izquierda. ¿El valor de s va a cambiar al reflejar? Piénsalo antes.
simétrica
media mediana media ± s P5 y P95
—
media
—
mediana
—
desv. estándar
—
P5
—
P95

Las dos distancias del profesor

(media−s) a P5—
(media+s) a P95—

240 mediciones de vibración, centradas en 41. Muestra fija: los números son reproducibles. Cifras ilustrativas [DATITO · construido sobre el ejemplo de vibración de la Clase del 17-jul]

La respuesta a la predicción

s no cambia al reflejar. Ni un decimal. Reflejar es restar cada dato de un valor fijo, y eso conserva todas las distancias al centro —que es lo único que mide la varianza—. La media y la mediana sí se reflejan, y P5 y P95 se intercambian.

Entonces tienes dos distribuciones que son distintas —una con la cola a la derecha, otra a la izquierda— y que comparten exactamente el mismo s. Ese número, solo, no puede distinguirlas. Las distancias a P5 y P95 sí: se dan vuelta.

Regla para llevarte: la desviación estándar mide cuánto. Los percentiles miden cuánto y hacia dónde.

El boxplot: los percentiles hechos dibujo

El profesor lo presentó así (lámina 41): la línea del medio es la mediana; la caja va del percentil 25 al 75; los valores que quedan fuera del bigote se dibujan como puntos sueltos, y esos son los valores anómalos. Del bigote dijo que «es 1,5 por el rango intercuartil» [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:14:48–1:15:11]. El rango intercuartil (RIC) es P75 − P25: el ancho de la caja.

Detalle que no cambia el criterio: 1,5 × RIC es el largo máximo del bigote. En matplotlib y seaborn el bigote se detiene en el último dato que cae dentro de ese límite, así que puede verse más corto [INFERENCIA].
Calcula en papel: vibración de nueve turnos, cifras ilustrativas [DATITO]: 36, 38, 39, 40, 41, 42, 43, 45, 70. Obtén mediana, P25, P75, RIC, los dos límites de 1,5 × RIC, y decide qué dato se dibuja suelto. Después contesta: ¿lo borrarías?
Solución paso a paso
  1. Ya están ordenados; n = 9. Mediana = el 5.º dato = 41.
  2. P25 y P75 con el método por defecto de pandas y numpy (posición (n − 1)·p, contando desde 0): P25 cae en la posición 2 → el 3.er dato = 39; P75 cae en la posición 6 → el 7.º dato = 43.
  3. RIC = 43 − 39 = 4. 1,5 × RIC = 6.
  4. Límites: 39 − 6 = 33 y 43 + 6 = 49.
  5. El 70 supera 49 → se dibuja suelto: es atípico. El bigote de arriba llega hasta 45; el de abajo, hasta 36.
  6. Media = 394 / 9 = 43,8, mayor que la mediana 41 → cola a la derecha, igual que en el control de arriba.

¿Lo borrarías? No por ser atípico. En este problema los valores altos de vibración son justamente los momentos de falla: borrar el 70 es borrar lo que quieres predecir. Atípico describe una posición en la distribución; error es un juicio que hay que verificar. Es el mismo criterio del 2900 de la 9B. (Otros textos calculan los cuartiles con otra regla y dan números algo distintos; el procedimiento no cambia.)

Verdadero o falso, con justificación (uno de los tres formatos que anunció para el Certamen 1 [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:28:11–1:28:15]): «Si en el EDA los boxplots de una variable para tumores benignos y malignos no se traslapan, ya quedó demostrado que esa variable separa las dos clases.»
Respuesta, y lo que dijo el profesor sobre esto

Falso. Un boxplot describe la muestra que tienes. Con pocos datos, dos cajas separadas pueden salir por azar, y el dibujo no te dice cuántos datos hay detrás de cada caja. El profesor lo advirtió comentando la presentación de un grupo de compañeros que había usado un test t para comparar tumores benignos y malignos:

«fíjense que también tiene relación el estadístico T con el número de datos Entonces tú puedes tener unos boxplot hermosos como estos acá con tres datos y eso no te asegura significancia estadística» Clase del 14-ago · 1:20:37–1:20:49 · profesor, comentando una presentación de compañeros · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md]

Antes les había preguntado si revisaron la normalidad que el test supone, y aclaró que esa herramienta no se enseña en el curso [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md · 1:19:27–1:21:04]. Para el certamen, lo que te llevas es el criterio: el EDA propone una hipótesis; no la demuestra. Que el hablante es el profesor titular se infiere porque un compañero se dirige a él como «Profesor» en 1:20:01 y porque él habla de lo que «no la enseñamos» en el curso [INFERENCIA].

7 · Camino inverso: te dan cinco números, sin gráfico

En una prueba escrita no vas a tener el histograma. Vas a tener una tabla. Estos son los números reales de tu propio proyecto: los precios de las 7.244 propiedades de Melbourne vendidas en 2017, el conjunto de prueba con el que evaluaste tus seis modelos.

EstadísticoValor (AUD)
n7.244
Media1.078.072
Mediana910.000
Desviación estándar629.743
Mínimo131.000
P5420.000
P952.260.000
Máximo9.000.000

[FUENTE · Repo: calculado sobre 09_RESULTADOS/predicciones_2017.csv, columna Price. La mediana de 910.000 coincide con meta.precio_mediana_2017 de resultados_temporal.json]

Antes de seguir leyendo, escribe en una hoja qué forma tiene esta distribución y por qué. Tienes todo lo necesario. No mires el gráfico de más abajo todavía.
Cómo se reconstruye la forma desde esos números
  1. Media contra mediana. 1.078.072 > 910.000. La media está arriba de la mediana → hay cola hacia la derecha. Primera señal, y ya alcanza para sospechar.
  2. Distancia izquierda. media − s = 1.078.072 − 629.743 = 448.329. P5 = 420.000. Diferencia: 28.329.
  3. Distancia derecha. media + s = 1.707.815. P95 = 2.260.000. Diferencia: 552.185.
  4. Compara. 552.185 frente a 28.329: el lado derecho tiene 19 veces más recorrido sobrante. Cola derecha confirmada, y fuerte.
  5. Los extremos. mediana − mín = 779.000. máx − mediana = 8.090.000. Diez veces más.
  6. Traduce a una frase del problema. «Hay muchas casas baratas y unas pocas mansiones que estiran el promedio.»

La consecuencia que duele: el 61,5 % de las propiedades de 2017 se vendió por menos que el «precio promedio» de 1.078.072. Si un cliente te pregunta «¿cuánto cuesta una casa en Melbourne?» y le dices el promedio, le das un número que seis de cada diez casas no alcanzan. La mediana de 910.000 es la respuesta honesta.

Y ahora sí, el gráfico

Esto no es una curiosidad: es la decisión de modelado que tomaste. Tu modelo final, HistGradientBoosting, no se entrenó sobre Price sino sobre log1p(Price). El motivo está en los números de arriba: en escala logarítmica la media (13,754) y la mediana (13,721) casi coinciden, y el 52,5 % de los datos queda bajo la media en vez del 61,5 %. La asimetría desaparece. Una decisión de EDA se convirtió en una decisión de modelo. Eso es lo que el EDA produce: no gráficos bonitos, decisiones.
Pero el log no es gratis, y tu propio repositorio lo demuestra. Ridge sobre log1p(Price) dio R² = −17,0: al deshacer la transformación con expm1, los errores sobre los valores extremos se disparan exponencialmente. La misma transformación que ayuda a un modelo de árboles destruye a uno lineal. [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md y 09_RESULTADOS/resultados_temporal.json]

8 · Lo que el EDA dice (y no dice) de la dificultad del problema

Hasta aquí el EDA describía columnas. En un proyecto también tiene que responder una pregunta más incómoda: ¿qué tan difícil va a ser esto? Tu proyecto entrena con 2016 y predice 2017. Estos son hallazgos reales del EDA de ese corte:

Hallazgo2016 (train)2017 (test)
Filas6.3367.244
Mediana de Price (AUD)900.000910.000
Filas de suburbios que no existen en el train—29,1 %
Nulos en CouncilArea0 %18,9 %
Categorías de CouncilArea que solo aparecen en 2017—14, una se llama Unavailable

[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json, bloque meta] [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md, experimento CouncilArea, y 09_RESULTADOS/experimento_councilarea_2026-09-18.json, bloque fase4_faltantes]

Ejercicio de interpretación. Para cada una de las tres últimas filas escribe (a) qué te dice sobre la dificultad de predecir 2017 con un modelo entrenado en 2016, y (b) qué no te dice. Después ordénalas de la que más te preocupa a la que menos, con una razón por línea. No abras los criterios hasta tener las tres respuestas escritas.
Criterios para corregirte (no es una respuesta modelo)

Llévale tus tres respuestas a Datito: es la pregunta diagnóstica de este concepto, y se corrige en conversación.

Respuesta correcta y cómo se resuelve

En una frase: las medianas casi no dicen nada de la dificultad; el 29,1 % dice que casi un tercio del test cae en barrios que el modelo nunca vio; y CouncilArea dice que una columna cambió de comportamiento entre 2016 y 2017. Preocupan en ese orden: 29,1 %, CouncilArea, medianas.

Fila(a) Qué te dice(b) Qué no te dice
Medianas 900.000 → 910.000 El precio típico casi no se movió (+1,1 %). No hay un salto de nivel de un año a otro que el modelo deba adivinar. Si cambió la mezcla de propiedades (tipos, barrios), las colas, o la relación entre las columnas y el precio. Es el resumen de una sola columna: la lección de Anscombe (sección 2).
29,1 % de filas de suburbios nuevos Un problema de cobertura: 7.244 × 0,291 ≈ 2.109 casas de 2017 están en barrios sin ningún ejemplo en el train. Un modelo que dependiera del nombre del barrio no tendría nada que usar en ellas. Cuánto sube el error. Eso hay que medirlo, y tu repositorio lo midió: el modelo final no usa Suburb (usa latitud, longitud, distancia, región), y su MAE en barrios nuevos es 193.462 AUD contra 186.064 en barrios conocidos, un 4 % más. Hipótesis antes de medir; dato después.
CouncilArea: 0 % → 18,9 % de nulos, 14 categorías nuevas El faltante no es igual en train y en test: un modelo entrenado en 2016 nunca vio un nulo ni esas 14 comunas. Entre nulos y categorías nuevas, el 28,5 % de las filas de 2017 no aporta nada por esa columna. Y Unavailable es un faltante disfrazado de categoría, como el cero de los camiones. Si CouncilArea importa para el precio. Puede ser redundante con la región y las coordenadas. El experimento del repositorio midió que agregarla mejoraba apenas 599 AUD (0,38 %) en 2016, y se dejó fuera.

Orden, con una razón por línea:

  1. 29,1 % — afecta a unas 2.109 filas y no se puede eliminar: es una propiedad del futuro, no de una columna. Solo se compensa con otras columnas de ubicación.
  2. CouncilArea — afecta a cerca del 28,5 % de las filas, pero se resuelve sacando la columna, a un costo medido de 0,38 %.
  3. Medianas — no afectan a ninguna fila en particular; describen el centro y nada más.

Error típico: concluir «el problema es fácil porque las medianas son casi iguales» (un resumen no determina la forma), o afirmar «el 29,1 % va a subir mucho el error» como si fuera un resultado. Es una hipótesis hasta que se mide, y aquí la medición dio un 4 %. Otro orden también puede aprobar si la razón dice cuántas filas afecta y si otra columna lo compensa.

Origen: filas, medianas, 29,1 %, columnas excluidas y MAE por suburbio nuevo y conocido del modelo «HistGradientBoosting | log»: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]. Nulos, categorías nuevas, 28,5 % y experimento A/B: [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md, experimento CouncilArea] y [FUENTE · Repo: 09_RESULTADOS/experimento_councilarea_2026-09-18.json]. El orden y sus razones: [DATITO].

9 · Dos variables a la vez

Hasta aquí, una variable por vez. El paso siguiente es preguntar si dos se mueven juntas. La herramienta es el scatter plot, y el número es la correlación.

Su ejemplo: altura en el eje X, peso en el eje Y. De inmediato sale una hipótesis —a más altura, más peso— y de la hipótesis sale un modelo: estimar el peso a partir de la altura [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:03:00–1:03:28].

Ahí está el puente completo: graficas → ves una relación → formulas una hipótesis → propones un modelo. El EDA es lo que te dice qué features vale la pena probar.

Tus propias correlaciones

Correlación de Pearson de cada variable numérica con Price, sobre las 13.580 filas de Melbourne:

Variabler con PriceLectura
Rooms0,497La más alta de todas, y aun así explica poco sola
YearBuilt−0,262Negativa: las más antiguas tienden a ser más caras
Lattitude−0,213Geografía pura: más al sur, más caro
Longtitude0,204Ídem, en el otro eje
Distance−0,163Más lejos del centro, más barato
BuildingArea0,070Sospechosamente baja. Ver la nota
Landsize0,038El tamaño del terreno casi no predice el precio

[FUENTE · Repo: 09_RESULTADOS/correlacion_dashai.json, n = 13.580]

Por qué BuildingArea da 0,070 y no hay que creerle. Esa columna tenía muchos nulos, y se rellenaron todos con un mismo valor constante (130,60 m²). Cientos de filas con un valor idéntico e inventado aplastan cualquier correlación hacia cero. El 0,070 describe el dataset después de imputar, no el mundo. Moraleja de EDA: un coeficiente bajo puede venir del fenómeno o puede venir de lo que le hiciste al dato. Antes de descartar una variable por su correlación, mira cuántos nulos tenía. [FUENTE · Repo: el propio correlacion_dashai.json declara rellenos_nulos: BuildingArea = 130,5965]

La matriz de correlación, leída como la leyó el profesor

Con el dataset del Titanic (sobrevivió o no, clase, sexo, edad, familiares a bordo, precio del pasaje), el profesor leyó la fila de supervivencia. Sexo aparece con −0,54 ⚠ (dicho en clase como «menos 54»; coincide con el valor conocido de ese dataset [INFERENCIA]). Para interpretarlo necesitó la codificación: «sé que cero es mujer y uno es hombre». Correlación negativa → a más «1», menos supervivencia → sobrevivieron más mujeres. El precio del pasaje, en cambio, correlaciona positivo: pasaje más caro, más probable sobrevivir [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:10:57–1:12:29]. (El Titanic vuelve en el práctico P5; aquí solo está lo que el profesor leyó en clase, no resultados del práctico.)

Dos avisos de lectura. (1) Una categórica binaria codificada 0/1 sí admite correlación, siempre que sepas qué es el 0 y qué es el 1: si inviertes el código, se invierte el signo [INFERENCIA]. (2) En 1:13:50 la transcripción dice «la matrita confusión», pero por contexto sigue hablando de la matriz de correlación —la recomienda para elegir variables en regresión—, no de la matriz de confusión, que es de clasificación [INFERENCIA] [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:13:50–1:14:12].

Correlación ≠ causalidad

El profesor partió con un ejemplo burdo a propósito: cuando sube la temperatura se venden más helados, y nadie concluiría que comprar helado sube la temperatura; pero en los noticieros se hace exactamente eso con correlaciones menos obvias [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:55:50–0:56:45].

La segunda historia la aportó un compañero, y es real. Un colega suyo recibió un análisis que no le convencía. Para desarmarlo, se conectó a la base de recursos humanos, sacó el dígito verificador del RUT de todos los trabajadores y lo correlacionó con la variable de interés. El dígito verificador correlacionaba más que el análisis del otro ingeniero, y la conclusión irónica fue contratar más gente con esos dígitos verificadores [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:56:47–0:57:44].

Las tres cosas que te deja ese intercambio:
  1. Una correlación alta no es evidencia de nada por sí sola. Necesitas un mecanismo que explique por qué una cosa movería a la otra. Esto lo planteó el mismo compañero al introducir su historia [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:56:50–0:56:58].
  2. Con muchos datos, algo va a correlacionar por puro azar, y hay que tener cuidado [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:57:46–0:57:56].
  3. Existen los confusores: variables que no mediste y que mueven a otras dos a la vez. Ves que suben juntas y no ves la causa real [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:58:26–0:58:46].
Y el caso extremo ya lo viste arriba: el conjunto 4 de Anscombe tiene correlación 0,816 producida por un solo punto. Diez observaciones idénticas más una lejos. Si reportas ese 0,816 sin haber graficado, estás reportando un artefacto.

Varias variables y una clase: el EDA que pide el proyecto

Al llegar a los ejemplos finales se detuvo: «este es el tipo de cosas que yo espero que ustedes hagan en su análisis exploratorio» [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:16:01–1:16:09]. El ejemplo: análisis químico de vinos de una misma región de Italia, de tres cultivadores, con 13 medidas por vino (lámina 44). Su secuencia fue esta [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:17:33–1:23:34]:

  1. Contar las clases. Hay más vinos del cultivador 1 que del 2 y del 0, y eso importa porque los modelos tienden a ajustarse a la clase más representada. Es el desbalance que después castigan las métricas de clasificación.
  2. Resumen por variable. Media, desviación, mínimo, P25, P50, P75 y máximo de las 13. Alcohol: media cercana a 13 y desviación 0,8, con la mediana parecida a la media → simétrica. Intensidad de color: media 5,05 y mediana 4,69 → corrida hacia valores bajos. (Cifras dichas en clase ⚠.)
  3. Histograma por clase. Con el alcohol, el curso vio que el cultivador 1 hace vinos de menor graduación, pero que el alcohol no separa al 0 del 2; el profesor lo confirmó.
  4. Dos variables juntas. Con ácido málico y alcohol planteó que ya se podía clasificar la procedencia del vino, y lo llamó una hipótesis de clasificación [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:22:25–1:22:46]. En el gráfico 2D los tres grupos casi se separan: no será perfecto, pero se puede clasificar.
Fíjate en qué entrega el EDA al final: no un gráfico bonito, sino una hipótesis comprobable que el modelo va a poner a prueba. Antes de clasificar, ya sabes qué variables deberían servir y por qué. Y, como viste con los boxplots de la sección 6, la hipótesis todavía no está demostrada.

10 · Integridad visual

El profesor dedicó un bloque a gráficos que engañan (láminas 23 a 27). Su criterio de referencia es el de Tufte: transmitir el mayor número de ideas, en el menor tiempo, con la menor cantidad de tinta, en el menor espacio (lámina 22). Aclaró que hoy, sin imprenta, la tinta y el espacio importan menos que las ideas por unidad de tiempo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:46:33–0:47:20].

Ejemplo en claseEl truco
Millas por galón: 18 en 1978, 27 en 1985La figura del 85 se dibuja como diez veces más grande, aunque el valor no llega al doble
«Yo corro mucho más rápido que ustedes»Eje entre 8,09 y 8,1: una diferencia mínima parece enorme
Cortes de impuestos: 35 % frente a 39,6 %Se presenta como desastre una diferencia que «no es tanta» (probablemente un eje que no parte en cero; la figura no está en el texto de la lámina [INFERENCIA])
Vacunación en Chile, cadena nacionalEscala logarítmica: una caída fuerte parece una bajita. Abajo, en detalle

[FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:47:23–0:53:26]

El caso chileno: una escala logarítmica en cadena nacional

Durante la pandemia se presentó en cadena nacional un gráfico del avance de la vacunación en Chile. Mirando solo la línea, la tasa parecía haber bajado apenas un poco [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:51:31–0:52:09]. El profesor preguntó en qué escala estaba el eje, y la respuesta que quedó fue: logarítmica [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:52:12–0:52:24]. En esa escala la distancia en el eje no es proporcional a la cantidad —cada tramo igual multiplica—, así que una caída grande se ve chica [INFERENCIA sobre la figura]. Él lo volvió a graficar en escala lineal:

«entre este y este hay un décimo de la distancia entre este y este […] una baja en la tasa de vacunación de más o menos un 50% o sea estaba como en 1.5 y llegó como a 1.8 ⚠ casi un 50%» Clase del 17-jul · 0:52:32–0:53:02 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]
⚠ Las cifras no cuadran tal como quedaron transcritas. De 1,5 a 1,8 es una subida del 20 %, no una baja de casi 50 %. Lo firme es lo que repitió dos veces: una baja de más o menos la mitad, entre marzo y abril. Lo más probable es un error de transcripción en uno de los números (con 0,8 en vez de 1,8 la baja sería de 47 %) [INFERENCIA]. La figura está en las láminas de «Distorsión de escalas» (26 y 27), cuyo texto no se extrajo: si necesitas la cifra exacta, abre el PDF.
Su cierre: el gráfico lo presentó el gobierno de Chile para influir en la población, pero transmitía un mensaje incorrecto [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:53:05–0:53:26]. Y la advertencia que había dejado en la lámina 21: la visualización sirve para persuadir, y alguien va a intentar persuadirte a ti con un gráfico; hay que ser crítico, dijo, sin que eso sea algo negativo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:46:15–0:46:29]. Antes de mirar la forma, mira el eje: si parte de cero, si la escala es lineal o logarítmica, si los tamaños son proporcionales a los valores.

Sin gráfico también se engaña: el denominador

Al final del bloque, un compañero aportó un caso que había visto en redes sociales: una sola frase, sin gráfico, sobre accidentes laborales y días de la semana.

Predice y calcula: la publicación decía que un 25 % de los accidentes de trabajo se reportan un viernes o un lunes, e insinuaba que la gente usa el accidente para alargar el fin de semana. Antes de abrir: si los accidentes se repartieran parejo entre los 7 días, ¿qué porcentaje caería en viernes o lunes? ¿El 25 % queda por encima o por debajo de eso?
El cálculo, y lo que concluyó el compañero
  1. Con reparto uniforme, cada día aporta 1/7 ≈ 14,3 %.
  2. Viernes + lunes = 2/7 ≈ 28,6 %.
  3. 25 % < 28,6 % → el dato queda por debajo de lo esperado. Si sugiere algo, es lo contrario de lo que insinuaba la publicación.
«un 25% de los accidentes de trabajo se reportan un viernes o lunes […] ⟨supongamos⟩ que es como una distribución uniforme que no es así, pero ⟨supongamos⟩ realmente debería ser un 30% […] si uno lo pensaba un poco decía todo lo contrario» ⟨⟩ = corrección de transcripción [INFERENCIA] Clase del 17-jul · 0:53:54–0:54:38 · un compañero · [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md]

Su «30 %» es el 28,6 % redondeado, y también dijo que cada día aporta cerca de un 15 % (14,3 %). El profesor lo tomó como un problema comunicacional que aparece de muchas formas [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:54:42–0:54:48].

El supuesto que conviene declarar: el propio compañero advirtió que el reparto real no es uniforme. Si en ese rubro solo se trabaja de lunes a viernes, la referencia sería 2/5 = 40 % y el 25 % quedaría todavía más abajo [DATITO]. Cambias el denominador y cambia la conclusión; por eso hay que escribirlo. Es el mismo problema que vas a encontrar en las métricas de clasificación: un porcentaje sin su denominador no dice nada.

11 · La distinción de certamen

Pregunta 4 del Certamen 2. «¿Cuál(es) de las siguientes son utilizadas para evaluar un modelo de clasificación?» Alternativas: área bajo la curva ROC, varianza, ganancia de pureza, tasa de falsos positivos y exactitud. Correctas: AUC, tasa de falsos positivos y exactitud. La distinción de esta unidad es la que descarta la varianza: una cantidad que describe un clasificador ≠ una cantidad que describe una variable. AUC, tasa de falsos positivos y exactitud solo existen si hay un clasificador y clases verdaderas contra las que comparar. La varianza existe con o sin clases: es un estadístico descriptivo de una columna. (La ganancia de pureza cae por otra razón: sirve para construir un árbol, no para evaluarlo.) Enunciado y análisis completos en certamen_2.html#p4. [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md, ficha P4]

Las otras distinciones de esta unidad, en el formato en que el profesor las pregunta:

No confundasConLo que decide
MediaMedianaLa media se arrastra hacia la cola; la mediana no. Con asimetría, reporta mediana
VarianzaDesviación estándarLas unidades. La varianza está al cuadrado y no se interpreta
Desviación estándarPercentiless dice cuánto; los percentiles dicen cuánto y hacia dónde
Variable numéricaVariable categóricaOrden. Sin orden no hay histograma ni media: solo frecuencias y moda
Gráfico de barrasGráfico de líneasSi puedes interpolar entre dos valores del eje X, línea. Si no, barras
CorrelaciónCausalidadEl mecanismo. Sin mecanismo, r alto no es evidencia
Resumen estadísticoForma de la distribuciónAnscombe: cuatro formas distintas, un solo resumen
Un estadístico descriptivoUna métrica de evaluaciónQué objeto describe: una variable o un modelo (P4)
MediciónHipótesis (supuesto)¿Sale de los datos o la pusiste tú? «Media 1,8 m» es medido; «son adultos» es hipótesis (P11)
Condición necesariaCondición suficienteFalla → alza de vibración no implica alza → falla. La feature ayuda, pero no basta
Cero medidoFaltante disfrazado (0, −999, Unavailable)¿Qué significaría ese valor si fuera real? Si no puedes contestarlo, es sospechoso (9B)
AtípicoErrorAtípico es una posición (fuera de 1,5 × RIC); error es un juicio que se verifica. El 2900 de la 9B y la vibración de 70 son atípicos, no errores probados
Separación en un boxplotSignificancia estadísticaEl número de datos. Un boxplot bonito con tres datos no asegura nada

12 · Procedimiento para el papel

Te dan una tabla de números o una figura y te piden describirla. Esto es lo que haces, en orden:

  1. Clasifica cada columna: ¿numérica o categórica? Esto decide todas las herramientas que puedes usar después.
  2. Busca los faltantes, también los disfrazados: nulos, pero además ceros en exceso, códigos como −999, categorías como Unavailable y valores idénticos repetidos (el 130,60 de BuildingArea). Para cada uno pregúntate qué significaría si fuera real.
  3. Para las categóricas: frecuencias y moda. Nada más. Si hay una categoría que se lleva casi todo, dilo: es desbalance.
  4. Para las numéricas, el centro: media y mediana. Las dos, siempre. La comparación entre ambas es gratis y es tu primer diagnóstico.
  5. Decide la asimetría: media > mediana → cola derecha. media < mediana → cola izquierda. media ≈ mediana → simétrica.
  6. La extensión: rango y desviación estándar. Pregúntate si s es grande comparado con la media: s = 629.743 sobre una media de 1.078.072 es más de la mitad. Eso es una distribución muy ancha.
  7. Confirma con percentiles: compara (media − s) contra P5 y (media + s) contra P95. La diferencia mayor marca el lado de la cola.
  8. Mira los extremos: ¿el máximo está a una distancia razonable del P95, o está diez veces más lejos? Si te dan cuartiles, calcula los límites P25 − 1,5 × RIC y P75 + 1,5 × RIC. Lo que quede fuera es candidato a atípico: se marca y se verifica, no se borra por reflejo.
  9. Escribe la conclusión en palabras del problema, no en jerga. No «la distribución presenta asimetría positiva» sino «hay muchas casas baratas y unas pocas mansiones que estiran el promedio».
  10. Nombra la consecuencia práctica: qué estadístico reportarías, qué variable transformarías, qué hipótesis probarías después. El EDA termina en una decisión.
  11. Etiqueta cada frase: medido o supuesto. «10 de 25 camiones marcan 0» es medido; «están inactivos» es hipótesis, y se escribe como tal.

13 · Errores que el formato castiga

14 · Transferencia: otro rubro, el mismo EDA

Riego en el Maule (cifras ilustrativas [DATITO]). Una cooperativa agrícola registra el agua de riego por predio y por semana durante una temporada: 400 registros. Resumen: media 1.180 m³, mediana 1.560 m³, P5 = 0, P95 = 2.300 m³, máximo 9.800 m³. El 31 % de los registros es exactamente 0.
(a) ¿Hacia dónde tira la media y por qué? (b) Da dos lecturas del 31 % de ceros y el dato que irías a buscar para distinguirlas. (c) ¿El 9.800 es un error? (d) ¿Qué número le darías al gerente como «consumo típico de una semana de riego», y qué supuesto declaras?
Solución
  1. (a) Media 1.180 < mediana 1.560: la media queda abajo. Pero no la arrastra una cola larga de valores bajos, sino una masa de 124 ceros (31 % de 400) separada del resto. La regla «media < mediana → cola izquierda» describe el síntoma; el EDA te obliga a mirar la causa. El 9.800, muy lejos del P95, tira hacia arriba, pero pesa poco al lado de 124 ceros.
  2. (b) Lectura 1: semanas sin riego (llovió, cosecha, predio en barbecho) → ceros reales. Lectura 2: medidores sin lectura o planillas sin llenar → faltantes disfrazados de cero. Para distinguir: cruza con la lluvia de cada semana (si los ceros caen en semanas lluviosas, son creíbles) y mira si se concentran en ciertos predios, medidores o digitadores (si sí, huele a reporte). Es el razonamiento de los camiones, casi palabra por palabra.
  3. (c) No se sabe desde el resumen. Es atípico —más de cuatro veces el P95—, pero puede ser un predio grande o una fuga. Se marca para verificar; no se borra.
  4. (d) Si confirmas que los ceros son semanas sin riego, «¿cuánto se gasta en una semana en que se riega?» se responde con la mediana de los registros distintos de cero, y se dice así. Si no lo has confirmado, entregas la mediana de 1.560 m³ junto con el supuesto: «31 % de semanas en cero, sin verificar si son reales». Lo que no haces es entregar 1.180 como «lo típico».

15 · Explícaselo a alguien

Producción: tu jefe, ingeniero y sin formación en estadística, te muestra el promedio de 1.440 L de la flota y tus 2.500 L. Escríbele un mensaje de no más de cinco frases que explique por qué ese promedio todavía no prueba que tus camiones gasten de más, y qué propones revisar. Sin jerga: nada de «asimetría» ni «imputación».
Criterios de corrección

Escríbelo en papel y llévaselo a Datito.

Respuesta correcta y cómo se resuelve

En una frase: el promedio de la flota todavía no sirve de vara, porque puede estar hundido por camiones que marcan 0 litros, y esos ceros pueden ser camiones parados o consumos que nadie anotó.

Respuesta modelo (cinco frases, sin jerga):

«Jefe, el promedio de 1.440 litros junta a todos los camiones de la flota, y antes de compararlo con mis 2.500 necesito ver cuánto gasta cada camión por separado. Si varios camiones aparecen con 0 litros, el promedio baja mucho y cualquier camión que esté trabajando se va a ver caro al lado de ese número. Esos ceros pueden ser camiones que estuvieron parados o consumos que nadie anotó, y con la planilla sola no se puede saber cuál de las dos. Propongo revisar quién registró esos ceros y cruzarlos con la bitácora de operación de esas semanas. Con eso comparamos mis camiones contra los que de verdad estaban trabajando, que es la comparación justa.»

Cómo se arma: (1) qué es lo medido: 1.440 y 2.500; (2) por qué el promedio no basta: la forma de los datos, los ceros; (3) las dos lecturas, sin elegir una; (4) una acción verificable; (5) qué se gana. Una frase por paso. Con los camiones ilustrativos del panel, la diferencia entre las dos lecturas es 74 % contra 4 % sobre la media, pero al jefe le basta la idea, no la cifra [DATITO].

Error típico: escribir «la distribución es asimétrica por imputación de ceros» (jerga que el jefe no puede usar), o afirmar como hecho que los ceros son camiones parados. Eso es una hipótesis y se dice como hipótesis.

Origen: cifras de la lámina 20 [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 20]; las dos lecturas de los ceros y el paso de ir a ver quién anotó, [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:12–0:45:38]; la redacción es [DATITO]. Intenta la tuya antes de abrir esto y llévasela a Datito.

Antes de cerrar

Para responderle a Datito: te doy dos columnas de un dataset de sensores de una planta. La columna temperatura tiene media 78,4 y mediana 78,1. La columna horas_hasta_falla tiene media 412 y mediana 190. Sin ningún gráfico: ¿cuál de las dos transformarías antes de modelar, y qué estadístico reportarías de cada una? Justifica con el criterio, no con el resultado.
Respuesta correcta y cómo se resuelve

Respuesta: transformaría horas_hasta_falla (con logaritmo, como log1p) y dejaría temperatura como está. De la temperatura reportaría la media (78,4) con su desviación estándar; de las horas hasta la falla, la mediana (190 h) con percentiles, no la media de 412.

Cómo se resuelve:

  1. Compara media y mediana, y compáralas contra la escala. Temperatura: 78,4 − 78,1 = 0,3, apenas un 0,4 % de 78 → prácticamente simétrica. Horas: 412 frente a 190 → la media es 2,2 veces la mediana.
  2. Decide el lado. En las horas, media > mediana → cola a la derecha: la mayoría de las máquinas falla relativamente pronto y unas pocas duran muchísimo y arrastran el promedio.
  3. Consecuencia de modelado. Con una cola así el logaritmo acerca media y mediana, como pasó con Price en Melbourne (61,5 % bajo la media en crudo, 52,5 % en logaritmo). La temperatura no tiene nada que corregir.
  4. Consecuencia de reporte. «Una máquina típica dura unas 190 horas» es honesto; 412 horas es un número que la mayoría de las máquinas no alcanza.

Error típico: mirar la diferencia en bruto sin escala («0,3 es poco, 222 es mucho», que por casualidad acierta aquí pero falla si cambian las unidades), o transformar las dos «por si acaso». Otro: creer que el logaritmo siempre ayuda. En tu repositorio, Ridge sobre log1p(Price) dio R² −17,0: la transformación es una hipótesis que se valida con el modelo, no una regla. Y sin gráfico lo que tienes es una sospecha fuerte; se confirma con P5 y P95 si te los dan (sección 7).

Origen: las dos columnas son ilustrativas [DATITO]; el criterio media contra mediana es el de las secciones 4, 7 y 12 de esta página; los porcentajes bajo la media: [FUENTE · Repo: 09_RESULTADOS/predicciones_2017.csv, columna Price]; el R² de Ridge: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] y [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]. Llévale igual tu respuesta a Datito para que te repregunte.

Cierre de la Clase 3 · EDA: conocer los datos antes de modelar

Qué aprendiste

  • Un resumen no determina la forma: hay que mirar la distribución.
  • La media se mueve con los extremos; la mediana no.
  • La varianza de una muestra divide por n − 1.
  • Correlación no es causalidad, y un gráfico puede engañar por su escala.

Qué no debes confundir

  • Cantidad que describe una variable (varianza) ≠ cantidad que describe un clasificador (precisión, AUC) (C2 P4).
  • Hipótesis ≠ medición (C2 P11).
  • Necesario ≠ suficiente: toda falla trae vibración, no toda vibración es falla.

Procedimiento para el papel

  1. Tipo de variable → gráfico adecuado.
  2. Centro (media y mediana) y extensión (desviación, percentiles).
  3. Busca ceros, centinelas y atípicos: ¿error o dato real?
  4. Escribe hipótesis, no conclusiones.

Viene de: Clase 2 · Datos, filas, columnas, features y target · Sigue: Clase 4 · Calidad, limpieza y preparación de datos

Vuelve a tu activación: En la clase de EDA, el histograma de consumo de camiones tenía muchísimos ceros. ¿Son camiones inactivos o reportes que faltan? ¿Cómo lo decidirías? ¿Cambiarías tu respuesta?

Pregunta final. Si la media es mucho mayor que la mediana, ¿qué te dice eso de la distribución?
Respuesta correcta y cómo se resuelve

Que tiene cola a la derecha: unos pocos valores altos arrastran la media, y la mediana representa mejor el caso típico. [DATITO]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 4 · Calidad, limpieza y preparación de datos