Objetivo. Leer la distribución de una variable y detectar faltantes, atípicos y dificultades del problema antes de modelar.
- Evidencia de aprendizaje: Interpreta un resumen (media, mediana, desviación, percentiles) y dice qué revela y qué no revela sobre la forma y la calidad.
- Actividad final: Camino inverso: reconstruir la forma de una distribución a partir de cinco números, sin gráfico.
- Criterio de dominio: Distingue media de mediana ante asimetría y detecta un cero o centinela sospechoso con un argumento de calidad, no de estética.
Análisis exploratorio de datos
Mirar los datos antes de modelarlos. Qué te dicen los resúmenes, y sobre todo qué te esconden.
Primero tienes que saber qué es una fila y qué es una columna
(datos, features y target). Después de esto viene decidir
qué haces con lo que encontraste (limpieza y preparación).
El EDA no arregla nada: encuentra.
[FUENTE · Repo: 07_DATITO/curriculum.yaml, campo prerrequisitos]
1 · Para qué sirve, según tu profesor
Abrió la clase sin gráficos. Si mides personas y la altura media es 1,8 metros, ¿qué te dice eso? El curso respondió que serían adultos; con una media de 0,9 metros, que podrían ser niños. Y ahí se detuvo:
07_DATITO/06_AUDITORIAS/patron_evaluacion.md, §1]
Su ejemplo durante toda la clase es una máquina con sensores de voltaje, presión, rotación y vibración, más las fechas de mantención y de falla [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 5]. La vibración va más o menos entre 30 y 60, y el histograma tiene una cola hacia la derecha: pocos valores altos, poco probables, que igual ocurren. Esa cola es justo lo que le interesa: son los momentos de las fallas [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:18:41–0:20:43].
Respuesta correcta y cómo se resuelve
Respuesta correcta: no. Que toda falla venga con alza de vibración no implica que toda alza venga con falla. Vigilando solo la vibración detectarías las fallas, pero también darías alarmas en alzas que no terminan en nada.
Separó dos afirmaciones que suenan iguales y no lo son:
Falla → alza: en estos datos la vibración alta acompaña a toda falla. Alza → falla: no siempre. La vibración es una buena feature, pero no suficiente: sola daría falsas alarmas, y hay que buscar otras variables (él mismo aceptó la fecha de mantención como candidata [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:17:44–0:17:56]). Esas falsas alarmas son los falsos positivos que vas a medir en métricas de clasificación [INFERENCIA]. Y la forma del razonamiento es pariente de la ficha P6 del Certamen 2, causa ≠ condición habilitante (certamen_2.html#p6).
Error típico: leer la flecha al revés. «Falla → alza» es una condición necesaria (sin alza no hubo falla); para anticipar sin falsas alarmas harías falta «alza → falla», que es suficiente, y los datos del profesor muestran alzas sin falla. Contestar «sí, porque siempre coinciden» es justo confundir las dos. [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:16:09–0:16:36]; los nombres «necesaria / suficiente» son [DATITO].
En la lámina 21 el profesor resume para qué sirve visualizar, y lo contó con el ejemplo de los camiones que verás en la sección 3:
| Para qué | Qué significa |
|---|---|
| Identificar patrones | Patrones ocultos y tendencias que no se ven en las estadísticas |
| Formular hipótesis | «hay muchos ceros → hay muchos camiones inactivos» (sección 3) |
| Decidir el siguiente paso | De análisis o de modelamiento |
| Comunicar | Presentar, proveer evidencia… e influenciar y persuadir. Ojo con esto último (sección 10) |
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 21] [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:45–0:46:29]
2 · El resumen no determina la forma
Tu profesor puso cuatro conjuntos de datos en pantalla. Cada uno tiene dos variables,
x e y, y once filas. Y los cuatro tienen exactamente el mismo resumen:
Estos seis números no cambian al apretar los botones de abajo. Medias y desviaciones: las que el profesor leyó en clase [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:42:14–0:42:44]. Correlación y recta: valores canónicos del cuarteto de Anscombe, que en clase no se leyeron en voz alta [INFERENCIA]. Láminas 18 y 19.
Respuesta correcta y cómo se resuelve
Respuesta correcta: no. Los cuatro gráficos no se parecen en nada, aunque compartan media, desviación estándar, correlación y recta ajustada. El resumen no fija la forma.
Si dijiste que sí, acabas de descubrir el motivo por el que existe esta unidad. Los cuatro conjuntos son radicalmente distintos:
- 1 — una relación lineal con ruido. Es el único donde la recta describe lo que pasa.
- 2 — una curva. La recta es la mejor línea recta posible, y aun así es la descripción equivocada del fenómeno.
- 3 — una recta perfecta más un solo punto anómalo. Ese punto solo tuerce la recta.
- 4 — diez puntos con el mismo valor de
xy uno lejos. La correlación de 0,816 la produce ese único punto: sin él no hay ninguna relación que medir.
La conclusión del profesor frente a los cuatro gráficos: media, mediana, desviación estándar y percentiles ayudan, pero no bastan para darte el contexto real de lo que estás midiendo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:43:15–0:43:25].
Error típico: razonar «mismos números → mismos datos». Seis números no pueden guardar once pares de puntos: al resumir se pierde información, y muchas nubes distintas caben en el mismo resumen. Por eso, en una prueba, «¿se parecen?» se contesta con «no se puede saber sin graficar», nunca con «sí» [INFERENCIA].
3 · Lo que el EDA destapa: ceros que quizá no son ceros
Justo después de Anscombe, el profesor planteó esto. Las cifras están escritas en la lámina, así que no dependen de la transcripción:
Respuesta correcta y cómo se resuelve
Respuesta: pides la distribución del consumo camión por camión (un histograma), no solo el promedio. Si aparecen muchos ceros, pueden ser (1) camiones inactivos, un cero real, o (2) consumos que nadie reportó, un faltante disfrazado de cero. Con la planilla sola no se decide cuál.
Cómo se resuelve, con los 25 camiones ilustrativos del panel [DATITO]:
- 15 camiones trabajando suman 36.000 L → su media es 36.000 / 15 = 2.400 L.
- Si los 10 ceros son consumo real: 36.000 / 25 = 1.440 L, la cifra de la lámina. Tus 2.500 quedan 2.500 / 1.440 − 1 ≈ 74 % arriba.
- Si los 10 ceros son reportes que faltan, salen del cálculo: la media es 2.400 L y tus 2.500 quedan solo 2.500 / 2.400 − 1 ≈ 4 % arriba.
- Misma planilla, dos conclusiones opuestas. Lo que decide no es la estadística: es ir a ver quién anotó los datos y dónde estaban los camiones, que fue el siguiente paso que propuso el profesor [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:45:28–0:45:38].
Error típico: aceptar 1.440 L como «lo que gasta un camión» y concluir que tus camiones gastan 74 % de más. La media de 1.440 no describe a ninguno: cae en el hueco entre los parados y los que trabajan. El otro error es elegir una de las dos lecturas sin decir que es un supuesto.
Origen: 1.440 y 2.500 L, [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 20]; las dos lecturas de los ceros, [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:12–0:45:23]; el reparto 15 + 10 es ilustrativo [DATITO].
25 camiones, cifras ilustrativas construidas para reproducir la media de 1.440 L de la lámina 20: 10 camiones en 0 y 15 entre 2.100 y 2.700 L. [DATITO]
Lo que pasó en clase: con la distribución a la vista, el problema es la barra del cero.
Fíjate en la estructura del razonamiento, porque es el EDA completo en miniatura:
- Distribución. La media de 1.440 no describe a ningún camión: casi todos están en 0 o cerca de 2.400. Cae en el hueco entre los parados y los que trabajan.
- Calidad. Un cero puede ser una medición real (camión inactivo) o un faltante disfrazado de cero (nadie anotó el consumo). En la tabla se ven idénticos.
- Hipótesis. El curso propuso «camiones inactivos»; el profesor puso al lado la alternativa: no se está reportando.
- Siguiente paso. Ninguna de las dos se decide con estadística. Él propuso ir a ver quién anotó los datos y dónde estaban los camiones [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:45:28–0:45:38].
0 (conductor enfermo: medición real, se queda), un
−999 (en mantenimiento: faltante escrito como número) y un 2900 frente a 200
(atípico, no necesariamente error). Si los tratas igual, te equivocas en al menos uno. Qué hacer con
cada uno ya es limpieza y preparación; al EDA le toca
encontrarlos y decir qué supone de cada uno.
[FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_1.html, ficha 9B]
4 · Centralidad: dónde está el medio
| Estadístico | Cómo se calcula | Cuándo lo usas |
|---|---|---|
| Media (promedio) | Sumas todo y divides por n |
Distribución simétrica y sin valores extremos |
| Mediana | Ordenas y tomas el del medio (o el promedio de los dos del medio) | Hay cola o valores anómalos. Es el percentil 50 |
| Moda | El valor que aparece más seguido | Variable categórica: única opción disponible |
La razón por la que la moda existe
La lámina 11 lo dice en una línea: para variables categóricas ni la media ni la mediana tienen sentido; se usa la moda, el valor que aparece más seguido [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 11]. En clase lo explicó por el orden: una categórica no se puede ordenar, así que no hay histograma por rangos, solo frecuencias [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:25:29–0:25:43]. Su ejemplo para que se entendiera: nadie puede decir que el ornitorrinco viene antes que el conejo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:27:48–0:28:00].
En la máquina: ¿qué componente falló? Componente 1, 2, 3 o 4. No hay orden —la 3 no es «más» que la 2—, así que no hay histograma, no hay media, no hay desviación estándar. Solo frecuencias, y la moda fue la componente 2.
5 · Extensión: qué tan representativo es ese medio
Saber dónde está el centro no basta. Dos distribuciones con la misma mediana pueden ser una compacta y la otra desparramada, y en ese caso la mediana significa cosas distintas en cada una.
| Medida | Fórmula | Qué aporta | Qué le falta |
|---|---|---|---|
| Rango | máx − mín | El ancho total, en un número | Lo fija un solo dato en cada extremo |
| Varianza | s² | Desviación media al cuadrado | Unidades al cuadrado: no se puede interpretar |
| Desviación estándar | s = √s² | En las unidades de la variable | No dice hacia qué lado |
| Percentiles | P5, P25, P50… | Sí dicen el lado | Hay que calcular varios |
La varianza, desarmada
| Pieza | Qué es |
|---|---|
xi | Dato. El valor de la observación i. Lo mediste |
x̄ | Se calcula desde los datos. La media. No la eliges |
n | Dato. Cuántas observaciones tienes |
(xi − x̄) | La distancia de cada dato al centro. Es lo que queremos promediar |
| El cuadrado | Dos razones, abajo |
n − 1 | Corrección de sesgo, abajo |
| Qué decides tú | Qué variable medir, y si al final reportas s o percentiles |
¿Por qué el cuadrado, y no el valor absoluto?
El profesor dio dos razones y la segunda es la que se olvida [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:31:20–0:32:26] (la lámina 13 la resume: al cuadrado, la varianza queda más sensible a outliers):
- Para que sea positivo. Si sumaras las distancias con signo, las de arriba cancelarían las de abajo y siempre te daría cero. El cuadrado es «como una excusa» —palabras suyas— para volverlas positivas. El valor absoluto también serviría para esto.
- Para hacerla más sensible a los valores anómalos, a propósito. Una distancia grande al cuadrado crece mucho más rápido que la misma distancia sin elevar. Un dato lejano pesa desproporcionadamente, y eso es deliberado: se quiere que un valor extremo grite.
¿Por qué n − 1 y no n?
La idea: no tienes acceso a la varianza real de la población, solo a una muestra. La fórmula es
un estimador. Con n − 1, al crecer la muestra converge al valor real;
con n, converge a un valor equivocado aunque tuvieras datos infinitos. Con n
grande la diferencia es despreciable; con n chico es enorme.
¿Por qué la raíz?
Unidades. Si mides vibración en mm/s, la varianza queda en mm²/s², que no significa nada físico. La raíz devuelve la cantidad a mm/s, y recién ahí puedes decir «la mayoría de las máquinas están a ±6 mm/s del promedio» [DATITO: unidades y cifra ilustrativas]. El profesor la llamó un truco para recuperar las unidades de la variable (láminas 13 y 14) [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:35:46–0:36:39].
Ejemplo numérico chico — hazlo a mano antes de abrir
Vibración de cinco máquinas: 38, 40, 41, 42, 44.
- Media: (38+40+41+42+44) / 5 = 205 / 5 = 41
- Desviaciones: −3, −1, 0, +1, +3 → suman 0 (siempre suman 0, por eso el cuadrado)
- Cuadrados: 9, 1, 0, 1, 9 → suma = 20
- Varianza: 20 / (5 − 1) = 5 [mm²/s²]
- Desviación estándar: √5 = 2,24 [mm/s]
Ahora cambia el 44 por un 74 —una máquina a punto de fallar—:
- Media: 235 / 5 = 47 (se movió 6 unidades)
- Mediana: sigue siendo 41 (no se movió nada)
- Cuadrados: 81, 49, 36, 25, 729 → suma 920 → s² = 230 → s = 15,17
Un solo dato multiplicó la desviación estándar por casi 7. Fíjate en el 729: ese único término aporta el 79 % de la suma. Eso es la sensibilidad a los anómalos de la que habla el profesor, y aquí se ve el número exacto.
6 · La desviación estándar no tiene lado. Los percentiles sí
Este es el hallazgo central de la clase, y es lo que hace que los percentiles no sean un adorno.
Lo que sí se puede hacer, siguió, es calcular los percentiles. Y dio el método concreto para leerlos: compara la distancia de media − s a P5 con la distancia de media + s a P95. Si una es mucho mayor que la otra, por ese lado está la cola [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:39:44–0:40:45].
s va a cambiar al reflejar? Piénsalo antes.
Las dos distancias del profesor
240 mediciones de vibración, centradas en 41. Muestra fija: los números son reproducibles. Cifras ilustrativas [DATITO · construido sobre el ejemplo de vibración de la Clase del 17-jul]
La respuesta a la predicción
s no cambia al reflejar. Ni un decimal. Reflejar es restar cada dato
de un valor fijo, y eso conserva todas las distancias al centro —que es lo único que mide la varianza—.
La media y la mediana sí se reflejan, y P5 y P95 se intercambian.
Entonces tienes dos distribuciones que son distintas —una con la cola a la derecha, otra a la
izquierda— y que comparten exactamente el mismo s. Ese número, solo, no puede distinguirlas.
Las distancias a P5 y P95 sí: se dan vuelta.
Regla para llevarte: la desviación estándar mide cuánto. Los percentiles miden cuánto y hacia dónde.
El boxplot: los percentiles hechos dibujo
El profesor lo presentó así (lámina 41): la línea del medio es la mediana; la caja va del percentil 25 al 75; los valores que quedan fuera del bigote se dibujan como puntos sueltos, y esos son los valores anómalos. Del bigote dijo que «es 1,5 por el rango intercuartil» [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:14:48–1:15:11]. El rango intercuartil (RIC) es P75 − P25: el ancho de la caja.
Solución paso a paso
- Ya están ordenados; n = 9. Mediana = el 5.º dato = 41.
- P25 y P75 con el método por defecto de pandas y numpy (posición (n − 1)·p, contando desde 0): P25 cae en la posición 2 → el 3.er dato = 39; P75 cae en la posición 6 → el 7.º dato = 43.
- RIC = 43 − 39 = 4. 1,5 × RIC = 6.
- Límites: 39 − 6 = 33 y 43 + 6 = 49.
- El 70 supera 49 → se dibuja suelto: es atípico. El bigote de arriba llega hasta 45; el de abajo, hasta 36.
- Media = 394 / 9 = 43,8, mayor que la mediana 41 → cola a la derecha, igual que en el control de arriba.
¿Lo borrarías? No por ser atípico. En este problema los valores altos de vibración son justamente los momentos de falla: borrar el 70 es borrar lo que quieres predecir. Atípico describe una posición en la distribución; error es un juicio que hay que verificar. Es el mismo criterio del 2900 de la 9B. (Otros textos calculan los cuartiles con otra regla y dan números algo distintos; el procedimiento no cambia.)
Respuesta, y lo que dijo el profesor sobre esto
Falso. Un boxplot describe la muestra que tienes. Con pocos datos, dos cajas separadas pueden salir por azar, y el dibujo no te dice cuántos datos hay detrás de cada caja. El profesor lo advirtió comentando la presentación de un grupo de compañeros que había usado un test t para comparar tumores benignos y malignos:
Antes les había preguntado si revisaron la normalidad que el test supone, y aclaró que esa herramienta no se enseña en el curso [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-14T22_09_23Z_Fundamentos_en_Ciencia_de_Datos.md · 1:19:27–1:21:04]. Para el certamen, lo que te llevas es el criterio: el EDA propone una hipótesis; no la demuestra. Que el hablante es el profesor titular se infiere porque un compañero se dirige a él como «Profesor» en 1:20:01 y porque él habla de lo que «no la enseñamos» en el curso [INFERENCIA].
7 · Camino inverso: te dan cinco números, sin gráfico
En una prueba escrita no vas a tener el histograma. Vas a tener una tabla. Estos son los números reales de tu propio proyecto: los precios de las 7.244 propiedades de Melbourne vendidas en 2017, el conjunto de prueba con el que evaluaste tus seis modelos.
| Estadístico | Valor (AUD) |
|---|---|
| n | 7.244 |
| Media | 1.078.072 |
| Mediana | 910.000 |
| Desviación estándar | 629.743 |
| Mínimo | 131.000 |
| P5 | 420.000 |
| P95 | 2.260.000 |
| Máximo | 9.000.000 |
[FUENTE · Repo: calculado sobre 09_RESULTADOS/predicciones_2017.csv, columna Price.
La mediana de 910.000 coincide con meta.precio_mediana_2017 de resultados_temporal.json]
Cómo se reconstruye la forma desde esos números
- Media contra mediana. 1.078.072 > 910.000. La media está arriba de la mediana → hay cola hacia la derecha. Primera señal, y ya alcanza para sospechar.
- Distancia izquierda. media − s = 1.078.072 − 629.743 = 448.329. P5 = 420.000. Diferencia: 28.329.
- Distancia derecha. media + s = 1.707.815. P95 = 2.260.000. Diferencia: 552.185.
- Compara. 552.185 frente a 28.329: el lado derecho tiene 19 veces más recorrido sobrante. Cola derecha confirmada, y fuerte.
- Los extremos. mediana − mín = 779.000. máx − mediana = 8.090.000. Diez veces más.
- Traduce a una frase del problema. «Hay muchas casas baratas y unas pocas mansiones que estiran el promedio.»
La consecuencia que duele: el 61,5 % de las propiedades de 2017 se vendió por menos que el «precio promedio» de 1.078.072. Si un cliente te pregunta «¿cuánto cuesta una casa en Melbourne?» y le dices el promedio, le das un número que seis de cada diez casas no alcanzan. La mediana de 910.000 es la respuesta honesta.
Y ahora sí, el gráfico
Price sino sobre
log1p(Price). El motivo está en los números de arriba: en escala logarítmica la
media (13,754) y la mediana (13,721) casi coinciden, y el 52,5 % de los datos queda bajo la media
en vez del 61,5 %. La asimetría desaparece.
Una decisión de EDA se convirtió en una decisión de modelo. Eso es lo que el EDA
produce: no gráficos bonitos, decisiones.
log1p(Price) dio R² = −17,0: al deshacer la transformación
con expm1, los errores sobre los valores extremos se disparan exponencialmente.
La misma transformación que ayuda a un modelo de árboles destruye a uno lineal.
[FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md y 09_RESULTADOS/resultados_temporal.json]
8 · Lo que el EDA dice (y no dice) de la dificultad del problema
Hasta aquí el EDA describía columnas. En un proyecto también tiene que responder una pregunta más incómoda: ¿qué tan difícil va a ser esto? Tu proyecto entrena con 2016 y predice 2017. Estos son hallazgos reales del EDA de ese corte:
| Hallazgo | 2016 (train) | 2017 (test) |
|---|---|---|
| Filas | 6.336 | 7.244 |
Mediana de Price (AUD) | 900.000 | 910.000 |
| Filas de suburbios que no existen en el train | — | 29,1 % |
Nulos en CouncilArea | 0 % | 18,9 % |
Categorías de CouncilArea que solo aparecen en 2017 | — | 14, una se llama Unavailable |
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json, bloque meta]
[FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md, experimento CouncilArea, y
09_RESULTADOS/experimento_councilarea_2026-09-18.json, bloque fase4_faltantes]
Criterios para corregirte (no es una respuesta modelo)
- Medianas. Aprueba si separas lo que puede afirmar un resumen de una sola columna de lo que no puede, con un ejemplo concreto de cada lado. Si tu conclusión sobre la dificultad se apoya solo en esas dos cifras, repasa la sección 2 antes de seguir.
- 29,1 %. Aprueba si lo lees como un problema de cobertura: qué hace un modelo
con una categoría que nunca vio, y en qué fracción del test pasa. Suma si propones cómo medirlo (tu
repositorio ya separa el error por suburbios nuevos y conocidos en
resultados_temporal.json). - CouncilArea. Aprueba si notas que el faltante no es igual en train y en test,
y si tratas
Unavailablecomo lo que parece: un faltante disfrazado de categoría, primo del cero de los camiones (sección 3). - Orden. No hay un orden único correcto; se corrige la razón. Una razón válida dice cuántas filas afecta y si el modelo puede compensarlo con otra columna.
- Medido / supuesto. Cada frase tuya debería poder etiquetarse: «29,1 % de filas de suburbios nuevos» es medido; «eso va a subir el error» es hipótesis hasta que lo midas.
Llévale tus tres respuestas a Datito: es la pregunta diagnóstica de este concepto, y se corrige en conversación.
Respuesta correcta y cómo se resuelve
En una frase: las medianas casi no dicen nada de la dificultad; el 29,1 % dice que
casi un tercio del test cae en barrios que el modelo nunca vio; y CouncilArea dice que
una columna cambió de comportamiento entre 2016 y 2017. Preocupan en ese orden: 29,1 %, CouncilArea,
medianas.
| Fila | (a) Qué te dice | (b) Qué no te dice |
|---|---|---|
| Medianas 900.000 → 910.000 | El precio típico casi no se movió (+1,1 %). No hay un salto de nivel de un año a otro que el modelo deba adivinar. | Si cambió la mezcla de propiedades (tipos, barrios), las colas, o la relación entre las columnas y el precio. Es el resumen de una sola columna: la lección de Anscombe (sección 2). |
| 29,1 % de filas de suburbios nuevos | Un problema de cobertura: 7.244 × 0,291 ≈ 2.109 casas de 2017 están en barrios sin ningún ejemplo en el train. Un modelo que dependiera del nombre del barrio no tendría nada que usar en ellas. | Cuánto sube el error. Eso hay que medirlo, y tu repositorio lo midió: el modelo final no usa
Suburb (usa latitud, longitud, distancia, región), y su MAE en barrios nuevos es
193.462 AUD contra 186.064 en barrios conocidos, un 4 % más. Hipótesis antes de medir; dato después. |
CouncilArea: 0 % → 18,9 % de nulos, 14 categorías nuevas |
El faltante no es igual en train y en test: un modelo entrenado en 2016 nunca vio un
nulo ni esas 14 comunas. Entre nulos y categorías nuevas, el 28,5 % de las filas de 2017 no aporta
nada por esa columna. Y Unavailable es un faltante disfrazado de categoría, como el cero
de los camiones. |
Si CouncilArea importa para el precio. Puede ser redundante con la región y las
coordenadas. El experimento del repositorio midió que agregarla mejoraba apenas 599 AUD (0,38 %) en
2016, y se dejó fuera. |
Orden, con una razón por línea:
- 29,1 % — afecta a unas 2.109 filas y no se puede eliminar: es una propiedad del futuro, no de una columna. Solo se compensa con otras columnas de ubicación.
- CouncilArea — afecta a cerca del 28,5 % de las filas, pero se resuelve sacando la columna, a un costo medido de 0,38 %.
- Medianas — no afectan a ninguna fila en particular; describen el centro y nada más.
Error típico: concluir «el problema es fácil porque las medianas son casi iguales» (un resumen no determina la forma), o afirmar «el 29,1 % va a subir mucho el error» como si fuera un resultado. Es una hipótesis hasta que se mide, y aquí la medición dio un 4 %. Otro orden también puede aprobar si la razón dice cuántas filas afecta y si otra columna lo compensa.
Origen: filas, medianas, 29,1 %, columnas excluidas y MAE por suburbio nuevo y conocido del modelo «HistGradientBoosting | log»: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]. Nulos, categorías nuevas, 28,5 % y experimento A/B: [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md, experimento CouncilArea] y [FUENTE · Repo: 09_RESULTADOS/experimento_councilarea_2026-09-18.json]. El orden y sus razones: [DATITO].
9 · Dos variables a la vez
Hasta aquí, una variable por vez. El paso siguiente es preguntar si dos se mueven juntas. La herramienta es el scatter plot, y el número es la correlación.
Su ejemplo: altura en el eje X, peso en el eje Y. De inmediato sale una hipótesis —a más altura, más peso— y de la hipótesis sale un modelo: estimar el peso a partir de la altura [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:03:00–1:03:28].
Ahí está el puente completo: graficas → ves una relación → formulas una hipótesis → propones un modelo. El EDA es lo que te dice qué features vale la pena probar.
Tus propias correlaciones
Correlación de Pearson de cada variable numérica con Price, sobre las 13.580 filas
de Melbourne:
| Variable | r con Price | Lectura |
|---|---|---|
| Rooms | 0,497 | La más alta de todas, y aun así explica poco sola |
| YearBuilt | −0,262 | Negativa: las más antiguas tienden a ser más caras |
| Lattitude | −0,213 | Geografía pura: más al sur, más caro |
| Longtitude | 0,204 | Ídem, en el otro eje |
| Distance | −0,163 | Más lejos del centro, más barato |
| BuildingArea | 0,070 | Sospechosamente baja. Ver la nota |
| Landsize | 0,038 | El tamaño del terreno casi no predice el precio |
[FUENTE · Repo: 09_RESULTADOS/correlacion_dashai.json, n = 13.580]
BuildingArea da 0,070 y no hay que creerle.
Esa columna tenía muchos nulos, y se rellenaron todos con un mismo valor constante (130,60 m²).
Cientos de filas con un valor idéntico e inventado aplastan cualquier correlación hacia cero.
El 0,070 describe el dataset después de imputar, no el mundo.
Moraleja de EDA: un coeficiente bajo
puede venir del fenómeno o puede venir de lo que le hiciste al dato. Antes de descartar una variable
por su correlación, mira cuántos nulos tenía.
[FUENTE · Repo: el propio
correlacion_dashai.json declara rellenos_nulos: BuildingArea = 130,5965]
La matriz de correlación, leída como la leyó el profesor
Con el dataset del Titanic (sobrevivió o no, clase, sexo, edad, familiares a bordo, precio del pasaje), el profesor leyó la fila de supervivencia. Sexo aparece con −0,54 ⚠ (dicho en clase como «menos 54»; coincide con el valor conocido de ese dataset [INFERENCIA]). Para interpretarlo necesitó la codificación: «sé que cero es mujer y uno es hombre». Correlación negativa → a más «1», menos supervivencia → sobrevivieron más mujeres. El precio del pasaje, en cambio, correlaciona positivo: pasaje más caro, más probable sobrevivir [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:10:57–1:12:29]. (El Titanic vuelve en el práctico P5; aquí solo está lo que el profesor leyó en clase, no resultados del práctico.)
Correlación ≠ causalidad
El profesor partió con un ejemplo burdo a propósito: cuando sube la temperatura se venden más helados, y nadie concluiría que comprar helado sube la temperatura; pero en los noticieros se hace exactamente eso con correlaciones menos obvias [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:55:50–0:56:45].
La segunda historia la aportó un compañero, y es real. Un colega suyo recibió un análisis que no le convencía. Para desarmarlo, se conectó a la base de recursos humanos, sacó el dígito verificador del RUT de todos los trabajadores y lo correlacionó con la variable de interés. El dígito verificador correlacionaba más que el análisis del otro ingeniero, y la conclusión irónica fue contratar más gente con esos dígitos verificadores [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:56:47–0:57:44].
- Una correlación alta no es evidencia de nada por sí sola. Necesitas un mecanismo que explique por qué una cosa movería a la otra. Esto lo planteó el mismo compañero al introducir su historia [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:56:50–0:56:58].
- Con muchos datos, algo va a correlacionar por puro azar, y hay que tener cuidado [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:57:46–0:57:56].
- Existen los confusores: variables que no mediste y que mueven a otras dos a la vez. Ves que suben juntas y no ves la causa real [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:58:26–0:58:46].
Varias variables y una clase: el EDA que pide el proyecto
Al llegar a los ejemplos finales se detuvo: «este es el tipo de cosas que yo espero que ustedes hagan en su análisis exploratorio» [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:16:01–1:16:09]. El ejemplo: análisis químico de vinos de una misma región de Italia, de tres cultivadores, con 13 medidas por vino (lámina 44). Su secuencia fue esta [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:17:33–1:23:34]:
- Contar las clases. Hay más vinos del cultivador 1 que del 2 y del 0, y eso importa porque los modelos tienden a ajustarse a la clase más representada. Es el desbalance que después castigan las métricas de clasificación.
- Resumen por variable. Media, desviación, mínimo, P25, P50, P75 y máximo de las 13. Alcohol: media cercana a 13 y desviación 0,8, con la mediana parecida a la media → simétrica. Intensidad de color: media 5,05 y mediana 4,69 → corrida hacia valores bajos. (Cifras dichas en clase ⚠.)
- Histograma por clase. Con el alcohol, el curso vio que el cultivador 1 hace vinos de menor graduación, pero que el alcohol no separa al 0 del 2; el profesor lo confirmó.
- Dos variables juntas. Con ácido málico y alcohol planteó que ya se podía clasificar la procedencia del vino, y lo llamó una hipótesis de clasificación [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 1:22:25–1:22:46]. En el gráfico 2D los tres grupos casi se separan: no será perfecto, pero se puede clasificar.
10 · Integridad visual
El profesor dedicó un bloque a gráficos que engañan (láminas 23 a 27). Su criterio de referencia es el de Tufte: transmitir el mayor número de ideas, en el menor tiempo, con la menor cantidad de tinta, en el menor espacio (lámina 22). Aclaró que hoy, sin imprenta, la tinta y el espacio importan menos que las ideas por unidad de tiempo [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:46:33–0:47:20].
| Ejemplo en clase | El truco |
|---|---|
| Millas por galón: 18 en 1978, 27 en 1985 | La figura del 85 se dibuja como diez veces más grande, aunque el valor no llega al doble |
| «Yo corro mucho más rápido que ustedes» | Eje entre 8,09 y 8,1: una diferencia mínima parece enorme |
| Cortes de impuestos: 35 % frente a 39,6 % | Se presenta como desastre una diferencia que «no es tanta» (probablemente un eje que no parte en cero; la figura no está en el texto de la lámina [INFERENCIA]) |
| Vacunación en Chile, cadena nacional | Escala logarítmica: una caída fuerte parece una bajita. Abajo, en detalle |
[FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:47:23–0:53:26]
El caso chileno: una escala logarítmica en cadena nacional
Durante la pandemia se presentó en cadena nacional un gráfico del avance de la vacunación en Chile. Mirando solo la línea, la tasa parecía haber bajado apenas un poco [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:51:31–0:52:09]. El profesor preguntó en qué escala estaba el eje, y la respuesta que quedó fue: logarítmica [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:52:12–0:52:24]. En esa escala la distancia en el eje no es proporcional a la cantidad —cada tramo igual multiplica—, así que una caída grande se ve chica [INFERENCIA sobre la figura]. Él lo volvió a graficar en escala lineal:
Sin gráfico también se engaña: el denominador
Al final del bloque, un compañero aportó un caso que había visto en redes sociales: una sola frase, sin gráfico, sobre accidentes laborales y días de la semana.
El cálculo, y lo que concluyó el compañero
- Con reparto uniforme, cada día aporta 1/7 ≈ 14,3 %.
- Viernes + lunes = 2/7 ≈ 28,6 %.
- 25 % < 28,6 % → el dato queda por debajo de lo esperado. Si sugiere algo, es lo contrario de lo que insinuaba la publicación.
Su «30 %» es el 28,6 % redondeado, y también dijo que cada día aporta cerca de un 15 % (14,3 %). El profesor lo tomó como un problema comunicacional que aparece de muchas formas [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:54:42–0:54:48].
El supuesto que conviene declarar: el propio compañero advirtió que el reparto real no es uniforme. Si en ese rubro solo se trabaja de lunes a viernes, la referencia sería 2/5 = 40 % y el 25 % quedaría todavía más abajo [DATITO]. Cambias el denominador y cambia la conclusión; por eso hay que escribirlo. Es el mismo problema que vas a encontrar en las métricas de clasificación: un porcentaje sin su denominador no dice nada.
11 · La distinción de certamen
01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md, ficha P4]
Las otras distinciones de esta unidad, en el formato en que el profesor las pregunta:
| No confundas | Con | Lo que decide |
|---|---|---|
| Media | Mediana | La media se arrastra hacia la cola; la mediana no. Con asimetría, reporta mediana |
| Varianza | Desviación estándar | Las unidades. La varianza está al cuadrado y no se interpreta |
| Desviación estándar | Percentiles | s dice cuánto; los percentiles dicen cuánto y hacia dónde |
| Variable numérica | Variable categórica | Orden. Sin orden no hay histograma ni media: solo frecuencias y moda |
| Gráfico de barras | Gráfico de líneas | Si puedes interpolar entre dos valores del eje X, línea. Si no, barras |
| Correlación | Causalidad | El mecanismo. Sin mecanismo, r alto no es evidencia |
| Resumen estadístico | Forma de la distribución | Anscombe: cuatro formas distintas, un solo resumen |
| Un estadístico descriptivo | Una métrica de evaluación | Qué objeto describe: una variable o un modelo (P4) |
| Medición | Hipótesis (supuesto) | ¿Sale de los datos o la pusiste tú? «Media 1,8 m» es medido; «son adultos» es hipótesis (P11) |
| Condición necesaria | Condición suficiente | Falla → alza de vibración no implica alza → falla. La feature ayuda, pero no basta |
| Cero medido | Faltante disfrazado (0, −999, Unavailable) | ¿Qué significaría ese valor si fuera real? Si no puedes contestarlo, es sospechoso (9B) |
| Atípico | Error | Atípico es una posición (fuera de 1,5 × RIC); error es un juicio que se verifica. El 2900 de la 9B y la vibración de 70 son atípicos, no errores probados |
| Separación en un boxplot | Significancia estadística | El número de datos. Un boxplot bonito con tres datos no asegura nada |
12 · Procedimiento para el papel
Te dan una tabla de números o una figura y te piden describirla. Esto es lo que haces, en orden:
- Clasifica cada columna: ¿numérica o categórica? Esto decide todas las herramientas que puedes usar después.
- Busca los faltantes, también los disfrazados: nulos, pero además ceros en exceso,
códigos como −999, categorías como
Unavailabley valores idénticos repetidos (el 130,60 deBuildingArea). Para cada uno pregúntate qué significaría si fuera real. - Para las categóricas: frecuencias y moda. Nada más. Si hay una categoría que se lleva casi todo, dilo: es desbalance.
- Para las numéricas, el centro: media y mediana. Las dos, siempre. La comparación entre ambas es gratis y es tu primer diagnóstico.
- Decide la asimetría: media > mediana → cola derecha. media < mediana → cola izquierda. media ≈ mediana → simétrica.
- La extensión: rango y desviación estándar. Pregúntate si
ses grande comparado con la media:s= 629.743 sobre una media de 1.078.072 es más de la mitad. Eso es una distribución muy ancha. - Confirma con percentiles: compara (media − s) contra P5 y (media + s) contra P95. La diferencia mayor marca el lado de la cola.
- Mira los extremos: ¿el máximo está a una distancia razonable del P95, o está diez veces más lejos? Si te dan cuartiles, calcula los límites P25 − 1,5 × RIC y P75 + 1,5 × RIC. Lo que quede fuera es candidato a atípico: se marca y se verifica, no se borra por reflejo.
- Escribe la conclusión en palabras del problema, no en jerga. No «la distribución presenta asimetría positiva» sino «hay muchas casas baratas y unas pocas mansiones que estiran el promedio».
- Nombra la consecuencia práctica: qué estadístico reportarías, qué variable transformarías, qué hipótesis probarías después. El EDA termina en una decisión.
- Etiqueta cada frase: medido o supuesto. «10 de 25 camiones marcan 0» es medido; «están inactivos» es hipótesis, y se escribe como tal.
13 · Errores que el formato castiga
- Reportar la media de una distribución con cola y presentarla como «lo típico». En Melbourne 2017, seis de cada diez casas están bajo esa media.
- Promediar los códigos de una categórica de varios niveles. Si codificaste las regiones como 1, 2, 3, su promedio de 2,4 no significa nada: el código es arbitrario (lámina 11). Matiz: con una binaria 0/1 la cosa cambia. Su media es la proporción de unos, y su correlación con otra variable se puede leer si sabes qué es el 0 y qué es el 1: así leyó el profesor el sexo en el Titanic (sección 9). El error no es el número; es olvidar la codificación.
- Tratar todos los ceros como mediciones, o todos como faltantes. Se decide caso a caso y se declara el supuesto: es la 9B.
- Borrar un atípico por ser atípico. En la máquina del profesor, los valores altos son las fallas que quieres predecir.
- Presentar una hipótesis del EDA como resultado. «Estas dos variables separan los vinos» es una hipótesis hasta que un modelo la pruebe, y un boxplot con pocos datos no la demuestra.
- Creer que
ste dice hacia qué lado está la cola. No lo hace, y dos distribuciones espejo lo prueban con el mismos. - Interpretar la varianza en las unidades de la variable. Está al cuadrado.
- Dividir por
nal calcular la varianza muestral. Van − 1. - Concluir desde un resumen sin haber graficado. Anscombe es literalmente el contraejemplo que el profesor mostró en pantalla.
- Leer una correlación alta como causa. Falta el mecanismo, y puede ser azar o un confusor.
- Descartar una variable por su correlación baja sin revisar sus nulos.
Imputar con una constante empuja
rhacia cero artificialmente. - Usar líneas para variables categóricas. La línea afirma que se puede interpolar, y no se puede.
- Confundir un estadístico descriptivo con una métrica de evaluación. Es la trampa de la varianza en la P4 del Certamen 2.
14 · Transferencia: otro rubro, el mismo EDA
(a) ¿Hacia dónde tira la media y por qué? (b) Da dos lecturas del 31 % de ceros y el dato que irías a buscar para distinguirlas. (c) ¿El 9.800 es un error? (d) ¿Qué número le darías al gerente como «consumo típico de una semana de riego», y qué supuesto declaras?
Solución
- (a) Media 1.180 < mediana 1.560: la media queda abajo. Pero no la arrastra una cola larga de valores bajos, sino una masa de 124 ceros (31 % de 400) separada del resto. La regla «media < mediana → cola izquierda» describe el síntoma; el EDA te obliga a mirar la causa. El 9.800, muy lejos del P95, tira hacia arriba, pero pesa poco al lado de 124 ceros.
- (b) Lectura 1: semanas sin riego (llovió, cosecha, predio en barbecho) → ceros reales. Lectura 2: medidores sin lectura o planillas sin llenar → faltantes disfrazados de cero. Para distinguir: cruza con la lluvia de cada semana (si los ceros caen en semanas lluviosas, son creíbles) y mira si se concentran en ciertos predios, medidores o digitadores (si sí, huele a reporte). Es el razonamiento de los camiones, casi palabra por palabra.
- (c) No se sabe desde el resumen. Es atípico —más de cuatro veces el P95—, pero puede ser un predio grande o una fuga. Se marca para verificar; no se borra.
- (d) Si confirmas que los ceros son semanas sin riego, «¿cuánto se gasta en una semana en que se riega?» se responde con la mediana de los registros distintos de cero, y se dice así. Si no lo has confirmado, entregas la mediana de 1.560 m³ junto con el supuesto: «31 % de semanas en cero, sin verificar si son reales». Lo que no haces es entregar 1.180 como «lo típico».
15 · Explícaselo a alguien
Criterios de corrección
- Pide ver la distribución, no solo el promedio.
- Nombra los ceros y da dos explicaciones posibles, sin afirmar cuál es la verdadera.
- Separa lo medido (el 1.440, el 2.500) de lo supuesto (que los ceros sean camiones parados).
- Termina en una acción concreta y verificable: revisar quién anotó, cruzar con la bitácora de operación.
- No acusa a nadie de mentir: ser crítico con los datos no es ser negativo con las personas.
Escríbelo en papel y llévaselo a Datito.
Respuesta correcta y cómo se resuelve
En una frase: el promedio de la flota todavía no sirve de vara, porque puede estar hundido por camiones que marcan 0 litros, y esos ceros pueden ser camiones parados o consumos que nadie anotó.
Respuesta modelo (cinco frases, sin jerga):
«Jefe, el promedio de 1.440 litros junta a todos los camiones de la flota, y antes de compararlo con mis 2.500 necesito ver cuánto gasta cada camión por separado. Si varios camiones aparecen con 0 litros, el promedio baja mucho y cualquier camión que esté trabajando se va a ver caro al lado de ese número. Esos ceros pueden ser camiones que estuvieron parados o consumos que nadie anotó, y con la planilla sola no se puede saber cuál de las dos. Propongo revisar quién registró esos ceros y cruzarlos con la bitácora de operación de esas semanas. Con eso comparamos mis camiones contra los que de verdad estaban trabajando, que es la comparación justa.»
Cómo se arma: (1) qué es lo medido: 1.440 y 2.500; (2) por qué el promedio no basta: la forma de los datos, los ceros; (3) las dos lecturas, sin elegir una; (4) una acción verificable; (5) qué se gana. Una frase por paso. Con los camiones ilustrativos del panel, la diferencia entre las dos lecturas es 74 % contra 4 % sobre la media, pero al jefe le basta la idea, no la cifra [DATITO].
Error típico: escribir «la distribución es asimétrica por imputación de ceros» (jerga que el jefe no puede usar), o afirmar como hecho que los ceros son camiones parados. Eso es una hipótesis y se dice como hipótesis.
Origen: cifras de la lámina 20 [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_05_AnálisisExploratorio.md · lámina 20]; las dos lecturas de los ceros y el paso de ir a ver quién anotó, [FUENTE · Repo: 05_CLASES/transcripciones/04Clase_Fundamentos_en_Ciencia_de_Datos_17_Julio.md · 0:44:12–0:45:38]; la redacción es [DATITO]. Intenta la tuya antes de abrir esto y llévasela a Datito.
Antes de cerrar
temperatura tiene media 78,4 y mediana 78,1. La columna
horas_hasta_falla tiene media 412 y mediana 190.
Sin ningún gráfico: ¿cuál de las dos transformarías antes de modelar, y qué estadístico
reportarías de cada una? Justifica con el criterio, no con el resultado.
Respuesta correcta y cómo se resuelve
Respuesta: transformaría horas_hasta_falla (con logaritmo, como
log1p) y dejaría temperatura como está. De la temperatura reportaría la
media (78,4) con su desviación estándar; de las horas hasta la falla, la mediana (190 h)
con percentiles, no la media de 412.
Cómo se resuelve:
- Compara media y mediana, y compáralas contra la escala. Temperatura: 78,4 − 78,1 = 0,3, apenas un 0,4 % de 78 → prácticamente simétrica. Horas: 412 frente a 190 → la media es 2,2 veces la mediana.
- Decide el lado. En las horas, media > mediana → cola a la derecha: la mayoría de las máquinas falla relativamente pronto y unas pocas duran muchísimo y arrastran el promedio.
- Consecuencia de modelado. Con una cola así el logaritmo acerca media y mediana,
como pasó con
Priceen Melbourne (61,5 % bajo la media en crudo, 52,5 % en logaritmo). La temperatura no tiene nada que corregir. - Consecuencia de reporte. «Una máquina típica dura unas 190 horas» es honesto; 412 horas es un número que la mayoría de las máquinas no alcanza.
Error típico: mirar la diferencia en bruto sin escala («0,3 es poco, 222 es mucho»,
que por casualidad acierta aquí pero falla si cambian las unidades), o transformar las dos «por si
acaso». Otro: creer que el logaritmo siempre ayuda. En tu repositorio, Ridge sobre
log1p(Price) dio R² −17,0: la transformación es una hipótesis que se valida con el modelo, no
una regla. Y sin gráfico lo que tienes es una sospecha fuerte; se confirma con P5 y P95 si te
los dan (sección 7).
Origen: las dos columnas son ilustrativas [DATITO]; el criterio media contra mediana es el de las secciones 4, 7 y 12 de esta página; los porcentajes bajo la media: [FUENTE · Repo: 09_RESULTADOS/predicciones_2017.csv, columna Price]; el R² de Ridge: [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] y [FUENTE · Repo: 07_DATITO/02_REFERENCIA/material.md]. Llévale igual tu respuesta a Datito para que te repregunte.
Cierre de la Clase 3 · EDA: conocer los datos antes de modelar
Qué aprendiste
- Un resumen no determina la forma: hay que mirar la distribución.
- La media se mueve con los extremos; la mediana no.
- La varianza de una muestra divide por n − 1.
- Correlación no es causalidad, y un gráfico puede engañar por su escala.
Qué no debes confundir
- Cantidad que describe una variable (varianza) ≠ cantidad que describe un clasificador (precisión, AUC) (C2 P4).
- Hipótesis ≠ medición (C2 P11).
- Necesario ≠ suficiente: toda falla trae vibración, no toda vibración es falla.
Procedimiento para el papel
- Tipo de variable → gráfico adecuado.
- Centro (media y mediana) y extensión (desviación, percentiles).
- Busca ceros, centinelas y atípicos: ¿error o dato real?
- Escribe hipótesis, no conclusiones.
Viene de: Clase 2 · Datos, filas, columnas, features y target · Sigue: Clase 4 · Calidad, limpieza y preparación de datos
Vuelve a tu activación: En la clase de EDA, el histograma de consumo de camiones tenía muchísimos ceros. ¿Son camiones inactivos o reportes que faltan? ¿Cómo lo decidirías? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Que tiene cola a la derecha: unos pocos valores altos arrastran la media, y la mediana representa mejor el caso típico. [DATITO]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.