Objetivo. Explicar un perceptrón y el ciclo de entrenamiento: forward, costo, backward y actualización.
- Evidencia de aprendizaje: Escribe el ciclo de entrenamiento y hace un forward pass a mano.
- Actividad final: Un paso de descenso de gradiente, a mano.
- Criterio de dominio: Nombra el rol de g (la no linealidad), de η (la tasa de aprendizaje) y de la retropropagación.
Redes neuronales
De la recta que ya sabes ajustar a un modelo que inventa sus propias variables.
Fundamentos de Ciencia de Datos · UdeC · Clase del 21 de agosto
Y una continuidad que conviene ver antes que nada: una neurona no es un objeto nuevo. Es la recta
y = w₀ + w₁·x que ya ajustaste en Melbourne
(clase6_regresion.html), con una cosa más pegada al final.
El profesor construyó exactamente ese puente en clase, y de ahí arrancamos. Vienes de
gradient boosting, el modelo que ganó en
Melbourne; aquí cambia la familia, no el objetivo (minimizar un costo).
1 · La situación: un molino que falla por los dos extremos
Faena de cobre. Un molino SAG muele mineral y consume varios megawatts. Mantención quiere un modelo que avise cuando la operación entra en riesgo, usando dos señales que el molino ya entrega cada segundo:
| Variable | Qué es | Rango típico |
|---|---|---|
carga | Llenado del molino, en % del volumen | 15 – 95 % |
vibracion | Vibración RMS en el descanso | 0,6 – 8,4 mm/s |
Lo importante del caso es cómo falla:
- Carga baja → el molino va casi vacío, las bolas de acero golpean directo el revestimiento. Riesgo.
- Carga alta → sobrecarga, el motor se ahoga. Riesgo.
- Vibración alta → algo está mal pase lo que pase. Riesgo.
[DATITO] Caso construido para este concepto. Los datos son sintéticos y deterministas: el mismo archivo genera siempre los mismos 123 puntos.
2 · El puente: tu recta ya es casi una neurona
Es literal: el profesor rehízo en clase el ejemplo de regresión de la
Clase del 31-jul para mostrar que esa recta es un perceptrón
al que le falta la g [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:43–1:57:04].
Compara las dos cosas que ya sabes escribir:
| Regresión lineal (Clase del 31-jul) | Perceptrón (Clase del 21-ago) | |
|---|---|---|
| Fórmula | ŷ = w₀ + w₁x₁ + … + wnxn |
ŷ = g(w₀ + w₁x₁ + … + wnxn) |
| Qué aprende | Los w | Los w |
| Cómo aprende | Minimiza una función de costo | Minimiza una función de costo |
| Diferencia | Una sola: la g. | |
La ecuación, desarmada
ŷ = g(z)
| x₁…xn | Las entradas. En el molino son dos; en una imagen, cada una puede ser el valor de un píxel, que es como lo planteó el profesor [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:53:42–1:53:46]. | dato |
| 1 | La entrada constante que el profesor dibuja arriba de todo. Existe para que
w₀ tenga de qué multiplicarse. Es el intercepto; en redes se llama
sesgo (bias). | dato |
| w₀…wn | Los pesos. Es lo único que el entrenamiento modifica. | lo aprende el modelo |
| z | La suma ponderada. Hasta aquí seguimos en el mundo de los modelos lineales, como dijo el profesor al armarla [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:01–1:55:03]. | intermedio |
| g | La función de activación. No lineal, y con ella la
salida ŷ pasa a ser una función no lineal de las entradas (sección 3). Es lo
único estructuralmente nuevo de todo el concepto. | lo decides tú |
| ŷ | La salida de la neurona. Puede ser la predicción final, o la entrada de la neurona siguiente. | resultado |
Qué problema resuelve esta ecuación: convierte un vector de mediciones en
un número, de forma que ese número pueda encadenarse con otros iguales. Sin la g
la cadena colapsa, y en la sección 4 vas a verlo colapsar.
3 · Primer control: una neurona, a mano
Abajo tienes una sola neurona con dos entradas, y sus tres pesos en tus manos. Los
puntos azules son operación normal; los rojos, riesgo. La recta es dónde z = 0:
la neurona dice «normal» de un lado y «riesgo» del otro.
Tu objetivo: llegar al 78,0 % de aciertos. Ese es el techo: no existe ninguna recta que lo supere, y lo sé porque están todas probadas. Muévelos todo lo que quieras.
g». Se muestran porque son las habituales.El punto de prueba es el aspa negra. Haz clic en el gráfico para moverla y ver el cálculo con otros números.
g: si cambias de escalón a sigmoide
dejando los tres pesos idénticos, ¿cambia el porcentaje de aciertos?Respuesta correcta y cómo se resuelve (y por qué la recta no pasa del 78,0 %)
Respuesta: no, el porcentaje de aciertos queda igual, porque con
g monótona la frontera de una neurona sigue siendo la recta z = 0.
El porcentaje no cambia al cambiar g, y eso no es un detalle
de implementación: todas estas activaciones son monótonas crecientes, así que
«g(z) por encima del umbral» ocurre exactamente cuando «z por encima
de 0». La frontera de una neurona es la misma recta z = 0 con cualquier
g. Lo que g cambia es el valor que esta neurona le entrega a
la siguiente — y por eso su efecto solo se vuelve visible cuando hay una neurona siguiente.
Y el techo del 78,0 % no es falta de paciencia tuya. Con 123 puntos y la franja sana en el
medio, la mejor recta posible deja fuera uno de los dos extremos. Da igual cómo la inclines:
una recta no encierra una franja. Si quieres el atajo, prueba
w₀ = −0,2, w₁ = 0,8, w₂ = −1,4: 96 aciertos de 123, y
ninguna otra recta hace 97.
Error típico: contestar «sí, porque la sigmoide es no lineal». Es error
porque confunde la forma de la función (sí cambia) con la frontera de decisión
(no cambia si g es monótona): lo desarrolla el recuadro de abajo.
[DATITO] propiedad de las funciones monótonas y datos sintéticos del molino · no linealidad del perceptrón: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:11–1:55:25]
| Afirmación | Veredicto | Por qué |
|---|---|---|
| «El perceptrón es un modelo no lineal» | Verdadera | Lo dijo el profesor (cita de arriba): ŷ = g(w₀ + w₁x₁ + … ) es una función no
lineal de x. Una sigmoide de una suma no es una suma. |
«La frontera de decisión de una neurona con g monótona es una recta» | Verdadera [DATITO] | Si g es monótona, «g(z) sobre el umbral» ocurre exactamente
cuando «z sobre un valor fijo», y z = constante es una recta (un
hiperplano con más entradas). Por eso tu predicción de arriba: cambiar g no mueve
los aciertos. |
tanh ya separa la franja del molino
(falso: su frontera sigue siendo recta). Lo que da fronteras curvas es
apilar neuronas con g no lineal; lo vas a ver en la sección 7.
4 · La función de costo: cuatro puntos, como en la clase
Antes de apilar nada hay que resolver el problema de fondo: ¿cómo se encuentran los
w? El profesor lo mostró con cuatro puntos genéricos
(x₁, y₁) … (x₄, y₄) y una recta, sin valores numéricos
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:56:09–1:56:11 y 1:57:44–1:57:50]
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 14–15].
Aquí les ponemos números: cuatro mediciones inventadas con esa misma
estructura, en unidades del molino (alimentación contra potencia consumida). Cifras
ilustrativas [DATITO].
| Medición | x · alimentación (100 t/h) | y · potencia (MW) |
|---|---|---|
| 1 | 2 | 5 |
| 2 | 4 | 9 |
| 3 | 6 | 12 |
| 4 | 8 | 17 |
Modelo: ŷ = 1 + w·x. El 1 MW es el consumo en vacío [DATITO], y lo dejamos
fijo para que todo el problema quepa en una dimensión. El profesor hizo una simplificación
parecida: dibujó el costo contra un solo w y aclaró que era para simplificar la
explicación, porque el perceptrón real tiene w₀ y w₁
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:02:59–2:03:11].
La función de costo de la clase es el error cuadrático promediado: el error de cada punto al cuadrado y después el promedio de los cuatro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:58:22–1:58:56] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 16–17, «Función de Costo»; el texto extraído solo trae el título, la fórmula la transcribe el formulario de Resumen_Clase8_DL_LLMs_Agentes.md].
| yi − ŷ(xi) | El error de una medición: lo que pasó menos lo que el modelo dijo. | — |
| ( · )² | Al cuadrado, para que un error de −3 pese igual que uno de +3 y no se cancelen entre sí. | lo decides tú |
| (1/n) Σ | Promediar los errores, que es el paso que el profesor hizo en la
pizarra. Promediar y no sumar hace que J no dependa de cuántos datos
tengas. | — |
| J | Un solo número que resume qué tan malo es el modelo completo. Es lo que hay que minimizar. | resultado |
Con estos cuatro puntos, la cuenta cierra en números redondos:
Una parábola. Su mínimo está en w* = 1,95 MW por cada 100 t/h, y ahí abajo
todavía queda J = 0,175 de error: el mínimo de la función de costo no es
cero. Ningún modelo pasa exactamente por los cuatro puntos, y eso está bien.
5 · Segundo control: el descenso de gradiente
La imagen del profesor: partes de un valor cualquiera de w, sueltas una
pelotita y la dejas ir en contra de la pendiente, paso a paso
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:00:35–2:01:09].
El nombre formal es método del gradiente (en su versión estocástica, más
abajo).
| ∂J/∂w | La derivada: el valor de la pendiente en el punto donde estás [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:03:38–2:03:52]. Dice hacia dónde sube el costo. | se calcula |
| − | El signo menos. Por eso bajas en vez de subir. Sin él, el modelo empeoraría a propósito. | — |
| η | La tasa de aprendizaje (eta): cuánto avanzas en cada paso. Muy chica, avanza despacito; muy grande, empieza a saltar de un lado a otro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:22–2:04:34]. | lo decides tú |
| wt | Dónde estás en el paso t. Empieza en un valor cualquiera. | lo aprende el modelo |
Para nuestra parábola la derivada es exacta y la
puedes escribir a mano: ∂J/∂w = 60w − 117.
Respuesta correcta y cómo se resuelve (y el número exacto donde todo se rompe)
Respuesta: en menos pasos, pero no en la mitad: con η = 0,020 el error se
multiplica por −0,2 en cada paso (en vez de +0,4), así que converge antes pero rebotando de un
lado al otro; partiendo de w = 0, para quedar a menos de 0,01 del óptimo necesita
4 pasos en vez de 6.
Sustituyendo la derivada en la regla de actualización:
wt+1 = (1 − 60η)·wt + 117η. El error respecto del óptimo se
multiplica por (1 − 60η) en cada paso. De ahí sale todo:
| η | 1 − 60η | Comportamiento |
|---|---|---|
| 0,005 | +0,70 | Baja derecho, lento |
| 0,010 | +0,40 | Baja derecho, rápido |
| 0,0167 | 0,00 | Llega en UN paso. El óptimo posible |
| 0,020 | −0,20 | Se pasa al otro lado y vuelve. Converge |
| 0,030 | −0,80 | Rebota mucho, converge apenas |
| 0,0333 | −1,00 | El umbral. Oscila para siempre sin acercarse |
| 0,040 | −1,40 | Diverge. Cada paso empeora |
Cuenta de pasos. El error inicial es 0 − 1,95 = −1,95 y en cada paso se
multiplica por (1 − 60η). Para quedar a menos de 0,01:
- η = 0,010: 1,95 · 0,45 ≈ 0,020 (todavía no) y 1,95 · 0,46 ≈ 0,008 → 6 pasos.
- η = 0,020: 1,95 · 0,23 ≈ 0,016 (todavía no) y 1,95 · 0,24 ≈ 0,003 → 4 pasos, con el signo alternando.
Duplicar η de 0,010 a 0,020 hace que pase de bajar derecho a cruzarse de lado y llega antes, pero no en la mitad. Y de 0,0167 hacia arriba, subir η empeora. La relación no es «más η, más rápido»: hay un óptimo y después un acantilado en η = 1/30 ≈ 0,0333. El profesor lo dijo cualitativamente: con una tasa muy grande empieza a saltar de un lado a otro y no llega al óptimo [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:34 y 2:04:53–2:05:05].
Error típico: «el doble de η, la mitad de pasos». Es error porque la
velocidad depende de |1 − 60η|, no de η en proporción: el mismo razonamiento
llevaría a creer que η = 0,040 es todavía mejor, y diverge.
[DATITO] El umbral y los conteos son exactos para esta parábola. En una red real no se pueden calcular, y por eso η se busca probando.
[INFERENCIA] Lo que sigue no se dijo en clase: en la práctica el gradiente se suele calcular sobre un puñado de datos por vez (un mini-lote), no sobre los 123. La dirección sale ruidosa, pero cada paso cuesta mucho menos. Si te preguntan «por qué estocástico» en el certamen, responde primero con la razón del profesor.
«¿Y si la pelotita cae en un mínimo local?» — respuesta correcta y cómo se resuelve
Respuesta: podría pasar, pero en redes con muchísimos parámetros es muy poco probable, porque un mínimo local tendría que ser mínimo en todas las dimensiones a la vez.
Contexto: justo antes, el profesor había advertido que con una tasa de aprendizaje muy baja se puede terminar en un óptimo local y no en el global [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:05:08–2:05:22]. Un compañero preguntó qué pasa entonces. Fíjate en la autocorrección: primero dice «globales» y se corrige a «locales».
Entre medio da el argumento: si un punto fuese mínimo en una dimensión y no en otra, la pelotita se va por la otra dimensión; con dos dimensiones todavía puede pasar, pero estos modelos tienen miles de millones de parámetros. El argumento es de probabilidad, no de garantía: quedar atrapado exige que todas las dimensiones a la vez suban.
Error típico: responder «nunca pasa» o, al revés, «siempre queda atrapada». Lo primero convierte una probabilidad en garantía; lo segundo ignora el argumento de la alta dimensión. Y cuidado con repetir la primera frase del profesor: él mismo corrigió «globales» por «locales».
6 · Conectar muchas: forward, backward, retropropagación
Ahora sí se apilan. La salida de una neurona entra como entrada de la siguiente, y el recorrido tiene dos sentidos con nombre propio:
Forward pass. Los datos van de izquierda a derecha: se multiplican por los pesos, pasan hacia adelante y al final la red dice «perro». Esto es lo que ocurre cada vez que el modelo predice — lo que el profesor llamó inferencia [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:08:23–2:09:05].
Backward pass. Si el modelo predijo «gato» y era un perro, se calcula la función de costo y desde ahí se va modificando la red hacia atrás, neurona por neurona [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:09:09–2:09:36]. El profesor le puso nombre así: «el algoritmo que ajusta el modelo se llama el algoritmo de retro propagación del error porque tomo el error y lo voy propagando hacia atrás para ir mejorando la red» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:09:54–2:10:04].
El nombre de la familia
Redes en las que la información solo va hacia adelante: feedforward neural networks. Es la arquitectura básica, y la que tienes abajo.
7 · Tercer control: entrenar la red, con y sin g
La misma nube de puntos del molino. La misma recta imposible. Ahora con una capa oculta y el descenso de gradiente corriendo de verdad en tu navegador: 4.000 pasos, retropropagación incluida.
g = identidad —o sea,
sin no linealidad en la capa oculta—, ¿qué frontera dibuja la red entrenada?tanh
activado, baja las neuronas ocultas de 4 a 1. ¿Resuelve el problema, ya que
la no linealidad sigue ahí?Respuesta correcta y cómo se resuelve (las dos predicciones de esta sección)
Respuesta 1: con g = identidad la red entrenada dibuja una
recta, igual que una sola neurona, con cualquier número de capas y cualquier
semilla (70,7 %).
Respuesta 2: no; con tanh y una sola neurona
oculta llega a 73,2 %: la no linealidad está, pero falta capacidad para hacer los dos cortes que
encierran la franja (con 2 neuronas sube a 96,7 %).
Los números que deberías haber visto, y qué separa cada uno:
| Configuración | Aciertos | Qué dibuja |
|---|---|---|
| Responder siempre «riesgo» | 61,0 % | Nada. Es el piso |
| Identidad · cualquier n.º de neuronas · cualquier semilla | 70,7 % | Una recta |
| tanh · 1 neurona · cualquier semilla | 73,2 % | Una curva suave, un solo corte |
| tanh · 2 neuronas · cualquier semilla | 96,7 % | Dos cortes: ya encierra por dos lados |
| tanh · 3 neuronas | 98,4 – 100 % | Casi cierra la franja. Aquí sí depende de la semilla |
| tanh · 4 neuronas o más | 100 % | La franja completa |
Ese «depende de la semilla» de la fila de 3 neuronas es la otra cara de la moneda: en cuanto hay no linealidad, la función de costo deja de tener un único mínimo y de dónde partas importa. Con identidad no importaba nunca.
Lo más revelador de la tabla está en la columna de la izquierda. Con identidad, todas las semillas y todos los anchos dan exactamente 70,7 %. No es coincidencia: componer funciones lineales da otra función lineal, así que la red de 8 neuronas y la de 1 son el mismo modelo, y ese modelo tiene un solo óptimo. Arranque donde arranque, la pelotita cae al mismo lugar.
El profesor lo dijo respondiendo a un compañero que sostenía que, al final, todo eran funciones lineales:
Errores típicos: (1) «más capas dan una curva aunque sean lineales»: falso,
la composición de funciones lineales es lineal; (2) «basta con tener la g»:
falso, una neurona hace un solo corte y la franja necesita al menos dos.
Porcentajes: [DATITO] datos sintéticos del molino, entrenamiento en este navegador · colapso de lo lineal: cita de arriba.
«Pero a mano llegué a 78,0 % con una recta, y la red lineal saca 70,7 %. ¿La red es peor?» — respuesta correcta y cómo se resuelve
Respuesta: no es peor, optimiza otra cosa: el descenso de gradiente minimiza la función de costo, no el porcentaje de aciertos, y la recta que minimiza el costo no tiene por qué ser la que más acierta.
Es una distinción que conviene tener guardada: el modelo no minimiza los aciertos. Minimiza la función de costo.
| Tú, a mano | El descenso de gradiente | |
|---|---|---|
| Qué optimizas | El % de aciertos, moviendo sliders hasta que sube | J, la entropía cruzada [DATITO] |
| Cómo trata un punto mal clasificado | Todos pesan 1 | Cuanto más seguro y más equivocado, más castigo |
| Resultado | 78,0 % | 70,7 %, con J mínimo |
La recta de 78,0 % acierta más, pero se equivoca con mucha confianza en unos pocos puntos
extremos, y eso la penaliza en J. La recta de 70,7 % prefiere equivocarse «con
dudas». Ambas son la respuesta correcta a preguntas distintas.
Esto no es una rareza del ejemplo: es la razón por la que un modelo puede entrenar bien y evaluar mal en la métrica que al cliente le importa. En Galaxy Zoo lo tienes en tus propios datos: la métrica oficial era F1-macro, y ningún clasificador la minimiza directamente. [FUENTE · Repo: 02_DATOS/00_LEEME.md]
Y fíjate en lo que no cambia con esto: ni 78,0 % ni 70,7 % se acercan al 100 %. El techo de la recta es el techo de la recta, se mida como se mida.
Error típico: concluir que «el entrenamiento falló» porque la métrica final es menor que la que lograste a mano. Es error porque compara dos óptimos de objetivos distintos: costo contra aciertos.
[DATITO] datos sintéticos del molino · F1-macro de Galaxy Zoo: [FUENTE · Repo: 02_DATOS/00_LEEME.md]
No linealidad (la g) | Capacidad (n.º de neuronas) | |
|---|---|---|
| Qué permite | Que apilar sirva de algo | Cuántos cortes puede hacer la frontera |
| Si falta | 70,7 % entrenada, 78,0 % como techo teórico. Ni 8 neuronas lo arreglan | 73,2 % con 1 neurona. La g está, pero no alcanza |
| Si sobra | No aplica | Sobreajuste. Más capacidad = más brecha train/test |
8 · El camino inverso: te dan la ecuación
En una prueba no te van a pedir que entrenes nada. Te van a entregar una neurona escrita y te van a preguntar qué hace. Practícalo al revés. Esta neurona vigila un chancador:
g = sigmoide · ŷ > 0,5 significa «seguir operando»
Responde antes de abrir: ¿qué regla física codifica? ¿Qué pasa con ŷ si el
amperaje sube? ¿Y si sube 1 °C la temperatura? ¿Cuál de las dos señales pesa más en la
decisión, y por qué no basta con mirar el número del peso?
Respuesta correcta y cómo se resuelve
Respuesta: codifica «más caliente o más cargado es peor»; si sube el
amperaje, z baja 0,30 por cada unidad y ŷ se acerca a «detener»; si
sube 1 °C, z baja 0,05; y con estos datos no se puede decir cuál
señal pesa más, porque los pesos solo se comparan si las entradas están en la misma escala.
- Los signos. Ambos pesos son negativos: subir cualquiera de las dos
señales baja
z, bajaŷ, y acerca la decisión a «detener». La neurona codifica «más caliente o más cargado = peor». Los signos te dan la dirección de cada variable sin hacer una sola cuenta. - El sesgo. El 2,4 es el punto de partida con todo en cero. Es el «beneficio de la duda» que la máquina tiene antes de que ninguna señal opine.
- La frontera. Poner
ŷ = 0,5es ponerz = 0, o sea0,05·temp + 0,30·amperaje = 2,4. Es una recta, y sobre ella la máquina está justo en el límite. - La trampa de la comparación. 0,30 > 0,05, pero eso no demuestra que el amperaje importe seis veces más: la temperatura se mide en decenas de grados y el amperaje quizá en unidades. Un peso solo es comparable con otro si las entradas están en la misma escala. Esa es la misma razón por la que las redes exigen normalizar, y es una comparación que el formato de certamen castiga.
- El límite. Es una neurona: su frontera es una recta. Si el
chancador también fallara por amperaje demasiado bajo, esta ecuación no podría
representarlo. Harían falta al menos dos neuronas y una
gno lineal.
Error típico: «el amperaje importa seis veces más porque 0,30 / 0,05 = 6».
Es error porque ignora las unidades: con la temperatura en decenas de grados, 0,05 por grado
puede mover z tanto o más que 0,30 por amperio.
[DATITO] ecuación y caso del chancador inventados para este ejercicio
9 · Lo que cambia de verdad: el modelo elige las variables
En el aprendizaje clásico primero calculas características y después se las pasas a un modelo como un support vector machine o un random forest [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:14–1:50:38]. Y el contraste:
Esto no es una mejora de rendimiento: es un cambio en quién decide qué se mide.
| Flujo clásico (todo el curso hasta aquí) | Red profunda | |
|---|---|---|
| Entrada | Una tabla de variables que alguien eligió | La señal cruda: píxeles, audio, texto |
| Quién elige las variables | Tú, antes de entrenar | El entrenamiento, como parte del ajuste |
| Dónde está el trabajo humano | En pensar qué medir | En la arquitectura, los datos y el η |
| Se puede auditar | Sí: cada columna tiene nombre | Con dificultad: las variables internas no tienen nombre |
Está en tus propios datos, y probablemente no lo habías visto así
Mira las columnas del Galaxy Zoo con el que trabajaste:
Son 86 features numéricas sobre 1.000 filas de entrenamiento [FUENTE · Repo: 02_DATOS/00_LEEME.md]. Magnitudes fotométricas, corrimiento al rojo, tamaños. Y ahora la observación que importa: esas 86 columnas no son la galaxia. Son mediciones que un astrónomo decidió sacarle a la imagen. Alguien miró una foto del cielo y resolvió que el brillo en cinco bandas era lo relevante.
El desafío Galaxy Zoo original se corrió sobre las imágenes crudas y lo ganó una red convolucional, que nunca supo qué era una «magnitud psfMag_u» y aun así aprendió a distinguir espirales de elípticas [INFERENCIA]. Tú recibiste el problema ya resuelto por la mitad: la extracción de características ya venía hecha. Eso es exactamente el flujo clásico de la tabla de arriba.
Fíjate en qué entraba a esos modelos: una tabla con columnas ya elegidas por ti, el flujo clásico de la tabla de arriba. Tu pregunta: en tus modelos de Melbourne tú elegiste las features; ¿qué haría distinto una red neuronal con ellas, y habría ganado ahí? Ojo: en el repositorio no se entrenó ninguna red sobre Melbourne [NO EVIDENCIADO], así que esa comparación no está medida.
Respuesta correcta y cómo se resuelve
Respuesta: una red no se limita a combinar las features que le das: aprende en sus capas ocultas variables intermedias propias a partir de ellas (o del dato crudo, si se lo das); en Melbourne, con una tabla ya elaborada y 6.336 filas, esa ventaja tiene poco dónde operar, y lo esperable es que el boosting gane, aunque no está medido.
- Qué hace distinto: en el flujo clásico tú decides qué se mide y el modelo solo pondera; en una red, cada neurona oculta es una variable nueva que el entrenamiento construye (cita de arriba).
- Dónde rinde eso: con señal cruda (píxeles, texto) y muchos datos; con pocos datos, los clásicos rinden mejor (lámina 8).
- Melbourne: columnas ya elegidas y 6.336 filas de entrenamiento. Lo esperable es que el boosting gane, y el profesor advierte que un random forest supera a una red compleja más seguido de lo que uno cree (desarrollo en dl_llm_agentes.html#deep-learning).
- Límite: es una expectativa fundada, no una medición.
Error típico: «la red usa las mismas features, así que da lo mismo». Es error porque la red no se queda con tus columnas: las recombina en variables internas; que eso sirva o no depende de los datos.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:29–1:36:34] [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] · aplicación a Melbourne [INFERENCIA]
10 · La distinción que el certamen ya te cobró
En el Certamen 2, dos de las diez preguntas numeradas fueron de este bloque (P5 y P6). La P6 es la que toca redes directamente:
Lo que decide es la cláusula «mediante el uso de redes neuronales»: de cada alternativa pregúntate si es un avance producido con redes, o algo que existía antes o que a lo más las hizo posibles. Una de las alternativas es verdadera como afirmación histórica y falsa como respuesta a esta pregunta. El análisis completo, con la respuesta y las láminas que la respaldan, está en certamen_2.html#p6; el ejercicio para clasificar ítems parecidos, en dl_llm_agentes.html#deep-learning.
Respuesta correcta y cómo se resuelve
Respuesta: son correctas la 1 (procesamiento del lenguaje natural) y la 4 (detección de objetos en imágenes); la nube y las bases de datos relacionales no son revoluciones mediante redes neuronales.
| Alternativa | ¿Avance mediante redes? | Respaldo |
|---|---|---|
| Procesamiento del lenguaje natural | Sí | Láminas 33–34: GLUE y «Transformers in NLP» |
| Computación en la nube | No. A lo más, condición que permitió entrenarlas [INFERENCIA] | La lámina 65 atribuye el boom a redes, datos y GPU; la nube no sale de las redes |
| Bases de datos relacionales | No | Anterior y ajena a las redes [INFERENCIA] |
| Detección de objetos en imágenes | Sí | Láminas 6–7: ImageNet, 1,2 M imágenes de entrenamiento y 1000 categorías |
Error típico: marcar la nube «porque sin ella no habría IA moderna». Es verdadera como historia y falsa como respuesta: el enunciado acota a avances «mediante el uso de redes neuronales».
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6–7, 33–34 y 65] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P6]
La ficha original de esa pregunta en tu expediente dice, sin adornos: «No hay una sola red neuronal en todo el código del repositorio», y en su primera versión la marcaba INSUFICIENTE. La síntesis vigente del mismo documento, actualizada tras la guía de estudio, deja P5 y P6 en PARCIAL [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · §2 Síntesis cuantitativa, l. 139]. Este artefacto no cambia eso —para eso hay que entrenar una red— pero cierra el lado conceptual.
11 · Procedimiento a mano, para una prueba escrita
Sin computador, con lápiz. Dos procedimientos cortos que cubren casi todo lo que se puede preguntar.
A · Un forward pass
- Escribe las entradas con el 1 adelante:
(1, x₁, x₂). - Multiplica cada una por su peso y suma todo. Eso es
z. - Aplica
gaz. Solo az, no a cada término. - Si hay más capas, ese resultado es una entrada de la capa siguiente. Vuelve al paso 1.
- Interpreta la salida en el lenguaje del problema: no «0,82», sino «82 % de probabilidad de operación normal».
B · Un paso de descenso de gradiente
- Escribe la función de costo con los números del enunciado.
- Deriva respecto del peso que te piden. Evalúala en el
wactual. - Aplica
wnuevo = wviejo − η · (derivada). Cuida el signo dos veces: el de la resta y el de la derivada. - Verifica que
Jbajó. Si subió, o te equivocaste de signo o el η es demasiado grande — y ambas son respuestas válidas si el enunciado las pide.
Ejercicio: con J(w) = 0,175 + 30(w − 1,95)², arrancando en
w = 0 con η = 0,01, haz a mano cuatro pasos de descenso de gradiente.
¿Dónde quedas y cuánto vale J?
Respuesta correcta y cómo se resuelve
Respuesta: después de cuatro pasos w ≈ 1,900 y
J ≈ 0,25; se acerca a w* = 1,95 y a J = 0,175, nunca a
cero.
J(w) = 0,175 + 30(w − 1,95)² · ∂J/∂w = 60w − 117 · arrancas en
w = 0 con η = 0,01.
| t | wt | ∂J/∂w | η · ∂J/∂w | wt+1 | J(wt+1) |
|---|---|---|---|---|---|
| 0 | 0,000 | −117,00 | −1,170 | 1,170 | 18,43 |
| 1 | 1,170 | −46,80 | −0,468 | 1,638 | 3,10 |
| 2 | 1,638 | −18,72 | −0,187 | 1,825 | 0,64 |
| 3 | 1,825 | −7,49 | −0,075 | 1,900 | 0,25 |
La derivada es negativa, así que −η·(negativo) es positivo y w
sube hacia 1,95. Fíjate en que los incrementos se achican solos: cerca del mínimo la
pendiente es pequeña y el algoritmo frena sin que nadie se lo pida. Y J se acerca
a 0,175, nunca a cero.
Error típico: escribir w + η·∂J/∂w (signo cambiado): con la
derivada negativa, w bajaría a −1,17 y J subiría a 292,2. Si
J sube en tu tabla, revisa el signo antes que nada.
[DATITO] parábola construida desde las cuatro mediciones ilustrativas de la sección 4 · regla de actualización: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:06–2:04:20]
C · Transferencia: un invernadero
[DATITO] Invernadero de tomates con dos sensores: temperatura y humedad relativa. El cultivo
está sano en una franja de temperatura (ni helada ni golpe de calor) y con la humedad bajo un
umbral (sobre él aparecen hongos). Responde antes de abrir: ¿basta una neurona con sigmoide
para marcar «sano / en riesgo»? ¿Cuántas neuronas ocultas pedirías como mínimo, y qué
g? ¿Qué pasa si pones esas neuronas con g = identidad?
Respuesta correcta y cómo se resuelve
Respuesta: una neurona no basta; hacen falta del orden de tres neuronas
ocultas con g no lineal (una por cada lado de la zona sana), y con
g = identidad ninguna cantidad sirve, porque todo colapsa a una recta.
- Una neurona no basta. Su salida es no lineal, pero su frontera de decisión es una recta, y la zona sana está cerrada por tres lados: frío, calor y humedad alta.
- Mínimo, del orden de tres neuronas ocultas con
gno lineal: un corte por cada lado de la zona. Es el mismo patrón del molino, donde dos cortes ya subían a 96,7 % y cuatro cerraban la franja. - Con identidad no sirve ninguna cantidad: la composición colapsa a un modelo lineal y vuelves a una sola recta.
- Lo que no puedes decir sin validar: que tres sean suficientes con datos reales. Eso lo decide el error en validación, no el dibujo.
Error típico: «con sigmoide ya es no lineal, basta una». Es error porque confunde la no linealidad de la función con la forma de la frontera, y además ignora la capacidad: cada neurona aporta un corte.
[DATITO] caso del invernadero; patrón de cortes tomado del panel de la sección 7
D · Producción: explícaselo a alguien
Explícale a un compañero, en cinco líneas y sin usar la palabra «neurona», por qué el perceptrón es un modelo no lineal y aun así una sola unidad no puede aislar la franja sana del molino. Escríbelo antes de abrir la respuesta y llévalo a Datito.
Respuesta correcta y cómo se resuelve
Respuesta: la unidad es no lineal porque aplica una función curva
g a una suma ponderada, pero su frontera de decisión sigue siendo recta, y una recta
no puede encerrar una franja central.
Respuesta modelo (cinco líneas):
«La unidad suma las entradas con pesos y a esa suma le aplica una curva, como una sigmoide; por eso su salida no es una línea recta de las entradas. Pero decide “normal” o “riesgo” según si esa suma pasa un umbral, y todos los puntos donde la suma vale exactamente el umbral forman una recta. En el molino la zona sana es una franja rodeada de riesgo por dos lados, y una recta solo parte el plano en dos. Para encerrar la franja hay que combinar varias unidades, cada una con su recta, y juntar sus salidas con otra curva; sin la curva, combinarlas daría otra recta.»
Criterios con que Datito lo revisa: separa la función (no lineal por la
g) de la frontera (recta si g es monótona); dice qué agrega apilar;
dice por qué sin g apilar no sirve; distingue no linealidad de capacidad.
Error típico: escribir «no puede porque es lineal». Es error: el profesor corrigió justamente eso; la unidad es no lineal y el límite está en su frontera.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:54:04–1:55:25] · frontera recta con g monótona [DATITO]
12 · Errores que este formato castiga
- Decir que el perceptrón es lineal. Falso:
ŷ = g(z)congno lineal es una función no lineal de las entradas, y el profesor lo corrigió en clase (sección 3). Y el error opuesto: creer que por eso una sola neurona ya separa clases que una recta no separa. Congmonótona su frontera de decisión sigue siendo recta [DATITO]; las fronteras curvas aparecen al apilar neuronas congno lineal, porque singla composición colapsa a un modelo lineal. - Tratar η como «velocidad». Pasado el óptimo, subirlo empeora; pasado el umbral, diverge. En el ejemplo de arriba ese umbral es exacto: η = 1/30.
- Retropropagación: las dos formulaciones de la clase valen. El profesor la presentó como «el algoritmo que ajusta el modelo» (propaga el error hacia atrás para mejorar la red, 2:09:54–2:10:04) y después precisó el reparto: el backward calcula los gradientes y el descenso de gradiente da el paso (2:10:58–2:11:14) [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:09:54–2:11:14]. Si escribes, usa la segunda porque es más precisa, pero no marques la primera como falsa. Lo que sí es error: presentar la retropropagación como una alternativa al descenso de gradiente, o como algo que funciona sin función de costo.
- Decir «más capas = mejor». Más capacidad es más sobreajuste, y tienes el número propio: Random Forest, 0,2314 de brecha en Melbourne.
- Contar como «avance mediante redes» lo que no salió de ellas. La lámina 65 atribuye el boom a tres factores (redes, muchos datos, GPU); pero una pregunta que dice «mediante el uso de redes neuronales» pide áreas donde las redes produjeron el salto (visión, lenguaje), no la infraestructura que las hizo posibles. Es la P6.
- Comparar dos pesos sin mirar la escala de sus entradas. 0,30 contra 0,05 no dice nada si una variable va en decenas y la otra en unidades.
- Esperar que J llegue a cero. El mínimo de la función de costo casi nunca es cero, y si lo es con datos reales, sospecha de sobreajuste.
- Confundir la función de costo con la métrica. El entrenamiento minimiza
J; tú juzgas con exactitud, F1 o MAE. No son lo mismo, y el modelo que minimizaJpuede no ser el que maximiza tu métrica. Lo tienes en el panel de arriba: 78,0 % a mano contra 70,7 % entrenada, sobre la misma familia de rectas.
13 · Qué tendría que verte hacer para darlo por comprendido
| Evidencia | Qué tendrías que producir |
|---|---|
| EXPLICAR | Decir con tus palabras, sin la palabra «neurona», por qué apilar modelos lineales no sirve — y por qué eso no se arregla poniendo más. |
| APLICAR | Hacer a mano un forward pass de dos entradas y un paso de descenso de gradiente, con los signos correctos, sin mirar esta página. |
| TRANSFERIR | Tomar un problema nuevo —uno de esos donde la respuesta sana está en el medio y el riesgo en los dos extremos— y decidir, argumentando, si conviene una red o un boosting. Y saber cuándo la respuesta es «boosting», como en Melbourne. |
Cierre de la Clase 17 · Redes neuronales
Qué aprendiste
- Un perceptrón es una regresión más una función g no lineal.
- Entrenar es minimizar el costo con el gradiente.
- Con η grande el descenso salta; con η chico avanza despacio.
- La retropropagación calcula los gradientes capa por capa.
Qué no debes confundir
- ŷ no lineal en x ≠ frontera de una sola neurona, que sigue siendo recta.
- Forward ≠ backward.
Procedimiento para el papel
- Forward: calcula ŷ.
- Calcula el costo.
- Backward: calcula los gradientes.
- Actualiza los pesos y repite.
Viene de: Clase 16 · Random Forest y ensambles · Sigue: Clase 18 · Deep learning, LLM y agentes
Vuelve a tu activación: Tu regresión lineal ya es casi una neurona. ¿Qué le falta? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
No: g lo transforma en un modelo no lineal en x [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:11]. Aun así, con una sola neurona y g monótona, la frontera de decisión es recta [DATITO].
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.