Unidad 5 · Modelos más potentesClase 17 de 23
Clase 17 · Redes neuronales

Objetivo. Explicar un perceptrón y el ciclo de entrenamiento: forward, costo, backward y actualización.

Ficha Bloom · Comprender
  • Evidencia de aprendizaje: Escribe el ciclo de entrenamiento y hace un forward pass a mano.
  • Actividad final: Un paso de descenso de gradiente, a mano.
  • Criterio de dominio: Nombra el rol de g (la no linealidad), de η (la tasa de aprendizaje) y de la retropropagación.
Activación. Tu regresión lineal ya es casi una neurona. ¿Qué le falta? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Redes neuronales

De la recta que ya sabes ajustar a un modelo que inventa sus propias variables.
Fundamentos de Ciencia de Datos · UdeC · Clase del 21 de agosto

Regresión → Random Forest → Gradient Boosting → Redes neuronales → Deep learning → LLM → Agentes
Dónde estás. Concepto 18 de 21. Es el último cambio de paradigma del curso: en los 17 anteriores tú elegías las variables y el modelo decidía cómo combinarlas. Desde aquí el modelo también elige las variables. Los tres conceptos que vienen después —deep learning, LLM y agentes— son consecuencias de este. Si este queda a medias, esos tres quedan a medias.

Y una continuidad que conviene ver antes que nada: una neurona no es un objeto nuevo. Es la recta y = w₀ + w₁·x que ya ajustaste en Melbourne (clase6_regresion.html), con una cosa más pegada al final. El profesor construyó exactamente ese puente en clase, y de ahí arrancamos. Vienes de gradient boosting, el modelo que ganó en Melbourne; aquí cambia la familia, no el objetivo (minimizar un costo).

1 · La situación: un molino que falla por los dos extremos

Faena de cobre. Un molino SAG muele mineral y consume varios megawatts. Mantención quiere un modelo que avise cuando la operación entra en riesgo, usando dos señales que el molino ya entrega cada segundo:

VariableQué esRango típico
cargaLlenado del molino, en % del volumen15 – 95 %
vibracionVibración RMS en el descanso0,6 – 8,4 mm/s

Lo importante del caso es cómo falla:

El detalle que decide todo lo que sigue: los modos de falla están en extremos opuestos. La operación sana es una franja central, y todo lo que la rodea es riesgo. Eso significa que la frontera entre «normal» y «riesgo» encierra una región. Una recta no encierra nada: la recta parte el plano en dos mitades infinitas.

[DATITO] Caso construido para este concepto. Los datos son sintéticos y deterministas: el mismo archivo genera siempre los mismos 123 puntos.

2 · El puente: tu recta ya es casi una neurona

«fíjense que este modelo que yo acabo de armar que el ⟨w₀⟩ más el ⟨w₁⟩ por x es un perceptron […] ahora es un modelo lineal lo único que le está faltando es la función no lineal para transformarse en un perceptron propiamente tal» Clase del 21-ago · 1:56:58–1:57:27 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA] (el ASR escribe «doble de 0» y «doble de 1»)

Es literal: el profesor rehízo en clase el ejemplo de regresión de la Clase del 31-jul para mostrar que esa recta es un perceptrón al que le falta la g [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:43–1:57:04]. Compara las dos cosas que ya sabes escribir:

Regresión lineal (Clase del 31-jul)Perceptrón (Clase del 21-ago)
Fórmula ŷ = w₀ + w₁x₁ + … + wnxn ŷ = g(w₀ + w₁x₁ + … + wnxn)
Qué aprendeLos wLos w
Cómo aprendeMinimiza una función de costoMinimiza una función de costo
DiferenciaUna sola: la g.

La ecuación, desarmada

z = w₀·1 + w₁x₁ + w₂x₂ + … + wnxn
ŷ = g(z)
x₁…xnLas entradas. En el molino son dos; en una imagen, cada una puede ser el valor de un píxel, que es como lo planteó el profesor [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:53:42–1:53:46].dato
1La entrada constante que el profesor dibuja arriba de todo. Existe para que w₀ tenga de qué multiplicarse. Es el intercepto; en redes se llama sesgo (bias).dato
w₀…wnLos pesos. Es lo único que el entrenamiento modifica.lo aprende el modelo
zLa suma ponderada. Hasta aquí seguimos en el mundo de los modelos lineales, como dijo el profesor al armarla [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:01–1:55:03].intermedio
gLa función de activación. No lineal, y con ella la salida ŷ pasa a ser una función no lineal de las entradas (sección 3). Es lo único estructuralmente nuevo de todo el concepto.lo decides tú
ŷLa salida de la neurona. Puede ser la predicción final, o la entrada de la neurona siguiente.resultado

Qué problema resuelve esta ecuación: convierte un vector de mediciones en un número, de forma que ese número pueda encadenarse con otros iguales. Sin la g la cadena colapsa, y en la sección 4 vas a verlo colapsar.

3 · Primer control: una neurona, a mano

Abajo tienes una sola neurona con dos entradas, y sus tres pesos en tus manos. Los puntos azules son operación normal; los rojos, riesgo. La recta es dónde z = 0: la neurona dice «normal» de un lado y «riesgo» del otro.

Tu objetivo: llegar al 78,0 % de aciertos. Ese es el techo: no existe ninguna recta que lo supere, y lo sé porque están todas probadas. Muévelos todo lo que quieras.

0,5 -1,5 -1,5
Función de activación g · [DATITO] los nombres escalón, sigmoide, tanh y ReLU no aparecen en las 14 transcripciones disponibles al 2026-09-21 ni en el texto extraído de las láminas de FCD-08: en clase solo se dijo «función no lineal g». Se muestran porque son las habituales.
—
aciertos
—
z del punto de prueba
—
g(z) del punto
78,0 %
el techo de cualquier recta

El punto de prueba es el aspa negra. Haz clic en el gráfico para moverla y ver el cálculo con otros números.

Antes de tocar el selector de g: si cambias de escalón a sigmoide dejando los tres pesos idénticos, ¿cambia el porcentaje de aciertos?
Respuesta correcta y cómo se resuelve (y por qué la recta no pasa del 78,0 %)

Respuesta: no, el porcentaje de aciertos queda igual, porque con g monótona la frontera de una neurona sigue siendo la recta z = 0.

El porcentaje no cambia al cambiar g, y eso no es un detalle de implementación: todas estas activaciones son monótonas crecientes, así que «g(z) por encima del umbral» ocurre exactamente cuando «z por encima de 0». La frontera de una neurona es la misma recta z = 0 con cualquier g. Lo que g cambia es el valor que esta neurona le entrega a la siguiente — y por eso su efecto solo se vuelve visible cuando hay una neurona siguiente.

Y el techo del 78,0 % no es falta de paciencia tuya. Con 123 puntos y la franja sana en el medio, la mejor recta posible deja fuera uno de los dos extremos. Da igual cómo la inclines: una recta no encierra una franja. Si quieres el atajo, prueba w₀ = −0,2, w₁ = 0,8, w₂ = −1,4: 96 aciertos de 123, y ninguna otra recta hace 97.

Error típico: contestar «sí, porque la sigmoide es no lineal». Es error porque confunde la forma de la función (sí cambia) con la frontera de decisión (no cambia si g es monótona): lo desarrolla el recuadro de abajo.

[DATITO] propiedad de las funciones monótonas y datos sintéticos del molino · no linealidad del perceptrón: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:11–1:55:25]

«por una función no lineal que es este g y entonces este g transforma el perceptron en un modelo no lineal y entonces el y que es la salida va a ser una función no lineal del input» Clase del 21-ago · 1:55:11–1:55:25 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]
Distinción de certamen probable: qué es no lineal y qué sigue siendo recto. El apunte híbrido de la clase la marca como pregunta de examen probable [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase8_DL_LLMs_Agentes.md · páginas 10 y 36 del resumen]. Son dos afirmaciones distintas y las dos son ciertas:
AfirmaciónVeredictoPor qué
«El perceptrón es un modelo no lineal»Verdadera Lo dijo el profesor (cita de arriba): ŷ = g(w₀ + w₁x₁ + … ) es una función no lineal de x. Una sigmoide de una suma no es una suma.
«La frontera de decisión de una neurona con g monótona es una recta»Verdadera [DATITO] Si g es monótona, «g(z) sobre el umbral» ocurre exactamente cuando «z sobre un valor fijo», y z = constante es una recta (un hiperplano con más entradas). Por eso tu predicción de arriba: cambiar g no mueve los aciertos.
La confusión castigable es mezclarlas: decir que el perceptrón «es lineal» (falso: lo corrigió el profesor) o que una sola neurona con tanh ya separa la franja del molino (falso: su frontera sigue siendo recta). Lo que da fronteras curvas es apilar neuronas con g no lineal; lo vas a ver en la sección 7.

4 · La función de costo: cuatro puntos, como en la clase

Antes de apilar nada hay que resolver el problema de fondo: ¿cómo se encuentran los w? El profesor lo mostró con cuatro puntos genéricos (x₁, y₁) … (x₄, y₄) y una recta, sin valores numéricos [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:56:09–1:56:11 y 1:57:44–1:57:50] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 14–15]. Aquí les ponemos números: cuatro mediciones inventadas con esa misma estructura, en unidades del molino (alimentación contra potencia consumida). Cifras ilustrativas [DATITO].

Mediciónx · alimentación (100 t/h)y · potencia (MW)
125
249
3612
4817

Modelo: ŷ = 1 + w·x. El 1 MW es el consumo en vacío [DATITO], y lo dejamos fijo para que todo el problema quepa en una dimensión. El profesor hizo una simplificación parecida: dibujó el costo contra un solo w y aclaró que era para simplificar la explicación, porque el perceptrón real tiene w₀ y w₁ [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:02:59–2:03:11].

La función de costo de la clase es el error cuadrático promediado: el error de cada punto al cuadrado y después el promedio de los cuatro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:58:22–1:58:56] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 16–17, «Función de Costo»; el texto extraído solo trae el título, la fórmula la transcribe el formulario de Resumen_Clase8_DL_LLMs_Agentes.md].

J(w) = (1/n) · Σi ( yi − ŷ(xi) )²
yi − ŷ(xi)El error de una medición: lo que pasó menos lo que el modelo dijo.—
( · )²Al cuadrado, para que un error de −3 pese igual que uno de +3 y no se cancelen entre sí.lo decides tú
(1/n) ΣPromediar los errores, que es el paso que el profesor hizo en la pizarra. Promediar y no sumar hace que J no dependa de cuántos datos tengas.—
JUn solo número que resume qué tan malo es el modelo completo. Es lo que hay que minimizar.resultado

Con estos cuatro puntos, la cuenta cierra en números redondos:

J(w) = 0,175 + 30 · (w − 1,95)²

Una parábola. Su mínimo está en w* = 1,95 MW por cada 100 t/h, y ahí abajo todavía queda J = 0,175 de error: el mínimo de la función de costo no es cero. Ningún modelo pasa exactamente por los cuatro puntos, y eso está bien.

5 · Segundo control: el descenso de gradiente

La imagen del profesor: partes de un valor cualquiera de w, sueltas una pelotita y la dejas ir en contra de la pendiente, paso a paso [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:00:35–2:01:09]. El nombre formal es método del gradiente (en su versión estocástica, más abajo).

wt+1 = wt − η · ∂J/∂w |wt
∂J/∂wLa derivada: el valor de la pendiente en el punto donde estás [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:03:38–2:03:52]. Dice hacia dónde sube el costo.se calcula
−El signo menos. Por eso bajas en vez de subir. Sin él, el modelo empeoraría a propósito.—
ηLa tasa de aprendizaje (eta): cuánto avanzas en cada paso. Muy chica, avanza despacito; muy grande, empieza a saltar de un lado a otro [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:22–2:04:34].lo decides tú
wtDónde estás en el paso t. Empieza en un valor cualquiera.lo aprende el modelo

Para nuestra parábola la derivada es exacta y la puedes escribir a mano: ∂J/∂w = 60w − 117.

Con η = 0,010 el modelo converge. Si pones el doble, η = 0,020, ¿en cuántos pasos llega?
0,010 0,00
0,00
w actual
114,25
J(w)
0
pasos dados
—
estado
Respuesta correcta y cómo se resuelve (y el número exacto donde todo se rompe)

Respuesta: en menos pasos, pero no en la mitad: con η = 0,020 el error se multiplica por −0,2 en cada paso (en vez de +0,4), así que converge antes pero rebotando de un lado al otro; partiendo de w = 0, para quedar a menos de 0,01 del óptimo necesita 4 pasos en vez de 6.

Sustituyendo la derivada en la regla de actualización: wt+1 = (1 − 60η)·wt + 117η. El error respecto del óptimo se multiplica por (1 − 60η) en cada paso. De ahí sale todo:

η1 − 60ηComportamiento
0,005+0,70Baja derecho, lento
0,010+0,40Baja derecho, rápido
0,01670,00Llega en UN paso. El óptimo posible
0,020−0,20Se pasa al otro lado y vuelve. Converge
0,030−0,80Rebota mucho, converge apenas
0,0333−1,00El umbral. Oscila para siempre sin acercarse
0,040−1,40Diverge. Cada paso empeora

Cuenta de pasos. El error inicial es 0 − 1,95 = −1,95 y en cada paso se multiplica por (1 − 60η). Para quedar a menos de 0,01:

Duplicar η de 0,010 a 0,020 hace que pase de bajar derecho a cruzarse de lado y llega antes, pero no en la mitad. Y de 0,0167 hacia arriba, subir η empeora. La relación no es «más η, más rápido»: hay un óptimo y después un acantilado en η = 1/30 ≈ 0,0333. El profesor lo dijo cualitativamente: con una tasa muy grande empieza a saltar de un lado a otro y no llega al óptimo [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:34 y 2:04:53–2:05:05].

Error típico: «el doble de η, la mitad de pasos». Es error porque la velocidad depende de |1 − 60η|, no de η en proporción: el mismo razonamiento llevaría a creer que η = 0,040 es todavía mejor, y diverge.

[DATITO] El umbral y los conteos son exactos para esta parábola. En una red real no se pueden calcular, y por eso η se busca probando.

Por qué «estocástico». El algoritmo se llama descenso de gradiente estocástico, y el profesor dio esta razón: «el algoritmo gradiente estocástico se le llama estocástico porque tú lo ajustas desde los datos y los datos son muestreados de manera estocástica de la naturaleza» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:07:11–2:07:21].

[INFERENCIA] Lo que sigue no se dijo en clase: en la práctica el gradiente se suele calcular sobre un puñado de datos por vez (un mini-lote), no sobre los 123. La dirección sale ruidosa, pero cada paso cuesta mucho menos. Si te preguntan «por qué estocástico» en el certamen, responde primero con la razón del profesor.
«¿Y si la pelotita cae en un mínimo local?» — respuesta correcta y cómo se resuelve

Respuesta: podría pasar, pero en redes con muchísimos parámetros es muy poco probable, porque un mínimo local tendría que ser mínimo en todas las dimensiones a la vez.

Contexto: justo antes, el profesor había advertido que con una tasa de aprendizaje muy baja se puede terminar en un óptimo local y no en el global [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:05:08–2:05:22]. Un compañero preguntó qué pasa entonces. Fíjate en la autocorrección: primero dice «globales» y se corrige a «locales».

«Podría ser, podría ser, pero es muy poco probable uno puede mostrar que hay muy pocos mínimos globales […] perdón, hay muy pocos mínimos locales en un espacio de alta dimensionalidad […] porque tiene que ser mínimo local en todas las dimensiones» Clase del 21-ago · 2:05:39–2:06:58 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Entre medio da el argumento: si un punto fuese mínimo en una dimensión y no en otra, la pelotita se va por la otra dimensión; con dos dimensiones todavía puede pasar, pero estos modelos tienen miles de millones de parámetros. El argumento es de probabilidad, no de garantía: quedar atrapado exige que todas las dimensiones a la vez suban.

Error típico: responder «nunca pasa» o, al revés, «siempre queda atrapada». Lo primero convierte una probabilidad en garantía; lo segundo ignora el argumento de la alta dimensión. Y cuidado con repetir la primera frase del profesor: él mismo corrigió «globales» por «locales».

⚠ En la grabación el profesor habla de «billones» de parámetros [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:06:46–2:06:48]. Es un calco del inglés billions: se refiere a miles de millones (10⁹), no a billones en español (10¹²). La lámina 45 escribe «GPT-3 tiene 175B de parámetros» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45].

6 · Conectar muchas: forward, backward, retropropagación

Ahora sí se apilan. La salida de una neurona entra como entrada de la siguiente, y el recorrido tiene dos sentidos con nombre propio:

carga, vibración → capa oculta → salida → predicción: «normal»

Forward pass. Los datos van de izquierda a derecha: se multiplican por los pesos, pasan hacia adelante y al final la red dice «perro». Esto es lo que ocurre cada vez que el modelo predice — lo que el profesor llamó inferencia [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:08:23–2:09:05].

ajusto pesos ← ajusto pesos ← error: era «riesgo»

Backward pass. Si el modelo predijo «gato» y era un perro, se calcula la función de costo y desde ahí se va modificando la red hacia atrás, neurona por neurona [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:09:09–2:09:36]. El profesor le puso nombre así: «el algoritmo que ajusta el modelo se llama el algoritmo de retro propagación del error porque tomo el error y lo voy propagando hacia atrás para ir mejorando la red» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:09:54–2:10:04].

Un entrenamiento es este ciclo, repetido. forward → calcular J → backward (obtener los gradientes) → un paso de descenso. Y otra vez. Y otra vez. Minutos después, al volver al gráfico de la pelotita, el profesor separó las piezas: «tomo todos los datos hago forward y después hago un backward para calcular los gradientes y avanza» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:11:06–2:11:14]. Las dos formas de decirlo conviven; la sección 12 te dice cuál usar y cuál es el error de verdad.

El nombre de la familia

Redes en las que la información solo va hacia adelante: feedforward neural networks. Es la arquitectura básica, y la que tienes abajo.

7 · Tercer control: entrenar la red, con y sin g

La misma nube de puntos del molino. La misma recta imposible. Ahora con una capa oculta y el descenso de gradiente corriendo de verdad en tu navegador: 4.000 pasos, retropropagación incluida.

Si apilo tres capas de neuronas pero dejo g = identidad —o sea, sin no linealidad en la capa oculta—, ¿qué frontera dibuja la red entrenada?
Activación de la capa oculta
4 1
—
aciertos
—
costo J
0
pasos
61,0 %
responder siempre «riesgo»
Segundo control, y vale la pena anticiparlo aparte: con tanh activado, baja las neuronas ocultas de 4 a 1. ¿Resuelve el problema, ya que la no linealidad sigue ahí?
Respuesta correcta y cómo se resuelve (las dos predicciones de esta sección)

Respuesta 1: con g = identidad la red entrenada dibuja una recta, igual que una sola neurona, con cualquier número de capas y cualquier semilla (70,7 %).

Respuesta 2: no; con tanh y una sola neurona oculta llega a 73,2 %: la no linealidad está, pero falta capacidad para hacer los dos cortes que encierran la franja (con 2 neuronas sube a 96,7 %).

Los números que deberías haber visto, y qué separa cada uno:

ConfiguraciónAciertosQué dibuja
Responder siempre «riesgo»61,0 %Nada. Es el piso
Identidad · cualquier n.º de neuronas · cualquier semilla70,7 %Una recta
tanh · 1 neurona · cualquier semilla73,2 %Una curva suave, un solo corte
tanh · 2 neuronas · cualquier semilla96,7 %Dos cortes: ya encierra por dos lados
tanh · 3 neuronas98,4 – 100 %Casi cierra la franja. Aquí sí depende de la semilla
tanh · 4 neuronas o más100 %La franja completa

Ese «depende de la semilla» de la fila de 3 neuronas es la otra cara de la moneda: en cuanto hay no linealidad, la función de costo deja de tener un único mínimo y de dónde partas importa. Con identidad no importaba nunca.

Lo más revelador de la tabla está en la columna de la izquierda. Con identidad, todas las semillas y todos los anchos dan exactamente 70,7 %. No es coincidencia: componer funciones lineales da otra función lineal, así que la red de 8 neuronas y la de 1 son el mismo modelo, y ese modelo tiene un solo óptimo. Arranque donde arranque, la pelotita cae al mismo lugar.

El profesor lo dijo respondiendo a un compañero que sostenía que, al final, todo eran funciones lineales:

«no son funciones lineales son funciones no lineales pero el perceptron es no lineal […] si tú hicieras un perceptron lineal y tú conectas todos los perceptron lineales que quieras al final se transforma todo en un modelo lineal no más» Clase del 21-ago · 1:54:04–1:54:24 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Errores típicos: (1) «más capas dan una curva aunque sean lineales»: falso, la composición de funciones lineales es lineal; (2) «basta con tener la g»: falso, una neurona hace un solo corte y la franja necesita al menos dos.

Porcentajes: [DATITO] datos sintéticos del molino, entrenamiento en este navegador · colapso de lo lineal: cita de arriba.

«Pero a mano llegué a 78,0 % con una recta, y la red lineal saca 70,7 %. ¿La red es peor?» — respuesta correcta y cómo se resuelve

Respuesta: no es peor, optimiza otra cosa: el descenso de gradiente minimiza la función de costo, no el porcentaje de aciertos, y la recta que minimiza el costo no tiene por qué ser la que más acierta.

Es una distinción que conviene tener guardada: el modelo no minimiza los aciertos. Minimiza la función de costo.

Tú, a manoEl descenso de gradiente
Qué optimizasEl % de aciertos, moviendo sliders hasta que subeJ, la entropía cruzada [DATITO]
Cómo trata un punto mal clasificadoTodos pesan 1Cuanto más seguro y más equivocado, más castigo
Resultado78,0 %70,7 %, con J mínimo
[DATITO] Qué costo usa este panel y cuál vio la clase. La red de este panel (salida sigmoide, clase 0/1) minimiza la entropía cruzada. En la Clase del 21-ago el profesor mostró como función de costo el error cuadrático promediado (sección 4). En las 14 transcripciones disponibles al 2026-09-21, la entropía cruzada solo aparece en la Clase del 31-jul, adelantada como la función de costo que usa GPT al clasificar la siguiente palabra [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:09:37–0:09:45]. En el certamen, si te piden «la función de costo de la clase», es la de la sección 4.

La recta de 78,0 % acierta más, pero se equivoca con mucha confianza en unos pocos puntos extremos, y eso la penaliza en J. La recta de 70,7 % prefiere equivocarse «con dudas». Ambas son la respuesta correcta a preguntas distintas.

Esto no es una rareza del ejemplo: es la razón por la que un modelo puede entrenar bien y evaluar mal en la métrica que al cliente le importa. En Galaxy Zoo lo tienes en tus propios datos: la métrica oficial era F1-macro, y ningún clasificador la minimiza directamente. [FUENTE · Repo: 02_DATOS/00_LEEME.md]

Y fíjate en lo que no cambia con esto: ni 78,0 % ni 70,7 % se acercan al 100 %. El techo de la recta es el techo de la recta, se mida como se mida.

Error típico: concluir que «el entrenamiento falló» porque la métrica final es menor que la que lograste a mano. Es error porque compara dos óptimos de objetivos distintos: costo contra aciertos.

[DATITO] datos sintéticos del molino · F1-macro de Galaxy Zoo: [FUENTE · Repo: 02_DATOS/00_LEEME.md]

Dos cosas que el certamen puede poner una al lado de la otra.
No linealidad (la g)Capacidad (n.º de neuronas)
Qué permiteQue apilar sirva de algoCuántos cortes puede hacer la frontera
Si falta70,7 % entrenada, 78,0 % como techo teórico. Ni 8 neuronas lo arreglan73,2 % con 1 neurona. La g está, pero no alcanza
Si sobraNo aplicaSobreajuste. Más capacidad = más brecha train/test
No son la misma palanca, y una no sustituye a la otra.

8 · El camino inverso: te dan la ecuación

En una prueba no te van a pedir que entrenes nada. Te van a entregar una neurona escrita y te van a preguntar qué hace. Practícalo al revés. Esta neurona vigila un chancador:

ŷ = g( 2,4 − 0,05·temp − 0,30·amperaje )
g = sigmoide · ŷ > 0,5 significa «seguir operando»

Responde antes de abrir: ¿qué regla física codifica? ¿Qué pasa con ŷ si el amperaje sube? ¿Y si sube 1 °C la temperatura? ¿Cuál de las dos señales pesa más en la decisión, y por qué no basta con mirar el número del peso?

Respuesta correcta y cómo se resuelve

Respuesta: codifica «más caliente o más cargado es peor»; si sube el amperaje, z baja 0,30 por cada unidad y ŷ se acerca a «detener»; si sube 1 °C, z baja 0,05; y con estos datos no se puede decir cuál señal pesa más, porque los pesos solo se comparan si las entradas están en la misma escala.

  1. Los signos. Ambos pesos son negativos: subir cualquiera de las dos señales baja z, baja ŷ, y acerca la decisión a «detener». La neurona codifica «más caliente o más cargado = peor». Los signos te dan la dirección de cada variable sin hacer una sola cuenta.
  2. El sesgo. El 2,4 es el punto de partida con todo en cero. Es el «beneficio de la duda» que la máquina tiene antes de que ninguna señal opine.
  3. La frontera. Poner ŷ = 0,5 es poner z = 0, o sea 0,05·temp + 0,30·amperaje = 2,4. Es una recta, y sobre ella la máquina está justo en el límite.
  4. La trampa de la comparación. 0,30 > 0,05, pero eso no demuestra que el amperaje importe seis veces más: la temperatura se mide en decenas de grados y el amperaje quizá en unidades. Un peso solo es comparable con otro si las entradas están en la misma escala. Esa es la misma razón por la que las redes exigen normalizar, y es una comparación que el formato de certamen castiga.
  5. El límite. Es una neurona: su frontera es una recta. Si el chancador también fallara por amperaje demasiado bajo, esta ecuación no podría representarlo. Harían falta al menos dos neuronas y una g no lineal.

Error típico: «el amperaje importa seis veces más porque 0,30 / 0,05 = 6». Es error porque ignora las unidades: con la temperatura en decenas de grados, 0,05 por grado puede mover z tanto o más que 0,30 por amperio.

[DATITO] ecuación y caso del chancador inventados para este ejercicio

9 · Lo que cambia de verdad: el modelo elige las variables

En el aprendizaje clásico primero calculas características y después se las pasas a un modelo como un support vector machine o un random forest [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:14–1:50:38]. Y el contraste:

«deep learning tiene la gracia de que se puede conectar directamente a la fuente de datos y automáticamente hacer la extracción de características […] y a veces no son las características que uno mediría pero son características que te ayudan a resolver el problema» Clase del 21-ago · 1:50:41–1:50:57 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Esto no es una mejora de rendimiento: es un cambio en quién decide qué se mide.

Flujo clásico (todo el curso hasta aquí)Red profunda
EntradaUna tabla de variables que alguien eligióLa señal cruda: píxeles, audio, texto
Quién elige las variablesTú, antes de entrenarEl entrenamiento, como parte del ajuste
Dónde está el trabajo humanoEn pensar qué medirEn la arquitectura, los datos y el η
Se puede auditarSí: cada columna tiene nombreCon dificultad: las variables internas no tienen nombre

Está en tus propios datos, y probablemente no lo habías visto así

Mira las columnas del Galaxy Zoo con el que trabajaste:

psfMag_u · psfMag_g · psfMag_r · psfMag_i · psfMag_z · fiberMag_u · … · z · zErr · nChild

Son 86 features numéricas sobre 1.000 filas de entrenamiento [FUENTE · Repo: 02_DATOS/00_LEEME.md]. Magnitudes fotométricas, corrimiento al rojo, tamaños. Y ahora la observación que importa: esas 86 columnas no son la galaxia. Son mediciones que un astrónomo decidió sacarle a la imagen. Alguien miró una foto del cielo y resolvió que el brillo en cinco bandas era lo relevante.

El desafío Galaxy Zoo original se corrió sobre las imágenes crudas y lo ganó una red convolucional, que nunca supo qué era una «magnitud psfMag_u» y aun así aprendió a distinguir espirales de elípticas [INFERENCIA]. Tú recibiste el problema ya resuelto por la mitad: la extracción de características ya venía hecha. Eso es exactamente el flujo clásico de la tabla de arriba.

Y el otro lado. En Melbourne entrenaste con 6.336 propiedades de 2016 y evaluaste sobre 7.244 de 2017. Ganó HistGradientBoosting con R² de 0,7571 en test, y el Random Forest —el más flexible del lote— fue el que más brecha abrió: 0,9423 en train contra 0,7109 en test, 0,2314 de diferencia [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json].

Fíjate en qué entraba a esos modelos: una tabla con columnas ya elegidas por ti, el flujo clásico de la tabla de arriba. Tu pregunta: en tus modelos de Melbourne tú elegiste las features; ¿qué haría distinto una red neuronal con ellas, y habría ganado ahí? Ojo: en el repositorio no se entrenó ninguna red sobre Melbourne [NO EVIDENCIADO], así que esa comparación no está medida.
Respuesta correcta y cómo se resuelve

Respuesta: una red no se limita a combinar las features que le das: aprende en sus capas ocultas variables intermedias propias a partir de ellas (o del dato crudo, si se lo das); en Melbourne, con una tabla ya elaborada y 6.336 filas, esa ventaja tiene poco dónde operar, y lo esperable es que el boosting gane, aunque no está medido.

  1. Qué hace distinto: en el flujo clásico tú decides qué se mide y el modelo solo pondera; en una red, cada neurona oculta es una variable nueva que el entrenamiento construye (cita de arriba).
  2. Dónde rinde eso: con señal cruda (píxeles, texto) y muchos datos; con pocos datos, los clásicos rinden mejor (lámina 8).
  3. Melbourne: columnas ya elegidas y 6.336 filas de entrenamiento. Lo esperable es que el boosting gane, y el profesor advierte que un random forest supera a una red compleja más seguido de lo que uno cree (desarrollo en dl_llm_agentes.html#deep-learning).
  4. Límite: es una expectativa fundada, no una medición.

Error típico: «la red usa las mismas features, así que da lo mismo». Es error porque la red no se queda con tus columnas: las recombina en variables internas; que eso sirva o no depende de los datos.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:29–1:36:34] [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] · aplicación a Melbourne [INFERENCIA]

10 · La distinción que el certamen ya te cobró

En el Certamen 2, dos de las diez preguntas numeradas fueron de este bloque (P5 y P6). La P6 es la que toca redes directamente:

P6 · Revoluciones de la IA (0,5 pts, respuesta múltiple). El enunciado dice que «la inteligencia artificial mediante el uso de redes neuronales ha experimentado avances significativos» y pregunta cuál(es) de estas tecnologías se considera(n) entre las revoluciones recientes más destacadas: procesamiento del lenguaje natural · computación en la nube · bases de datos relacionales · detección de objetos en imágenes [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P6, enunciado textual de Canvas].

Lo que decide es la cláusula «mediante el uso de redes neuronales»: de cada alternativa pregúntate si es un avance producido con redes, o algo que existía antes o que a lo más las hizo posibles. Una de las alternativas es verdadera como afirmación histórica y falsa como respuesta a esta pregunta. El análisis completo, con la respuesta y las láminas que la respaldan, está en certamen_2.html#p6; el ejercicio para clasificar ítems parecidos, en dl_llm_agentes.html#deep-learning.
Respuesta correcta y cómo se resuelve

Respuesta: son correctas la 1 (procesamiento del lenguaje natural) y la 4 (detección de objetos en imágenes); la nube y las bases de datos relacionales no son revoluciones mediante redes neuronales.

Alternativa¿Avance mediante redes?Respaldo
Procesamiento del lenguaje naturalSíLáminas 33–34: GLUE y «Transformers in NLP»
Computación en la nubeNo. A lo más, condición que permitió entrenarlas [INFERENCIA]La lámina 65 atribuye el boom a redes, datos y GPU; la nube no sale de las redes
Bases de datos relacionalesNoAnterior y ajena a las redes [INFERENCIA]
Detección de objetos en imágenesSíLáminas 6–7: ImageNet, 1,2 M imágenes de entrenamiento y 1000 categorías

Error típico: marcar la nube «porque sin ella no habría IA moderna». Es verdadera como historia y falsa como respuesta: el enunciado acota a avances «mediante el uso de redes neuronales».

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6–7, 33–34 y 65] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P6]

La ficha original de esa pregunta en tu expediente dice, sin adornos: «No hay una sola red neuronal en todo el código del repositorio», y en su primera versión la marcaba INSUFICIENTE. La síntesis vigente del mismo documento, actualizada tras la guía de estudio, deja P5 y P6 en PARCIAL [FUENTE · Repo: 01_DOCUMENTACION/01_CERTAMEN2/02_MAPA_PROCESO_ESTUDIO.md · §2 Síntesis cuantitativa, l. 139]. Este artefacto no cambia eso —para eso hay que entrenar una red— pero cierra el lado conceptual.

La distinción hermana, P5: generar texto ≠ ejecutar acciones y observar su resultado. Un LLM es un componente; el agente es el bucle que lo rodea. Está desarrollada en dl_llm_agentes.html#agentes (y la ficha en certamen_2.html#p5), pero conviene que la veas ya: es el mismo patrón de razonamiento, quién hace qué, aplicado tres conceptos más adelante.

11 · Procedimiento a mano, para una prueba escrita

Sin computador, con lápiz. Dos procedimientos cortos que cubren casi todo lo que se puede preguntar.

A · Un forward pass

  1. Escribe las entradas con el 1 adelante: (1, x₁, x₂).
  2. Multiplica cada una por su peso y suma todo. Eso es z.
  3. Aplica g a z. Solo a z, no a cada término.
  4. Si hay más capas, ese resultado es una entrada de la capa siguiente. Vuelve al paso 1.
  5. Interpreta la salida en el lenguaje del problema: no «0,82», sino «82 % de probabilidad de operación normal».

B · Un paso de descenso de gradiente

  1. Escribe la función de costo con los números del enunciado.
  2. Deriva respecto del peso que te piden. Evalúala en el w actual.
  3. Aplica wnuevo = wviejo − η · (derivada). Cuida el signo dos veces: el de la resta y el de la derivada.
  4. Verifica que J bajó. Si subió, o te equivocaste de signo o el η es demasiado grande — y ambas son respuestas válidas si el enunciado las pide.

Ejercicio: con J(w) = 0,175 + 30(w − 1,95)², arrancando en w = 0 con η = 0,01, haz a mano cuatro pasos de descenso de gradiente. ¿Dónde quedas y cuánto vale J?

Respuesta correcta y cómo se resuelve

Respuesta: después de cuatro pasos w ≈ 1,900 y J ≈ 0,25; se acerca a w* = 1,95 y a J = 0,175, nunca a cero.

J(w) = 0,175 + 30(w − 1,95)² · ∂J/∂w = 60w − 117 · arrancas en w = 0 con η = 0,01.

twt∂J/∂wη · ∂J/∂wwt+1J(wt+1)
00,000−117,00−1,1701,17018,43
11,170−46,80−0,4681,6383,10
21,638−18,72−0,1871,8250,64
31,825−7,49−0,0751,9000,25

La derivada es negativa, así que −η·(negativo) es positivo y w sube hacia 1,95. Fíjate en que los incrementos se achican solos: cerca del mínimo la pendiente es pequeña y el algoritmo frena sin que nadie se lo pida. Y J se acerca a 0,175, nunca a cero.

Error típico: escribir w + η·∂J/∂w (signo cambiado): con la derivada negativa, w bajaría a −1,17 y J subiría a 292,2. Si J sube en tu tabla, revisa el signo antes que nada.

[DATITO] parábola construida desde las cuatro mediciones ilustrativas de la sección 4 · regla de actualización: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:04:06–2:04:20]

C · Transferencia: un invernadero

[DATITO] Invernadero de tomates con dos sensores: temperatura y humedad relativa. El cultivo está sano en una franja de temperatura (ni helada ni golpe de calor) y con la humedad bajo un umbral (sobre él aparecen hongos). Responde antes de abrir: ¿basta una neurona con sigmoide para marcar «sano / en riesgo»? ¿Cuántas neuronas ocultas pedirías como mínimo, y qué g? ¿Qué pasa si pones esas neuronas con g = identidad?

Respuesta correcta y cómo se resuelve

Respuesta: una neurona no basta; hacen falta del orden de tres neuronas ocultas con g no lineal (una por cada lado de la zona sana), y con g = identidad ninguna cantidad sirve, porque todo colapsa a una recta.

  1. Una neurona no basta. Su salida es no lineal, pero su frontera de decisión es una recta, y la zona sana está cerrada por tres lados: frío, calor y humedad alta.
  2. Mínimo, del orden de tres neuronas ocultas con g no lineal: un corte por cada lado de la zona. Es el mismo patrón del molino, donde dos cortes ya subían a 96,7 % y cuatro cerraban la franja.
  3. Con identidad no sirve ninguna cantidad: la composición colapsa a un modelo lineal y vuelves a una sola recta.
  4. Lo que no puedes decir sin validar: que tres sean suficientes con datos reales. Eso lo decide el error en validación, no el dibujo.

Error típico: «con sigmoide ya es no lineal, basta una». Es error porque confunde la no linealidad de la función con la forma de la frontera, y además ignora la capacidad: cada neurona aporta un corte.

[DATITO] caso del invernadero; patrón de cortes tomado del panel de la sección 7

D · Producción: explícaselo a alguien

Explícale a un compañero, en cinco líneas y sin usar la palabra «neurona», por qué el perceptrón es un modelo no lineal y aun así una sola unidad no puede aislar la franja sana del molino. Escríbelo antes de abrir la respuesta y llévalo a Datito.

Respuesta correcta y cómo se resuelve

Respuesta: la unidad es no lineal porque aplica una función curva g a una suma ponderada, pero su frontera de decisión sigue siendo recta, y una recta no puede encerrar una franja central.

Respuesta modelo (cinco líneas):

«La unidad suma las entradas con pesos y a esa suma le aplica una curva, como una sigmoide; por eso su salida no es una línea recta de las entradas. Pero decide “normal” o “riesgo” según si esa suma pasa un umbral, y todos los puntos donde la suma vale exactamente el umbral forman una recta. En el molino la zona sana es una franja rodeada de riesgo por dos lados, y una recta solo parte el plano en dos. Para encerrar la franja hay que combinar varias unidades, cada una con su recta, y juntar sus salidas con otra curva; sin la curva, combinarlas daría otra recta.»

Criterios con que Datito lo revisa: separa la función (no lineal por la g) de la frontera (recta si g es monótona); dice qué agrega apilar; dice por qué sin g apilar no sirve; distingue no linealidad de capacidad.

Error típico: escribir «no puede porque es lineal». Es error: el profesor corrigió justamente eso; la unidad es no lineal y el límite está en su frontera.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:54:04–1:55:25] · frontera recta con g monótona [DATITO]

12 · Errores que este formato castiga

13 · Qué tendría que verte hacer para darlo por comprendido

EvidenciaQué tendrías que producir
EXPLICARDecir con tus palabras, sin la palabra «neurona», por qué apilar modelos lineales no sirve — y por qué eso no se arregla poniendo más.
APLICARHacer a mano un forward pass de dos entradas y un paso de descenso de gradiente, con los signos correctos, sin mirar esta página.
TRANSFERIRTomar un problema nuevo —uno de esos donde la respuesta sana está en el medio y el riesgo en los dos extremos— y decidir, argumentando, si conviene una red o un boosting. Y saber cuándo la respuesta es «boosting», como en Melbourne.

Cierre de la Clase 17 · Redes neuronales

Qué aprendiste

  • Un perceptrón es una regresión más una función g no lineal.
  • Entrenar es minimizar el costo con el gradiente.
  • Con η grande el descenso salta; con η chico avanza despacio.
  • La retropropagación calcula los gradientes capa por capa.

Qué no debes confundir

  • ŷ no lineal en x ≠ frontera de una sola neurona, que sigue siendo recta.
  • Forward ≠ backward.

Procedimiento para el papel

  1. Forward: calcula ŷ.
  2. Calcula el costo.
  3. Backward: calcula los gradientes.
  4. Actualiza los pesos y repite.

Viene de: Clase 16 · Random Forest y ensambles · Sigue: Clase 18 · Deep learning, LLM y agentes

Vuelve a tu activación: Tu regresión lineal ya es casi una neurona. ¿Qué le falta? ¿Cambiarías tu respuesta?

Pregunta final. ¿El perceptrón es un modelo lineal?
Respuesta correcta y cómo se resuelve

No: g lo transforma en un modelo no lineal en x [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:55:11]. Aun así, con una sola neurona y g monótona, la frontera de decisión es recta [DATITO].

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 18 · Deep learning, LLM y agentes