Unidad 5 · Modelos más potentesClase 18 de 23
Clase 18 · Deep learning, LLM y agentes

Objetivo. Distinguir deep learning, LLM y agente, y separar lo que avanzó mediante redes de lo que lo hizo posible.

prerrequisitosClase 17 · Redes neuronales
habilitaninguna
tiempo estimado~55 min
Ficha Bloom · Analizar
  • Evidencia de aprendizaje: Separa en una lista qué es avance mediante redes y qué es factor habilitante, y explica el bucle del agente.
  • Actividad final: Clasificar los siete ítems de la P6 y recorrer el simulador de agente de la P5.
  • Criterio de dominio: Explica la diferencia entre LLM y agente por el bucle cerrado: acción, observación, siguiente paso.
Activación. Un chatbot que puede buscar en Internet y leer lo que encuentra, ¿es un LLM o un agente? Escribe tu respuesta antes de seguir: la retomas en el cierre.

Deep learning, LLM y agentes

Una sola cadena causal: cada eslabón agrega una pieza al anterior, y cada uno tiene su propia evidencia.
Fundamentos de Ciencia de Datos · UdeC · Clase del 21-ago (la clase del profesor empieza en 1:35:51)

Redes neuronales → Deep learning → LLM → Agentes
Dónde estás. Conceptos 19, 20 y 21 de 21, en un mismo archivo porque son eslabones de una cadena: si no ves qué agrega cada uno, los tres se funden en una sola nube llamada «IA».
EslabónQué agregaLáminas de FCD-08
Red neuronal → deep learningMuchas capas, muchos datos y GPU para entrenarlas6–10, 65
Deep learning → LLMAtención (transformers) y una tarea: adivinar la palabra oculta, en particular la siguiente33–40, 45
LLM → agenteHerramientas, memoria, objetivos y el bucle acción → observación46–48
Por qué importa: la P5 y la P6 del Certamen 2 (0,5 pts cada una) salen de esta clase. Es una clase del profesor titular, así que entra. La charla del invitado de la misma sesión (antes de la clase, sobre datos personales) no es materia evaluable: solo aparece aquí como contexto, en la sección 2.

Cada sección sigue el mismo orden: predicción → explicación con la fuente → ejercicios (aplicar, interpretar, transferir, producir) → distinción de certamen → procedimiento para el papel → errores castigados.

1 · Deep learning: cuando las redes encontraron datos y GPU

Las redes neuronales existían desde los años 40. En 2012, en el desafío ImageNet, el error bajó de golpe. Antes de leer: ¿qué cambió en 2012?
Respuesta correcta y cómo se resuelve

Respuesta: en 2012 se entrenaron redes profundas en GPU sobre un dataset enorme (ImageNet, 1,2 M imágenes); la idea de red neuronal ya existía.

  1. Fecha de la idea: el perceptrón es de los años 40 (clase y lámina 51), así que «se inventó en 2012» queda descartado.
  2. Qué dijo el profesor que pasó: se aplicó deep learning de forma significativa y los autores usaron GPU para ajustar la red muy rápido.
  3. Qué datos tenía: 1,2 M imágenes de entrenamiento (lámina 6).

Error típico: creer que 2012 fue el invento de las redes. Es error porque confunde la idea (antigua) con las condiciones que la hicieron funcionar (GPU y datos).

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:38–1:44:12] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6 y 51]

Lo que pasó en ImageNet

ImageNet es un desafío de reconocimiento visual: 1,2 millones de imágenes de entrenamiento y 1000 categorías de objetos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 6]. Según el profesor, hasta 2011 el error rondaba el 25 %, en 2012 bajó a cerca de 16 %, siguió bajando y en 2015 llegó al nivel de la visión humana [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:46–1:43:36] ⚠.

«bajar el error en un desafío así importante en 10% en un año es lo que uno llama una revolución» Clase del 21-ago · 1:43:02–1:43:08 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Ese «10%» son puntos porcentuales: de ~25 a ~16, casi 10 puntos, como él mismo repite después [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:33–1:44:41]. ¿Y qué lo produjo? Lo que se aplicó de forma significativa fue deep learning, en buena parte porque los autores usaron GPU —tarjetas pensadas para videojuegos— para ajustar la red muy rápido. Soluciones con GPU en el desafío: 0 en 2010, 0 en 2011, 4 en 2012, 60 en 2013 y 110 en 2014 [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:38–1:44:31] ⚠.

⚠ Lo oficial primero. La lámina 6 dice «1.2M images de entrenamiento» y «1000 categorías de objetos». En la grabación se escucha «1200 imágenes» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:10–1:42:12], lo que no calza con la lámina: error de dicción o del reconocimiento de voz. Manda la lámina: 1,2 millones. Los porcentajes de error y los conteos de GPU solo están en la voz (el gráfico de la lámina 7 no se extrae como texto), así que úsalos como orden de magnitud, no como cifra de memoria.

Las redes no nacieron en 2012. El perceptrón es de los años 40; las redes fueron populares en los 80, algo en los 90, después se abandonaron, y en 2012 despegaron. El Premio Turing 2018 reconoció a tres de sus pioneros por insistir cuando nadie creía en ellas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:55:24–2:56:38] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 51]. Guarda esto para la P6: lo que cambió en 2012 no fue la idea, fueron las condiciones.

Qué es deep learning (la definición oficial)

Lámina 10: «Conjunto de algoritmos que modelan los datos a través de múltiples niveles de abstracción usando un conjunto de capas jerárquicas» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 10].

Deep learning es el concepto; hoy se implementa casi siempre con redes neuronales [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:47:58–1:48:14]. Y según el profesor, casi toda la IA que usamos hoy es deep learning [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:45:01–1:45:07].

El ejemplo de clase son las caras: para reconocer una cara, primero hay que reconocer ojos, nariz y boca; para eso, antes, líneas, puntos y curvas. La red recibe los píxeles directamente, sin atributos calculados, y aprende sola esos niveles, sin que nadie le pida buscar líneas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:46:58–1:47:56]. Un compañero preguntó si eso ocurre de verdad o es teoría. La respuesta tiene un matiz que conviene recordar tal cual:

«esto es un ejemplo como debiese funcionar como teóricamente en la práctica a veces funciona así a veces no y depende de la arquitectura» Clase del 21-ago · 1:52:26–1:52:34 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Agregó que en las redes de 2012–2014 sí se veían filtros parecidos a los que armaría un humano, y también muchos que un humano no armaría [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:51:52–1:52:14]. La extracción automática de características está desarrollada en redes_neuronales.html, sección 9.

La lámina que decide cuándo conviene: la 8

Lámina 8, «Técnicas de ML en función de la cantidad de datos»: desempeño contra cantidad de datos, con dos curvas, Deep Learning y Algoritmos Clásicos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8]. El profesor advirtió que el gráfico es un dibujo, no una medición [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:45:17–1:45:23], y lo leyó así:

«y si tu tienes pocos datos los algoritmos clásicos funcionan mejor que deep learning los algoritmos clásicos son como los que hemos estado viendo en este curso pero si tu tienes muchos datos deep learning funciona mucho mejor» Clase del 21-ago · 1:45:25–1:45:37 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

¿Cuántos datos son «muchos»? En la Clase del 7-ago el profesor respondió que no hay un número: depende del problema [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:22]. Y cerró con una advertencia:

«hay momentos en los cuales tú ⟨entrenas⟩ un random forest y ⟨entrenas⟩ una red neuronal muy compleja y el random forest lo supera y pasa mucho más seguido lo que uno creería» Clase del 7-ago · 1:36:29–1:36:34 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA] (el ASR escribe «entren a»)
⚠ Posible lapsus en la misma respuesta del 7-ago. Unos segundos antes, la transcripción dice que si no llegas al régimen de datos suficientes para que deep learning le gane a un random forest, en general conviene usar deep learning [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:05–1:36:15]. Eso contradice la lámina 8, la cita del 21-ago de arriba y la frase que viene justo después. Probable lapsus de dicción o error del ASR. Manda la lámina 8.
Y Melbourne. El mejor de tus seis modelos fue HistGradientBoosting sobre log1p(Price): MAE 188.218 AUD y R² 0,757 en las 7.244 propiedades de 2017, entrenado con 6.336 de 2016 [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]. Entró una tabla con columnas elegidas por ti: el flujo clásico. Repaso del modelo ganador en arboles_y_ensambles.html#boosting.

Lo que no hay: ninguna red neuronal entrenada sobre Melbourne en el repositorio [NO EVIDENCIADO]. «El boosting le gana a una red» no está medido en tus datos.

Tu pregunta (la de entrada de Datito para este concepto): en tus datos tabulares de Melbourne se espera que el boosting le gane a una red profunda. ¿Por qué, si el deep learning domina en imágenes y texto? Contéstala con la lámina 8 y la cita del 7-ago antes de abrir.
Respuesta correcta y cómo se resuelve

Respuesta: porque la ventaja del deep learning aparece con muchos datos y con señal cruda de la que extraer características, y Melbourne es lo contrario: 6.336 filas de entrenamiento en una tabla cuyas columnas ya eligió un humano; en ese régimen un modelo clásico de árboles suele ganar, aunque en tu repositorio no está medido.

  1. Cantidad de datos (lámina 8): con pocos datos los algoritmos clásicos funcionan mejor; con muchos, deep learning. 6.336 filas no se parecen a 1,2 M imágenes, aunque el cruce no tenga un número fijo (Clase del 7-ago).
  2. Tipo de dato: la gracia de deep learning es extraer características desde el dato crudo (píxeles, texto). En Melbourne las características ya estaban calculadas: esa ventaja no tiene dónde operar.
  3. Evidencia del profesor: un random forest supera a una red muy compleja «mucho más seguido» de lo que uno cree (cita del 7-ago).
  4. Límite honesto: es una expectativa bien fundada, no una medición: no hay red entrenada sobre Melbourne en el repositorio.

Error típico: responder «porque el boosting es mejor que las redes». Es error porque convierte una dependencia del régimen de datos (lámina 8) en una jerarquía fija de métodos; en ImageNet la relación es la inversa.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:34] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] · la aplicación a Melbourne es [INFERENCIA]

Distinción de certamen · P6

Lámina 65, «Comentarios Finales»: «El gran boom se debe gracias a las redes neuronales artificiales, la gran cantidad de datos que hemos producido como humanidad y a avances en cómputo con tarjetas gráficas», aplicado a imágenes, texto y videos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 65].

Ojo: la lámina pone los tres factores juntos como explicación del boom. La P6 pregunta otra cosa: qué tecnologías son revoluciones recientes de la IA «mediante el uso de redes neuronales». Esa cláusula es lo que decide (certamen_2.html#p6).

Para ordenarlo, Datito usa un marco propio [DATITO]: avance mediante redes (un área donde las redes produjeron el salto) frente a factor habilitante (lo que hizo posible entrenarlas o usarlas). El expediente lo llama «causa ≠ condición habilitante». No es terminología del profesor: en el certamen argumenta con la cláusula del enunciado y con las láminas, no con el marco.

Ejercicio de aplicación. Clasifica cada ítem antes de ver el veredicto.

1 · Reconocer y localizar objetos en fotos (ImageNet)
2 · Comprender y traducir texto (GLUE, transformers)
3 · Tarjetas gráficas (GPU) para ajustar modelos
4 · La enorme cantidad de datos que produjo la humanidad
5 · Generar imágenes a partir de un texto (modelos de difusión)
6 · Computación en la nube
7 · Bases de datos relacionales
Respuesta correcta y cómo se resuelve (los siete ítems)

Respuesta: avances mediante redes son 1, 2 y 5; factores habilitantes son 3 y 4; la nube (6) no es avance mediante redes (a lo más habilitante); las bases relacionales (7) no son ninguna de las dos.

ÍtemRespuestaPor quéFuente
1 · Objetos en fotosAvance mediante redesEl salto de ImageNet en 2012 lo dieron redes profundasLáminas 6–7
2 · Texto (GLUE)Avance mediante redesGPT, BERT y sucesores son transformers, redes basadas en atenciónLáminas 33–34
3 · GPUHabilitantePermitió entrenar redes rápido; no salió de ellasLámina 65; clase 1:43:50–1:44:12
4 · Muchos datosHabilitanteLas redes los necesitan para superar a los clásicosLáminas 8 y 65
5 · Imágenes desde textoAvance mediante redesLos modelos de difusión son redes que quitan ruidoLáminas 42–43; clase 2:36:49–2:37:37
6 · NubeNo es avance mediante redesLa lámina 65 no la nombra; a lo más ayuda a entrenar y servir modelos [INFERENCIA]P6 del Certamen 2
7 · Bases relacionalesNingunaAnteriores y ajenas a las redes; no aparecen en la clase [INFERENCIA]P6 del Certamen 2
  1. Lee la cláusula: ¿la pregunta es por avances mediante redes o por los factores del boom?
  2. De cada ítem pregunta: ¿es un área donde las redes produjeron un salto, o algo que las hizo posibles, o nada de eso?
  3. Marca solo lo que responde a la cláusula.

Error típico: marcar la nube o la GPU porque «fueron clave». Es error porque son verdaderas como historia y falsas como respuesta a una pregunta acotada a «mediante el uso de redes neuronales».

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6–8, 33–34, 42–43 y 65] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:50–1:44:12 y 2:36:49–2:37:37] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P6] · marco «habilitante» [DATITO]

Ejercicio de cálculo

Con las cifras dictadas en clase (⚠, orden de magnitud): error de ~25 % en 2011 y ~16 % en 2012. (a) ¿Cuántos puntos porcentuales bajó? (b) ¿Qué porcentaje de los errores de 2011 desapareció? (c) Si el conjunto de evaluación tuviera 100.000 imágenes [DATITO, cifra ilustrativa], ¿cuántas imágenes mal clasificadas menos habría?

Respuesta correcta y cómo se resuelve

Respuesta: (a) 9 puntos porcentuales; (b) desapareció el 36 % de los errores; (c) 9.000 imágenes mal clasificadas menos.

  1. (a) Diferencia directa: 25 − 16 = 9 puntos. Es el «10%» redondeado de la cita.
  2. (b) Proporción sobre el punto de partida: 9 / 25 = 0,36 = 36 %.
  3. (c) 25 % de 100.000 = 25.000 errores; 16 % = 16.000; diferencia 9.000.

Error típico: decir que el error «bajó 9 %» o que bajó «un 10 % de los errores». Es error porque mezcla puntos porcentuales (resta) con cambio relativo (división): «bajó 9 puntos» y «bajó 36 %» describen el mismo salto.

Cifras dictadas: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:46–1:43:08] ⚠ · 100.000 imágenes [DATITO]

Ejercicio de interpretación

Soluciones con GPU en el desafío: 0, 0, 4, 60 y 110 entre 2010 y 2014 (⚠ dictado). ¿Qué dicen esos números? ¿Prueban, por sí solos, que la GPU causó la caída del error?

Respuesta correcta y cómo se resuelve

Respuesta: los números muestran que el uso de GPU se difundió después del resultado de 2012; por sí solos no prueban que la GPU causara la caída del error.

  1. Mira el orden temporal: 4 soluciones con GPU en 2012 y 60 y 110 en los dos años siguientes. El aumento viene después del salto.
  2. Busca la explicación del profesor: al ver el resultado, los investigadores fueron a mirar cómo se hizo, vieron que usaban GPU y todos empezaron a usarlas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:33–1:44:49].
  3. Pregunta qué aísla el conteo: nada. No separa el aporte de la GPU del de la red o del de los datos; la lámina 65 los presenta juntos.
  4. Tradúcelo a la P6: la GPU habilitó entrenar redes grandes; no es un «avance mediante redes».

Error típico: leer un conteo de adopción como prueba causal («como después todos usaron GPU, la GPU explicó el salto»). Es error porque la adopción es una consecuencia del resultado, y un conteo no separa causas que actuaron juntas.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:15–1:44:49] ⚠ · [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 65] · lectura causal [INFERENCIA]

Ejercicio de transferencia · forestal

[DATITO] Una forestal tiene dos fuentes: (a) 3.000 fichas de rodales con 15 variables medidas en terreno por técnicos, y (b) 2 millones de fotos de dron, de las cuales solo 20.000 tienen etiqueta de especie. Para cada una: ¿qué te pide mirar la lámina 8 antes de elegir entre un algoritmo clásico y deep learning? ¿Qué trabajo haría la red por ti en (b) que en (a) ya está hecho?

Respuesta correcta y cómo se resuelve

Respuesta: la lámina 8 pide mirar la cantidad de datos; para las fichas (a) conviene partir con un modelo clásico, y en las fotos (b) la red haría por ti la extracción de características que en (a) ya hicieron los técnicos.

  1. Lámina 8: mira la cantidad de datos, sabiendo que el cruce no tiene un número fijo: depende del problema (Clase del 7-ago). Nada de esto se decide sin validar.
  2. (a) 3.000 filas y 15 variables ya elegidas por humanos: régimen de pocos datos y flujo clásico. Empieza por árboles, random forest o boosting; prueba una red solo si la validación lo justifica.
  3. (b) Es señal cruda, píxeles. Ahí la red haría la extracción de características que en (a) hicieron los técnicos (clase 1:50:41–1:50:57).
  4. Cuántos datos tiene (b) de verdad: para aprendizaje supervisado cuentan los etiquetados (20.000), no los 2 millones [INFERENCIA]. Las fotos sin etiqueta sirven con otra idea, el autoaprendizaje (sección 2).

Error típico: decir «(b) tiene 2 millones de datos, así que deep learning gana seguro». Es error por dos lados: solo 20.000 tienen etiqueta, y la lámina 8 es un dibujo sin umbral; la decisión final la toma la validación.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:22] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] · caso forestal [DATITO]

Producción · explícaselo a alguien

Tu jefe de turno en una mina te dice: «el deep learning ganó ImageNet, así que el modelo de consumo de combustible de los camiones (una tabla de 12 columnas) tiene que ser una red». Respóndele en cinco líneas. Escríbelo antes de abrir los criterios y llévalo a Datito.

Respuesta correcta y cómo se resuelve

Respuesta: que una red haya ganado ImageNet no dice nada sobre una tabla de 12 columnas: la ventaja del deep learning depende de tener muchos datos y señal cruda, así que hay que comparar modelos con validación antes de exigir una red.

Respuesta modelo (cinco líneas):

«Jefe, ImageNet eran 1,2 millones de fotos, y la red ganó porque aprendió sola qué mirar en los píxeles. Nuestro caso es otro: una tabla de 12 columnas que ya elegimos nosotros, con bastantes menos filas. La lámina que vimos en el curso muestra que con pocos datos los modelos clásicos rinden mejor, y el profesor advirtió que un random forest le gana a una red compleja más seguido de lo que uno cree. Propongo entrenar un boosting y una red, validarlos con datos de otro período y quedarnos con el que se equivoque menos en litros.»
  1. Separa el tipo de dato: señal cruda (fotos) frente a tabla con columnas elegidas.
  2. Usa la lámina 8 sin inventarle un umbral.
  3. Cierra con un criterio verificable (validación fuera de muestra), no con prestigio.

Criterios con que Datito lo revisa: distingue los tipos de dato; usa la lámina 8 sin umbral inventado; propone validar; no afirma que «la red va a perder», porque tampoco está medido.

Error típico: contestar «las redes no sirven para tablas». Es error porque cambia un dogma por otro: la lámina 8 describe un régimen, no una prohibición.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6 y 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:29–1:36:34] · caso minero y redacción [DATITO]

Procedimiento para el papel

  1. ¿La afirmación habla del concepto (niveles de abstracción, capas jerárquicas: lámina 10) o de la implementación (redes neuronales)?
  2. Si compara deep learning con algoritmos clásicos, busca la cantidad de datos (lámina 8). Sin ese dato, «siempre es mejor» es falso.
  3. Si pregunta por el boom: los tres factores de la lámina 65. Si pregunta por revoluciones «mediante redes»: áreas donde las redes dieron el salto (visión, lenguaje), no la infraestructura.
  4. Cifras: las de la lámina (1,2 M imágenes, 1000 categorías), no las de la voz.

Errores que el formato castiga

2 · LLM: una red que predice la siguiente palabra

Qué agrega este eslabón: una arquitectura (el transformer, basado en atención) y una tarea de entrenamiento muy simple: adivinar una palabra tapada, y en particular la siguiente. Antes de la explicación, un juguete.

El predictor de abajo solo «aprendió» de cuatro frases y solo mira la palabra anterior. Antes de usarlo: ¿puede escribir una oración completa que no esté en esas cuatro frases?
Respuesta correcta y cómo se resuelve

Respuesta: sí: el juguete puede escribir oraciones completas que no están en su corpus, porque encadena pares de palabras que sí vio; lo que no puede es usar una palabra que nunca vio.

  1. Cada paso solo exige que la pareja (palabra anterior → siguiente) exista en el corpus.
  2. «perro» aparece en dos frases distintas, así que desde «hola» se puede saltar de una frase a la otra: hola → perro → se → puso → muy → bien → y → tú.
  3. Esa oración completa no está en ninguna de las cuatro frases: el indicador del panel lo confirma.
  4. Pero una palabra ausente del corpus («ratón») no está en ninguna fila de la tabla: nunca puede salir.

Error típico: creer que un modelo de siguiente palabra solo «repite frases memorizadas». Es error porque lo que guarda son probabilidades de continuación, no frases, y combinarlas produce secuencias nuevas.

Juguete [DATITO] · que un modelo no aprende lo que no está en sus datos: [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:04:26–0:04:42]

Corpus del juguete [DATITO]

La primera frase imita el ejemplo del profesor en la Clase del 31-jul (le das «hola cómo estás» y predice «muy», después «bien»…) [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:05:52–0:06:09]; la segunda es su frase del ejemplo de atención [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:16:07–2:16:11]. Las probabilidades salen de contar qué palabra siguió a cuál: cifras ilustrativas.

Empieza con
Lo que lleva escrito
Candidatas para la siguiente palabra
1
tokens en el texto
1
probabilidad de la secuencia
—
¿oración completa en el corpus?
¿El juguete conoce esta palabra?
[DATITO] Lo que el juguete no tiene. Solo mira la palabra anterior; un LLM mira todo el contexto previo mediante atención (el propio profesor explicó que predice la siguiente palabra considerando todas las anteriores [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:06:04–0:06:09]). Tiene 15 palabras y probabilidades contadas a mano; un LLM tiene un vocabulario enorme y probabilidades que salen de una red con miles de millones de parámetros ajustados.

Tu pregunta (la de entrada de Datito para este concepto): un LLM solo predice el siguiente token. ¿Cómo puede algo así responder una pregunta que nunca vio escrita?

Respuesta correcta y cómo se resuelve

Respuesta: porque no guarda preguntas y respuestas, sino regularidades de cómo continúa el texto dado todo el contexto; al recibir una pregunta nueva, genera palabra por palabra la continuación más plausible según esas regularidades, igual que el juguete arma oraciones que no estaban en su corpus, pero a una escala enorme.

  1. Qué aprende: probabilidades de la palabra siguiente, no frases (lo mismo que viste en el juguete).
  2. Con qué contexto: el juguete solo mira la palabra anterior; un LLM mira todo lo escrito antes mediante atención, así que capta patrones mucho más largos (formato de pregunta y respuesta, gramática, asociaciones entre conceptos).
  3. Con cuántos datos: fue entrenado con prácticamente todo el texto disponible, así que casi cualquier pregunta nueva se parece en su estructura a muchas que sí vio.
  4. Por qué a veces falla: «plausible» no es «verdadero». Si la pregunta exige un hecho que no está en sus datos, continúa igual y alucina (lámina 45).

Error típico: responder «porque busca la respuesta en internet» o «porque entiende como una persona». Lo primero describe a un agente con herramienta, no a un LLM solo; lo segundo no explica el mecanismo que vio la clase.

[INFERENCIA] a partir de: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:22:30–2:22:44 y 2:46:42–2:46:54] [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:06:04–0:06:34] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45]

Qué es un LLM, en palabras del profesor

«los modelos que se llaman los grandes modelos del lenguaje […] large language model se le llaman la llm son simplemente modelos que predicen la siguiente palabra» Clase del 21-ago · 2:22:30–2:22:44 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Y son large porque tienen miles de millones de parámetros: son como la red de la clase, pero gigantes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:22:47–2:22:57]. En la Clase del 31-jul ya lo había adelantado, y agregó dos cosas que conviene separar: el modelo se entrena comparando la palabra que predice con la que realmente seguía, con la entropía cruzada como función de costo (la de clasificación); y cuando usas ChatGPT el modelo no se está entrenando, solo hace inferencia [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:08:06–0:11:04].

⚠ «175 billones». La lámina 45 dice «GPT-3 tiene 175B de parámetros» y «Llama-2 tiene versiones de 7B, 13B, 70B» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45]; en la grabación se dice «175 billones» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:45:43–2:45:47]. Es un calco del inglés: B = billion = 10⁹. GPT-3 tiene 175 × 10⁹ = 175 mil millones de parámetros, no 175 billones del español (10¹²).

Cómo se llega ahí: atención, BERT y la última palabra

Atención. En 2017, el artículo Attention is all you need propuso armar el modelo solo con mecanismos de atención [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:14:54–2:15:18]. La idea: para representar una palabra dentro de su oración, la red «presta atención» a las otras. En el ejemplo del profesor, para representar «ladró» en «El perro café se puso feliz y me ladró», pone 30 % de atención en «ladró», 30 % en «feliz», 30 % en «perro» y 10 % en «café» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:17:53–2:18:09] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 35]. Esos porcentajes los calcula otra red, a partir de las correlaciones entre los vectores de las palabras, normalizadas para que sumen 1 [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:26:23–2:28:13]; y el profesor aclaró que los números del ejemplo los puso él para ilustrar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:28:42–2:28:44]. Como cada representación se puede entrenar en paralelo, se pudo entrenar con muchísimos más datos: de ahí los modelos fundacionales (lámina 36) [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:18:24–2:19:17].

BERT. Tapa al azar cerca del 15 % de las palabras (lámina 38) y la red tiene que adivinar la palabra oculta. Así el entrenamiento se vuelve un problema de clasificación: elegir, entre todas las palabras posibles, la que falta [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:20:15–2:21:09]. El paso que convierte eso en un generador de texto:

«si yo puedo ⟨enmascarar⟩ una palabra entonces pues puedo ⟨enmascarar⟩ la última palabra enmascaro la última palabra y trato de predecir esa palabra» Clase del 21-ago · 2:21:18–2:21:28 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA] (el ASR escribe «mascarar»)

Repetir eso, palabra tras palabra, es generar texto; por eso se llama modelo generativo [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:21:38–2:22:09] (láminas 39–40, «Auto-Regressive Generative Transformers»). Es exactamente lo que hace el juguete de arriba, con una tabla en vez de una red.

El mismo principio en imágenes [INFERENCIA]. En la Clase del 31-jul el profesor explicó el autoaprendizaje (self-supervised): recortas un pedazo de la imagen de un perro y le pides al modelo que lo reconstruya (in-painting); no hay una etiqueta «perro», la etiqueta es el propio dato [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:17:14–1:17:56]. Tapar una palabra y pedir que la adivine es la versión en texto de lo mismo. Por eso un LLM se puede entrenar con enormes cantidades de texto sin que nadie etiquete nada.

GPT no es ChatGPT, y la palabra «detente»

«gpt no es lo mismo que chat gpt gpt es el modelo lenguaje chat gpt es la herramienta que hoy en día es un sistema multiagente» Clase del 21-ago · 2:23:52–2:23:58 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Ya lo había dicho en la Clase del 31-jul: ChatGPT es un sistema multiagente que tiene un LLM por detrás [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:04:51–0:05:08]. Cuando aprietas enter, el modelo genera palabra por palabra y en algún momento genera una palabra especial que no te muestra, «detente»: ahí el sistema se detiene y te toca hablar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:24:28–2:24:38]. ChatGPT usa otras palabras especiales, por ejemplo una que activa el generador de imágenes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:24:43–2:25:07]. Guarda esa idea: es el mecanismo de los agentes (sección 3).

Por qué cuesta caro usarlo. Cada palabra generada es un forward completo por miles de millones de parámetros, para millones de personas a la vez; el gasto no está solo en entrenar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:30:36–2:31:03]. Qué es un forward: redes_neuronales.html, sección 6.

Por qué alucinan

Lámina 45. Los LLM son muy buenos como asistente de escritura y de código. Son muy malos para: obtener respuestas basadas en hechos (alucinan), usar información posterior a su entrenamiento, y razonar y planificar. «Simplemente imitan a sus conjuntos de entrenamiento» [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45].

El ejemplo del profesor: si le preguntas a un LLM solo cómo estará el clima mañana, no tiene forma de saberlo, así que genera una palabra, otra y otra, e inventa [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:27]; está entrenado para generar palabras que sigan la distribución del texto que la humanidad ha escrito [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:42–2:46:54]. [DATITO] En el juguete lo ves directo: después de cada palabra siempre hay una siguiente con su probabilidad. El mecanismo no tiene una casilla para «no sé».

Contexto, no materia. En la misma sesión, antes de esta clase, un invitado habló de datos personales, regulación de la IA y propiedad intelectual [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 0:06:09–1:23:51]. Está fuera del currículum evaluable. El único puente: el profesor dijo que estos modelos se ajustaron prácticamente con todo el texto que la humanidad ha generado [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:30:22–2:30:30]; de dónde sale ese texto y con qué consentimiento era el tema del invitado.

Ejercicio de cálculo

Con la tabla del juguete (la ves en el panel al elegir cada palabra), calcula a mano la probabilidad que le asigna a (a) «hola cómo estás ⟨detente⟩» y a (b) «hola cómo estás muy bien y tú ⟨detente⟩», partiendo de «hola». Después compruébalo en el panel. ¿Cuál es más probable, y qué te dice eso sobre las respuestas largas?

Respuesta correcta y cómo se resuelve

Respuesta: (a) vale 1/4 = 0,25 y (b) vale 1/16 = 0,0625; la corta es cuatro veces más probable.

  1. La probabilidad de una secuencia es el producto de las probabilidades de cada paso.
  2. (a) hola→cómo ½ · cómo→estás 1 · estás→⟨detente⟩ ½ = ¼ = 0,25.
  3. (b) hola→cómo ½ · cómo→estás 1 · estás→muy ½ · muy→bien ½ · bien→y 1 · y→tú ½ · tú→⟨detente⟩ 1 = 1/16 = 0,0625.
  4. Cociente: 0,25 / 0,0625 = 4.

Qué te dice: cada paso multiplica por un número ≤ 1, así que las secuencias largas tienden a ser menos probables, aunque (b) sea la frase completa del corpus. Por eso el momento en que sale «detente» importa tanto como las palabras: decide dónde termina la respuesta.

Error típico: sumar las probabilidades en vez de multiplicarlas, o creer que la frase del corpus tiene que ser la más probable. Sumar da números mayores que 1 y no representa «esto y después esto»; y el corpus no garantiza nada sobre la probabilidad de la frase completa.

[DATITO] tabla del juguete, contada desde su corpus

Ejercicio de interpretación

La lámina 35 muestra, para «ladró», nueve pesos de atención: 0.0 0.3 0.1 0.0 0.0 0.3 0.0 0.0 0.3. (a) ¿Qué significa el 0,3 de «perro»? (b) ¿Por qué suman 1? (c) ¿Qué no puedes concluir de estos números?

Respuesta correcta y cómo se resuelve

Respuesta: (a) el 30 % de la representación de «ladró» se arma mirando a «perro»; (b) suman 1 porque se normalizan como porcentajes; (c) no puedes concluir que sean los pesos de un modelo real ni que la red «entienda»: son ilustrativos.

Correspondencia palabra→peso: sigue el orden de la frase dicho en clase (El, perro, café, se, puso, feliz, y, me, ladró); el texto extraído de la lámina desordena las palabras, así que la correspondencia es [INFERENCIA], coherente con lo que el profesor dictó.

  1. (a) «perro» es el contexto que le dice a «ladró» quién ladró: por eso recibe peso.
  2. (b) Se calculan correlaciones y se normalizan para que sean porcentajes: 0,3 + 0,1 + 0,3 + 0,3 = 1.
  3. (c) El profesor dijo que los números los puso él para ilustrar; en un modelo real los calcula una red. Y un peso dice cuánto aporta una palabra a un vector, no que haya comprensión.

Error típico: leer el 0,3 como «probabilidad de que la palabra sea perro», o creer que el programador fija esos pesos. Lo primero confunde atención con predicción; lo segundo contradice lo que se explicó en clase.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 35] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:17:53–2:18:09 y 2:26:23–2:28:44]

Ejercicio de transferencia · estaciones meteorológicas

[DATITO] Tienes registros de 30 estaciones meteorológicas agrícolas con lecturas faltantes de temperatura. Alguien propone «hacer lo de BERT» para rellenarlas. ¿Qué sería exactamente? ¿Cuál es la etiqueta? ¿Es un problema de clasificación, como en BERT?

Respuesta correcta y cómo se resuelve

Respuesta: «hacer lo de BERT» sería tapar lecturas conocidas y entrenar un modelo que las reconstruya desde el resto; la etiqueta es la propia lectura tapada, y como la temperatura es un número continuo el problema es de regresión, no de clasificación.

  1. Tapa al azar una parte de las lecturas que sí conoces y entrena un modelo para reconstruirlas desde las otras horas y las otras estaciones.
  2. La etiqueta es el dato tapado: autoaprendizaje, como el in-painting de la Clase del 31-jul. Nadie tiene que etiquetar nada.
  3. BERT es clasificación porque elige entre las palabras de un vocabulario; una temperatura es continua: regresión. Mismo principio, otro tipo de problema.
  4. Valida con lecturas tapadas que el modelo nunca vio; si no, mides memoria y no reconstrucción (limpieza_preparacion.html).

Error típico: decir «es clasificación, como BERT». Es error porque el tipo de problema lo define el tipo de etiqueta, no el truco de enmascarar.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:20:15–2:21:09] [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:17:14–1:17:56] · caso de estaciones [DATITO]

Producción · explícaselo a alguien

Explícale a alguien que no estudia datos por qué ChatGPT puede inventar un dato con total seguridad. Usa solo dos ideas de esta sección y ninguna palabra técnica sin explicar. Llévalo a Datito.

Respuesta correcta y cómo se resuelve

Respuesta: ChatGPT puede inventar con seguridad porque su modelo está hecho para continuar texto de forma plausible, palabra por palabra, y nada en ese mecanismo verifica si lo que escribe es cierto.

Respuesta modelo:

«Por dentro, ChatGPT tiene un programa que hace una sola cosa: adivinar la palabra que viene, una tras otra, según cómo suele seguir el texto que leyó durante su entrenamiento. Siempre hay una palabra siguiente que “suena bien”, sepa o no la respuesta. Si le preguntas algo que no estaba en lo que leyó, como el clima de mañana, igual arma una respuesta que suena correcta. Suena segura porque imita cómo escribimos las personas, no porque haya comprobado nada.»
  1. Idea 1: el mecanismo es continuar texto palabra por palabra.
  2. Idea 2: ese mecanismo no verifica hechos; imita la forma del texto (lámina 45).

Criterios con que Datito lo revisa: dice qué hace el modelo; explica por qué eso no incluye verificar; si nombra ChatGPT, lo separa del modelo que tiene dentro; no promete que «con más datos deja de alucinar».

Error típico: explicarlo como «se equivoca porque le falta información». Es incompleto: aunque le falte, el mecanismo no tiene cómo decir «no sé», y por eso la respuesta sale igual de segura.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:54] · redacción [DATITO]

Distinción de certamen · P5 (la mitad LLM)

Dos de las alternativas de la P5 se caen con la lámina 45: la que dice que los LLM son excelentes para hechos recientes y para planificar, y la que dice que no requieren muchos datos ni cómputo (certamen_2.html#p5). El enunciado pide responder «según la descripción»: se contrasta con la lámina, no con tu experiencia usando ChatGPT. La distinción que prepara la otra mitad: el modelo (GPT) ≠ el sistema (ChatGPT). Pregunta: ¿son verdaderas las alternativas 1 y 4 de la P5?
Respuesta correcta y cómo se resuelve

Respuesta: las dos son falsas: la lámina 45 dice que los LLM son malos para hechos, para información posterior a su entrenamiento y para planificar, y que necesitan muchos datos y cómputo.

  1. Alternativa 1 («excelentes para hechos recientes y planificar»): la lámina 45 dice lo contrario en los tres puntos.
  2. Alternativa 4 («no requieren grandes cantidades de datos ni cómputo»): la lámina 45 dice que, por tener miles de millones de parámetros, necesitan muchos datos y poder de cómputo.

Error típico: marcar la 1 porque «ChatGPT me responde cosas recientes». Es error porque eso lo hace el sistema con herramientas (un agente), no el LLM solo, y el enunciado pide contrastar con la descripción de clase.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P5]

Procedimiento para el papel

  1. ¿La afirmación habla del modelo (un LLM, GPT) o de un sistema (ChatGPT, un agente)?
  2. Contrasta con las dos listas de la lámina 45: bueno para / malo para.
  3. Si la afirmación exige hechos verificados, información nueva o acciones, no describe a un LLM solo.
  4. Cifras con B: multiplica por 10⁹.

Errores que el formato castiga

3 · Agentes: el LLM dentro de un bucle

Qué agrega este eslabón: al LLM se le dan herramientas, memoria y objetivos, y lo más importante, un bucle: lo que pasa al actuar vuelve y condiciona lo que sigue.

En el simulador de abajo, alguien pregunta por el clima de mañana. Antes de correrlo: si activas «la herramienta falla», ¿qué hacen el LLM solo y el agente?
Respuesta correcta y cómo se resuelve

Respuesta: el LLM solo inventa un pronóstico con o sin falla, porque no tiene herramienta ni observación; el agente recibe el error como observación y puede avisar o reintentar, aunque eso no garantiza que no alucine.

  1. LLM solo: no hay herramienta, así que «la herramienta falla» no cambia nada; genera palabras plausibles e inventa (el ejemplo del clima del profesor).
  2. Agente: emite el token de herramienta, el sistema la ejecuta, y el resultado —aquí, el error— vuelve a su contexto.
  3. Con el error en el contexto, la continuación más razonable es avisar o reintentar.
  4. Pero si el LLM ignora la observación, alucina igual dentro del sistema.

Error típico: «el agente nunca inventa porque tiene herramientas». Es error: el bucle hace que el resultado entre al contexto, no obliga al LLM a usarlo bien.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:27, 2:50:44–2:51:08 y 2:53:37–2:54:19] · simulación [DATITO]

instrucciones → pregunta → LLM genera tokens → token de herramienta → la herramienta se ejecuta → observación vuelve → LLM sigue generando → ⟨detente⟩
LLM solo
Agente (LLM + herramienta + bucle)
—
LLM solo: ¿volvió el resultado de una acción?
—
agente: ¿volvió el resultado de una acción?

[DATITO] Simulación con textos y cifras ilustrativas. El caso del clima es el ejemplo del profesor [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:48:15–2:48:33].

La separación que hizo el profesor

Un compañero preguntó por las bases de datos vectoriales que permiten buscar en un libro completo, justo después de que el profesor dijera que los LLM son malos con información posterior a su entrenamiento [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:59–2:47:17]. La respuesta es la P5 en una línea:

«bueno, lo que pasa es que estoy hablando de la LLM no estoy hablando de los agentes» Clase del 21-ago · 2:47:19–2:47:23 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]
Lámina 46 (definición oficial). Un agente puede realizar acciones autónomas sin intervención humana constante · puede contar con un humano en el proceso para mantener el control · tiene memoria para almacenar preferencias y conocimiento · un LLM puede encargarse del procesamiento de información y la toma de decisiones · debe percibir y procesar la información de su entorno · puede usar herramientas (internet, intérpretes de código, llamadas API) · puede colaborar con otros agentes o con humanos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 46].

Lámina 47 (diagrama). Memoria, herramientas y objetivos alimentan al agente; el agente produce acciones sobre el entorno, y las observaciones vuelven al agente. El texto extraído de FCD-08 no trae la figura; el diagrama lo transcribe [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase8_DL_LLMs_Agentes.md · sección 8.9.2].

En clase el profesor lo resumió así: el agente tiene por dentro acceso a un LLM que genera texto, además memoria, acceso a herramientas y objetivos muy claros [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:49:30–2:49:46]. Se construye dándole instrucciones (qué tipo de agente es, en qué se especializa, cómo debe responder) y declarándole las herramientas que tiene: una API del clima, otro agente que genera imágenes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:49:48–2:50:34]. Y así funciona por dentro:

«empiezan a generar el siguiente ⟨token⟩ en la siguiente palabra […] y generan una palabra especial con la cual se conectan a la herramienta ejecutan la herramienta después le devuelve ⟨al agente⟩ recibe la respuesta de la herramienta […] y de nuevo siguen ⟨prediciendo⟩ la siguiente palabra» Clase del 21-ago · 2:50:44–2:51:08 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md] · ⟨⟩ = corrección de transcripción [INFERENCIA] (el ASR escribe «toque», «a la gente» y «precisando»)
Distinción de certamen · P5: generar texto ≠ ejecutar acciones y observar su resultado [FUENTE · Repo: 07_DATITO/06_AUDITORIAS/patron_evaluacion.md · §1, fila P5]. Fíjate en la cita: el agente también genera tokens; hasta la llamada a la herramienta es una «palabra especial». Así que la diferencia no es «genera texto / no genera texto». Es el bucle cerrado: el resultado de la acción vuelve como observación y condiciona la palabra siguiente (lámina 47). El LLM solo genera y no se entera de nada de lo que pasa afuera. Ficha completa: certamen_2.html#p5.

Pregunta de la P5: ¿cuál(es) de estas afirmaciones es(son) correcta(s) según la descripción? (1) los LLM son excelentes para hechos recientes y planificar a largo plazo; (2) un agente puede usar herramientas, almacenar conocimiento y actuar de forma autónoma, mientras que un LLM se limita principalmente al procesamiento de información y generación de texto; (3) los agentes no pueden colaborar con otros agentes ni con humanos; (4) los LLM no requieren grandes cantidades de datos ni poder de cómputo.
Respuesta correcta y cómo se resuelve

Respuesta: solo la 2 es correcta.

  1. (1) Falsa: la lámina 45 dice que los LLM son malos para hechos, para información posterior a su entrenamiento y para razonar y planificar.
  2. (2) Correcta: la lámina 46 atribuye al agente herramientas, memoria y acción autónoma, y deja al LLM el procesamiento de información.
  3. (3) Falsa: la lámina 46 cierra con «pueden colaborar con otros agentes o con humanos».
  4. (4) Falsa: la lámina 45 dice que necesitan muchos datos y poder de cómputo.

Error típico: dudar de la 2 porque «el agente también genera texto». Es cierto que genera texto, pero la alternativa dice que el LLM se limita a eso, y el agente agrega herramientas, memoria y acción: la afirmación sigue siendo correcta.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 45–46] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P5, enunciado textual de Canvas]

El bucle no elimina la alucinación. En funciones críticas se arman varios agentes, uno que hace la tarea y otro que la revisa, con un auditor; eso baja la tasa de alucinación, pero igual se puede colar una en el sistema [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:53:37–2:54:19]. Y queda la responsabilidad: si un sistema autónomo falla, ¿quién responde? Por eso hasta hoy los agentes suelen funcionar supervisados, como asistentes del humano [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:54:23–2:54:43]. Ejemplos oficiales (lámina 48): agentes de monitoreo y mantenimiento, operacionales, de análisis documental y de asistencia a operadores.

«el desarrollo agente es como desarrollo software con una LLM metida adentro y que básicamente funciona super bien tiene ciclos de razonamiento ciclos de chequeo, lo que están haciendo» Clase del 21-ago · 3:23:57–3:24:07 · profesor · [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md]

Un detalle que confirma que el LLM es una pieza: el profesor contó en la Clase del 31-jul que en sus propios proyectos con agentes usa como backbone un LLM pagado, porque corre más rápido que en una GPU local [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:21:54–1:22:47].

Ejercicio de interpretación · leer una traza

[DATITO] Traza ilustrativa de un agente de bodega en una planta:

1 [usuario] ¿Quedan repuestos del rodamiento R-220? 2 [LLM] Voy a revisar el inventario. 3 [LLM] ⟨herramienta: inventario("R-220")⟩ 4 [herramienta] {"stock": 0, "orden_en_curso": "OC-5531"} 5 [LLM] No quedan; hay una orden de compra en curso (OC-5531). 6 [LLM] ⟨detente⟩

(a) ¿Qué líneas produce el LLM? (b) ¿Quién ejecuta la línea 4? (c) ¿Dónde se cierra el bucle? (d) ¿La línea 5 garantiza que no hubo alucinación?

Respuesta correcta y cómo se resuelve

Respuesta: (a) las líneas 2, 3, 5 y 6; (b) la línea 4 la ejecuta el sistema que rodea al LLM; (c) el bucle se cierra entre la 4 y la 5; (d) no, la línea 5 no garantiza que no haya alucinación.

  1. (a) Incluye la 3 y la 6: la llamada a la herramienta y el «detente» también son tokens que genera el LLM.
  2. (b) El LLM no ejecuta nada; solo emite el token que pide la herramienta.
  3. (c) El resultado de la acción (línea 4) vuelve al contexto y la línea 5 depende de él. Sin la 4, la 5 sería una invención.
  4. (d) El LLM pudo leer mal u omitir algo de la observación; por eso existen revisores y supervisión humana.

Error típico: atribuir la línea 4 al LLM («el LLM consultó el inventario»). Es error porque confunde pedir la acción (un token) con ejecutarla.

[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:50:44–2:51:08 y 2:53:37–2:54:19] · traza [DATITO]

Ejercicio de transferencia · planta concentradora

[DATITO] Dos sistemas en una planta: (A) un LLM al que le pegas las notas del turno y te devuelve el informe redactado; (B) un sistema que cada 5 minutos lee sensores por una API, detecta una vibración anómala, abre una orden de trabajo en el sistema de mantenimiento y consulta si quedó abierta. ¿Cuál es un agente según las láminas 46–47? Nombra qué atributos tiene cada uno y dónde está el bucle.

Respuesta correcta y cómo se resuelve

Respuesta: B es un agente y A no: A es un LLM usado como asistente de escritura, mientras que B percibe, usa herramientas, actúa y observa el resultado de su acción.

  1. A procesa el texto que le das y genera texto (lámina 45, asistente de escritura). No percibe el entorno por sí mismo, no usa herramientas, no actúa.
  2. B percibe el entorno (sensores), usa herramientas (la API de sensores y el sistema de mantenimiento), actúa (abre la orden) y observa el resultado (consulta si quedó abierta).
  3. El bucle de B: abrir la orden → consultar → la respuesta condiciona lo siguiente (lámina 47). Es casi literal el «agente de monitoreo y mantenimiento» de la lámina 48.
  4. Queda por decidir en B si hay un humano en el proceso (la lámina 46 lo permite) y quién responde si la orden sale mal.

Error típico: llamar agente a A «porque usa IA». Es error porque la definición exige atributos concretos (herramientas, percepción, acción), no el uso de un LLM.

[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 45–48] · caso de la planta [DATITO]

Caso auditable: Datito como agente [INFERENCIA]

Este tutor es un sistema con un LLM adentro. Las piezas existen en el repositorio y las puedes abrir:

PiezaEn DatitoDónde mirar
Instrucciones y objetivosEl protocolo pedagógico.claude/skills/datito/SKILL.md, CLAUDE.md
HerramientasLeer y escribir archivos; consultar el cuaderno de NotebookLM por MCPallowed-tools en SKILL.md; .mcp.json
MemoriaEstado del aprendizaje y registro de sesiones07_DATITO/progreso.yaml, 07_DATITO/07_BITACORA/
Varios agentesTareas que corren aisladasdatito-visual, datito-corregir (context: fork)
RevisorAuditor de diseño instruccional.claude/skills/datito-pedagogia/SKILL.md

Producción · audítalo tú

Para cada atributo de la lámina 46, decide si Datito lo cumple y con qué archivo de la tabla lo pruebas. Después escribe, en cinco líneas, qué lo separa de un chatbot al que le adjuntas documentos. Llévalo a Datito: es la pregunta con que abre este concepto.

Respuesta correcta y cómo se resuelve

Respuesta: lo que hace de Datito un agente y no un chatbot con documentos es que usa herramientas para actuar sobre su entorno (lee y escribe archivos, consulta NotebookLM), guarda memoria entre sesiones y cierra un bucle: lo que escribe (tu progreso) vuelve a leerse y condiciona la sesión siguiente [INFERENCIA].

Atributo de la lámina 46¿Lo cumple?Evidencia
Acciones autónomasSí, acotadasEscribe progreso.yaml y la bitácora sin que tú edites nada
Humano en el procesoSíEl bucle socrático espera tu respuesta (CLAUDE.md)
MemoriaSí07_DATITO/progreso.yaml, 07_DATITO/07_BITACORA/
LLM que procesa y decideSíEl modelo que ejecuta SKILL.md
Percibe su entornoSíLee el repositorio y tu estado antes de cada sesión
Usa herramientasSíallowed-tools de SKILL.md; MCP en .mcp.json
Colabora con otros agentesSíForks datito-visual, datito-corregir; auditor datito-pedagogia

Respuesta modelo (cinco líneas):

«Un chatbot con documentos adjuntos solo genera texto a partir de lo que le pegaste: no hace nada fuera de la conversación y no se entera de nada que pase después. Datito tiene un LLM adentro, pero además herramientas (leer y escribir archivos, consultar NotebookLM), memoria que dura entre sesiones (progreso.yaml y la bitácora) y objetivos fijados en sus instrucciones. Actúa sobre su entorno —registra mi progreso— y en la sesión siguiente lee ese resultado y decide qué preguntarme. Ese bucle acción → observación es lo que la lámina 47 llama agente. Igual tiene límites: depende de sus herramientas y puede equivocarse.»

Criterios con que Datito lo revisa: cada atributo con evidencia concreta (un archivo); nombra el bucle (qué acción, qué resultado vuelve, qué cambia después); reconoce lo que no puedes verificar; no confunde «tiene documentos» con «usa herramientas».

Error típico: «es un agente porque tiene mucha información». Es error: tener documentos es contexto, no herramientas ni acción; un chatbot con adjuntos también lo tiene.

[INFERENCIA] sobre .claude/skills/datito/SKILL.md, CLAUDE.md, .mcp.json y 07_DATITO/ · [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 46–47]

En el certamen, responde con las láminas 46–47, no con Datito. El caso sirve para entender; la corrección se hace contra la definición de la lámina.

Procedimiento para el papel

  1. Separa el componente (LLM) del sistema (agente): ¿qué sujeto tiene la afirmación?
  2. Busca en cada opción los atributos de la lámina 46.
  3. Pregunta si el resultado de una acción vuelve y condiciona lo siguiente (lámina 47).
  4. Desconfía de los absolutos: «no pueden colaborar», «nunca necesitan un humano», «no alucinan».

Errores que el formato castiga

4 · Qué tendría que verte hacer

EvidenciaDeep learningLLMAgentes
EXPLICARQué cambió en 2012 y por qué no fue la ideaPor qué «predecir la siguiente palabra» genera textoQué agrega el bucle al LLM
APLICARClasificar ítems según la cláusula de la P6Probabilidad de una secuencia a manoMarcar en una traza qué es LLM, herramienta y observación
INTERPRETARLeer la lámina 8 sin inventarle un umbralLeer un vector de atenciónDecir qué garantiza y qué no una observación
TRANSFERIRElegir entre clásico y red en otro dominio«Hacer lo de BERT» con datos continuosDistinguir agente de asistente en una planta
Redes neuronales → Deep learning → LLM → Agentes · Certamen 2 · P5 Certamen 2 · P6

Cierre de la Clase 18 · Deep learning, LLM y agentes

Qué aprendiste

  • Deep learning: redes profundas que dominan imagen y texto cuando hay muchos datos.
  • Con pocos datos tabulares, los algoritmos clásicos suelen ganar.
  • Un LLM predice la siguiente palabra.
  • Un agente es un LLM con herramientas y objetivos, cuyo resultado vuelve y condiciona lo siguiente.

Qué no debes confundir

  • Generar texto ≠ ejecutar acciones y observar su resultado (C2 P5).
  • Avance mediante redes ≠ factor que lo hizo posible (C2 P6).
  • GPT (el modelo) ≠ ChatGPT (el sistema).

Procedimiento para el papel

  1. ¿Aprende sus propias variables? Es deep learning.
  2. ¿Solo genera texto? Es un LLM.
  3. ¿Actúa con herramientas y observa el resultado? Es un agente.

Viene de: Clase 17 · Redes neuronales · Sigue: Clase 20 · Distinciones del Certamen 1

Vuelve a tu activación: Un chatbot que puede buscar en Internet y leer lo que encuentra, ¿es un LLM o un agente? ¿Cambiarías tu respuesta?

Pregunta final. Un modelo genera un token especial que llama a una calculadora y usa el resultado para seguir. ¿Es un LLM o un agente?
Respuesta correcta y cómo se resuelve

Un agente: actúa con una herramienta y el resultado vuelve y condiciona lo que genera después. [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:50:44]

El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.

Continuar → Clase 20 · Distinciones del Certamen 1