Objetivo. Distinguir deep learning, LLM y agente, y separar lo que avanzó mediante redes de lo que lo hizo posible.
- Evidencia de aprendizaje: Separa en una lista qué es avance mediante redes y qué es factor habilitante, y explica el bucle del agente.
- Actividad final: Clasificar los siete ítems de la P6 y recorrer el simulador de agente de la P5.
- Criterio de dominio: Explica la diferencia entre LLM y agente por el bucle cerrado: acción, observación, siguiente paso.
Deep learning, LLM y agentes
Una sola cadena causal: cada eslabón agrega una pieza al anterior, y cada uno tiene
su propia evidencia.
Fundamentos de Ciencia de Datos · UdeC · Clase del 21-ago (la clase del profesor empieza en 1:35:51)
| Eslabón | Qué agrega | Láminas de FCD-08 |
|---|---|---|
| Red neuronal → deep learning | Muchas capas, muchos datos y GPU para entrenarlas | 6–10, 65 |
| Deep learning → LLM | Atención (transformers) y una tarea: adivinar la palabra oculta, en particular la siguiente | 33–40, 45 |
| LLM → agente | Herramientas, memoria, objetivos y el bucle acción → observación | 46–48 |
Cada sección sigue el mismo orden: predicción → explicación con la fuente → ejercicios (aplicar, interpretar, transferir, producir) → distinción de certamen → procedimiento para el papel → errores castigados.
1 · Deep learning: cuando las redes encontraron datos y GPU
Respuesta correcta y cómo se resuelve
Respuesta: en 2012 se entrenaron redes profundas en GPU sobre un dataset enorme (ImageNet, 1,2 M imágenes); la idea de red neuronal ya existía.
- Fecha de la idea: el perceptrón es de los años 40 (clase y lámina 51), así que «se inventó en 2012» queda descartado.
- Qué dijo el profesor que pasó: se aplicó deep learning de forma significativa y los autores usaron GPU para ajustar la red muy rápido.
- Qué datos tenía: 1,2 M imágenes de entrenamiento (lámina 6).
Error típico: creer que 2012 fue el invento de las redes. Es error porque confunde la idea (antigua) con las condiciones que la hicieron funcionar (GPU y datos).
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:38–1:44:12] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6 y 51]
Lo que pasó en ImageNet
ImageNet es un desafío de reconocimiento visual: 1,2 millones de imágenes de entrenamiento y 1000 categorías de objetos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 6]. Según el profesor, hasta 2011 el error rondaba el 25 %, en 2012 bajó a cerca de 16 %, siguió bajando y en 2015 llegó al nivel de la visión humana [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:46–1:43:36] ⚠.
Ese «10%» son puntos porcentuales: de ~25 a ~16, casi 10 puntos, como él mismo repite después [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:33–1:44:41]. ¿Y qué lo produjo? Lo que se aplicó de forma significativa fue deep learning, en buena parte porque los autores usaron GPU —tarjetas pensadas para videojuegos— para ajustar la red muy rápido. Soluciones con GPU en el desafío: 0 en 2010, 0 en 2011, 4 en 2012, 60 en 2013 y 110 en 2014 [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:38–1:44:31] ⚠.
Las redes no nacieron en 2012. El perceptrón es de los años 40; las redes fueron populares en los 80, algo en los 90, después se abandonaron, y en 2012 despegaron. El Premio Turing 2018 reconoció a tres de sus pioneros por insistir cuando nadie creía en ellas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:55:24–2:56:38] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 51]. Guarda esto para la P6: lo que cambió en 2012 no fue la idea, fueron las condiciones.
Qué es deep learning (la definición oficial)
Deep learning es el concepto; hoy se implementa casi siempre con redes neuronales [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:47:58–1:48:14]. Y según el profesor, casi toda la IA que usamos hoy es deep learning [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:45:01–1:45:07].
El ejemplo de clase son las caras: para reconocer una cara, primero hay que reconocer ojos, nariz y boca; para eso, antes, líneas, puntos y curvas. La red recibe los píxeles directamente, sin atributos calculados, y aprende sola esos niveles, sin que nadie le pida buscar líneas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:46:58–1:47:56]. Un compañero preguntó si eso ocurre de verdad o es teoría. La respuesta tiene un matiz que conviene recordar tal cual:
Agregó que en las redes de 2012–2014 sí se veían filtros parecidos a los que armaría un humano, y también muchos que un humano no armaría [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:51:52–1:52:14]. La extracción automática de características está desarrollada en redes_neuronales.html, sección 9.
La lámina que decide cuándo conviene: la 8
Lámina 8, «Técnicas de ML en función de la cantidad de datos»: desempeño contra cantidad de datos, con dos curvas, Deep Learning y Algoritmos Clásicos [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8]. El profesor advirtió que el gráfico es un dibujo, no una medición [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:45:17–1:45:23], y lo leyó así:
¿Cuántos datos son «muchos»? En la Clase del 7-ago el profesor respondió que no hay un número: depende del problema [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:22]. Y cerró con una advertencia:
log1p(Price): MAE 188.218 AUD y R² 0,757 en las
7.244 propiedades de 2017, entrenado con 6.336 de 2016
[FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json]. Entró una
tabla con columnas elegidas por ti: el flujo clásico. Repaso del modelo ganador en
arboles_y_ensambles.html#boosting.
Lo que no hay: ninguna red neuronal entrenada sobre Melbourne en el repositorio [NO EVIDENCIADO]. «El boosting le gana a una red» no está medido en tus datos.
Tu pregunta (la de entrada de Datito para este concepto): en tus datos tabulares de Melbourne se espera que el boosting le gane a una red profunda. ¿Por qué, si el deep learning domina en imágenes y texto? Contéstala con la lámina 8 y la cita del 7-ago antes de abrir.
Respuesta correcta y cómo se resuelve
Respuesta: porque la ventaja del deep learning aparece con muchos datos y con señal cruda de la que extraer características, y Melbourne es lo contrario: 6.336 filas de entrenamiento en una tabla cuyas columnas ya eligió un humano; en ese régimen un modelo clásico de árboles suele ganar, aunque en tu repositorio no está medido.
- Cantidad de datos (lámina 8): con pocos datos los algoritmos clásicos funcionan mejor; con muchos, deep learning. 6.336 filas no se parecen a 1,2 M imágenes, aunque el cruce no tenga un número fijo (Clase del 7-ago).
- Tipo de dato: la gracia de deep learning es extraer características desde el dato crudo (píxeles, texto). En Melbourne las características ya estaban calculadas: esa ventaja no tiene dónde operar.
- Evidencia del profesor: un random forest supera a una red muy compleja «mucho más seguido» de lo que uno cree (cita del 7-ago).
- Límite honesto: es una expectativa bien fundada, no una medición: no hay red entrenada sobre Melbourne en el repositorio.
Error típico: responder «porque el boosting es mejor que las redes». Es error porque convierte una dependencia del régimen de datos (lámina 8) en una jerarquía fija de métodos; en ImageNet la relación es la inversa.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:34] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] [FUENTE · Repo: 09_RESULTADOS/resultados_temporal.json] · la aplicación a Melbourne es [INFERENCIA]
Distinción de certamen · P6
Ojo: la lámina pone los tres factores juntos como explicación del boom. La P6 pregunta otra cosa: qué tecnologías son revoluciones recientes de la IA «mediante el uso de redes neuronales». Esa cláusula es lo que decide (certamen_2.html#p6).
Para ordenarlo, Datito usa un marco propio [DATITO]: avance mediante redes (un área donde las redes produjeron el salto) frente a factor habilitante (lo que hizo posible entrenarlas o usarlas). El expediente lo llama «causa ≠ condición habilitante». No es terminología del profesor: en el certamen argumenta con la cláusula del enunciado y con las láminas, no con el marco.
Ejercicio de aplicación. Clasifica cada ítem antes de ver el veredicto.
Respuesta correcta y cómo se resuelve (los siete ítems)
Respuesta: avances mediante redes son 1, 2 y 5; factores habilitantes son 3 y 4; la nube (6) no es avance mediante redes (a lo más habilitante); las bases relacionales (7) no son ninguna de las dos.
| Ítem | Respuesta | Por qué | Fuente |
|---|---|---|---|
| 1 · Objetos en fotos | Avance mediante redes | El salto de ImageNet en 2012 lo dieron redes profundas | Láminas 6–7 |
| 2 · Texto (GLUE) | Avance mediante redes | GPT, BERT y sucesores son transformers, redes basadas en atención | Láminas 33–34 |
| 3 · GPU | Habilitante | Permitió entrenar redes rápido; no salió de ellas | Lámina 65; clase 1:43:50–1:44:12 |
| 4 · Muchos datos | Habilitante | Las redes los necesitan para superar a los clásicos | Láminas 8 y 65 |
| 5 · Imágenes desde texto | Avance mediante redes | Los modelos de difusión son redes que quitan ruido | Láminas 42–43; clase 2:36:49–2:37:37 |
| 6 · Nube | No es avance mediante redes | La lámina 65 no la nombra; a lo más ayuda a entrenar y servir modelos [INFERENCIA] | P6 del Certamen 2 |
| 7 · Bases relacionales | Ninguna | Anteriores y ajenas a las redes; no aparecen en la clase [INFERENCIA] | P6 del Certamen 2 |
- Lee la cláusula: ¿la pregunta es por avances mediante redes o por los factores del boom?
- De cada ítem pregunta: ¿es un área donde las redes produjeron un salto, o algo que las hizo posibles, o nada de eso?
- Marca solo lo que responde a la cláusula.
Error típico: marcar la nube o la GPU porque «fueron clave». Es error porque son verdaderas como historia y falsas como respuesta a una pregunta acotada a «mediante el uso de redes neuronales».
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6–8, 33–34, 42–43 y 65] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:43:50–1:44:12 y 2:36:49–2:37:37] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P6] · marco «habilitante» [DATITO]
Ejercicio de cálculo
Con las cifras dictadas en clase (⚠, orden de magnitud): error de ~25 % en 2011 y ~16 % en 2012. (a) ¿Cuántos puntos porcentuales bajó? (b) ¿Qué porcentaje de los errores de 2011 desapareció? (c) Si el conjunto de evaluación tuviera 100.000 imágenes [DATITO, cifra ilustrativa], ¿cuántas imágenes mal clasificadas menos habría?
Respuesta correcta y cómo se resuelve
Respuesta: (a) 9 puntos porcentuales; (b) desapareció el 36 % de los errores; (c) 9.000 imágenes mal clasificadas menos.
- (a) Diferencia directa: 25 − 16 = 9 puntos. Es el «10%» redondeado de la cita.
- (b) Proporción sobre el punto de partida: 9 / 25 = 0,36 = 36 %.
- (c) 25 % de 100.000 = 25.000 errores; 16 % = 16.000; diferencia 9.000.
Error típico: decir que el error «bajó 9 %» o que bajó «un 10 % de los errores». Es error porque mezcla puntos porcentuales (resta) con cambio relativo (división): «bajó 9 puntos» y «bajó 36 %» describen el mismo salto.
Cifras dictadas: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:42:46–1:43:08] ⚠ · 100.000 imágenes [DATITO]
Ejercicio de interpretación
Soluciones con GPU en el desafío: 0, 0, 4, 60 y 110 entre 2010 y 2014 (⚠ dictado). ¿Qué dicen esos números? ¿Prueban, por sí solos, que la GPU causó la caída del error?
Respuesta correcta y cómo se resuelve
Respuesta: los números muestran que el uso de GPU se difundió después del resultado de 2012; por sí solos no prueban que la GPU causara la caída del error.
- Mira el orden temporal: 4 soluciones con GPU en 2012 y 60 y 110 en los dos años siguientes. El aumento viene después del salto.
- Busca la explicación del profesor: al ver el resultado, los investigadores fueron a mirar cómo se hizo, vieron que usaban GPU y todos empezaron a usarlas [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:33–1:44:49].
- Pregunta qué aísla el conteo: nada. No separa el aporte de la GPU del de la red o del de los datos; la lámina 65 los presenta juntos.
- Tradúcelo a la P6: la GPU habilitó entrenar redes grandes; no es un «avance mediante redes».
Error típico: leer un conteo de adopción como prueba causal («como después todos usaron GPU, la GPU explicó el salto»). Es error porque la adopción es una consecuencia del resultado, y un conteo no separa causas que actuaron juntas.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:44:15–1:44:49] ⚠ · [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 65] · lectura causal [INFERENCIA]
Ejercicio de transferencia · forestal
[DATITO] Una forestal tiene dos fuentes: (a) 3.000 fichas de rodales con 15 variables medidas en terreno por técnicos, y (b) 2 millones de fotos de dron, de las cuales solo 20.000 tienen etiqueta de especie. Para cada una: ¿qué te pide mirar la lámina 8 antes de elegir entre un algoritmo clásico y deep learning? ¿Qué trabajo haría la red por ti en (b) que en (a) ya está hecho?
Respuesta correcta y cómo se resuelve
Respuesta: la lámina 8 pide mirar la cantidad de datos; para las fichas (a) conviene partir con un modelo clásico, y en las fotos (b) la red haría por ti la extracción de características que en (a) ya hicieron los técnicos.
- Lámina 8: mira la cantidad de datos, sabiendo que el cruce no tiene un número fijo: depende del problema (Clase del 7-ago). Nada de esto se decide sin validar.
- (a) 3.000 filas y 15 variables ya elegidas por humanos: régimen de pocos datos y flujo clásico. Empieza por árboles, random forest o boosting; prueba una red solo si la validación lo justifica.
- (b) Es señal cruda, píxeles. Ahí la red haría la extracción de características que en (a) hicieron los técnicos (clase 1:50:41–1:50:57).
- Cuántos datos tiene (b) de verdad: para aprendizaje supervisado cuentan los etiquetados (20.000), no los 2 millones [INFERENCIA]. Las fotos sin etiqueta sirven con otra idea, el autoaprendizaje (sección 2).
Error típico: decir «(b) tiene 2 millones de datos, así que deep learning gana seguro». Es error por dos lados: solo 20.000 tienen etiqueta, y la lámina 8 es un dibujo sin umbral; la decisión final la toma la validación.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:15–1:36:22] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 1:50:41–1:50:57] · caso forestal [DATITO]
Producción · explícaselo a alguien
Tu jefe de turno en una mina te dice: «el deep learning ganó ImageNet, así que el modelo de consumo de combustible de los camiones (una tabla de 12 columnas) tiene que ser una red». Respóndele en cinco líneas. Escríbelo antes de abrir los criterios y llévalo a Datito.
Respuesta correcta y cómo se resuelve
Respuesta: que una red haya ganado ImageNet no dice nada sobre una tabla de 12 columnas: la ventaja del deep learning depende de tener muchos datos y señal cruda, así que hay que comparar modelos con validación antes de exigir una red.
Respuesta modelo (cinco líneas):
«Jefe, ImageNet eran 1,2 millones de fotos, y la red ganó porque aprendió sola qué mirar en los píxeles. Nuestro caso es otro: una tabla de 12 columnas que ya elegimos nosotros, con bastantes menos filas. La lámina que vimos en el curso muestra que con pocos datos los modelos clásicos rinden mejor, y el profesor advirtió que un random forest le gana a una red compleja más seguido de lo que uno cree. Propongo entrenar un boosting y una red, validarlos con datos de otro período y quedarnos con el que se equivoque menos en litros.»
- Separa el tipo de dato: señal cruda (fotos) frente a tabla con columnas elegidas.
- Usa la lámina 8 sin inventarle un umbral.
- Cierra con un criterio verificable (validación fuera de muestra), no con prestigio.
Criterios con que Datito lo revisa: distingue los tipos de dato; usa la lámina 8 sin umbral inventado; propone validar; no afirma que «la red va a perder», porque tampoco está medido.
Error típico: contestar «las redes no sirven para tablas». Es error porque cambia un dogma por otro: la lámina 8 describe un régimen, no una prohibición.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 6 y 8] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-07T22_14_16Z_Fundamentos_en_Ciencia_de_Datos.md · 1:36:29–1:36:34] · caso minero y redacción [DATITO]
Procedimiento para el papel
- ¿La afirmación habla del concepto (niveles de abstracción, capas jerárquicas: lámina 10) o de la implementación (redes neuronales)?
- Si compara deep learning con algoritmos clásicos, busca la cantidad de datos (lámina 8). Sin ese dato, «siempre es mejor» es falso.
- Si pregunta por el boom: los tres factores de la lámina 65. Si pregunta por revoluciones «mediante redes»: áreas donde las redes dieron el salto (visión, lenguaje), no la infraestructura.
- Cifras: las de la lámina (1,2 M imágenes, 1000 categorías), no las de la voz.
Errores que el formato castiga
- «Deep learning siempre funciona mejor que los algoritmos clásicos.» Solo con muchos datos, y el cruce depende del problema.
- «Las redes neuronales se inventaron en 2012.» El perceptrón es de los años 40.
- Marcar la GPU, los datos o la nube como «revolución mediante redes».
- Escribir que ImageNet tiene 1200 imágenes (error de la grabación; lámina 6: 1,2 M).
- Presentar el ejemplo de las caras como garantía: depende de la arquitectura.
- Usar «deep learning» y «red neuronal» como sinónimos exactos.
2 · LLM: una red que predice la siguiente palabra
Qué agrega este eslabón: una arquitectura (el transformer, basado en atención) y una tarea de entrenamiento muy simple: adivinar una palabra tapada, y en particular la siguiente. Antes de la explicación, un juguete.
Respuesta correcta y cómo se resuelve
Respuesta: sí: el juguete puede escribir oraciones completas que no están en su corpus, porque encadena pares de palabras que sí vio; lo que no puede es usar una palabra que nunca vio.
- Cada paso solo exige que la pareja (palabra anterior → siguiente) exista en el corpus.
- «perro» aparece en dos frases distintas, así que desde «hola» se puede saltar de una frase a la otra: hola → perro → se → puso → muy → bien → y → tú.
- Esa oración completa no está en ninguna de las cuatro frases: el indicador del panel lo confirma.
- Pero una palabra ausente del corpus («ratón») no está en ninguna fila de la tabla: nunca puede salir.
Error típico: creer que un modelo de siguiente palabra solo «repite frases memorizadas». Es error porque lo que guarda son probabilidades de continuación, no frases, y combinarlas produce secuencias nuevas.
Juguete [DATITO] · que un modelo no aprende lo que no está en sus datos: [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:04:26–0:04:42]
La primera frase imita el ejemplo del profesor en la Clase del 31-jul (le das «hola cómo estás» y predice «muy», después «bien»…) [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:05:52–0:06:09]; la segunda es su frase del ejemplo de atención [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:16:07–2:16:11]. Las probabilidades salen de contar qué palabra siguió a cuál: cifras ilustrativas.
Tu pregunta (la de entrada de Datito para este concepto): un LLM solo predice el siguiente token. ¿Cómo puede algo así responder una pregunta que nunca vio escrita?
Respuesta correcta y cómo se resuelve
Respuesta: porque no guarda preguntas y respuestas, sino regularidades de cómo continúa el texto dado todo el contexto; al recibir una pregunta nueva, genera palabra por palabra la continuación más plausible según esas regularidades, igual que el juguete arma oraciones que no estaban en su corpus, pero a una escala enorme.
- Qué aprende: probabilidades de la palabra siguiente, no frases (lo mismo que viste en el juguete).
- Con qué contexto: el juguete solo mira la palabra anterior; un LLM mira todo lo escrito antes mediante atención, así que capta patrones mucho más largos (formato de pregunta y respuesta, gramática, asociaciones entre conceptos).
- Con cuántos datos: fue entrenado con prácticamente todo el texto disponible, así que casi cualquier pregunta nueva se parece en su estructura a muchas que sí vio.
- Por qué a veces falla: «plausible» no es «verdadero». Si la pregunta exige un hecho que no está en sus datos, continúa igual y alucina (lámina 45).
Error típico: responder «porque busca la respuesta en internet» o «porque entiende como una persona». Lo primero describe a un agente con herramienta, no a un LLM solo; lo segundo no explica el mecanismo que vio la clase.
[INFERENCIA] a partir de: [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:22:30–2:22:44 y 2:46:42–2:46:54] [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:06:04–0:06:34] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45]
Qué es un LLM, en palabras del profesor
Y son large porque tienen miles de millones de parámetros: son como la red de la clase, pero gigantes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:22:47–2:22:57]. En la Clase del 31-jul ya lo había adelantado, y agregó dos cosas que conviene separar: el modelo se entrena comparando la palabra que predice con la que realmente seguía, con la entropía cruzada como función de costo (la de clasificación); y cuando usas ChatGPT el modelo no se está entrenando, solo hace inferencia [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:08:06–0:11:04].
Cómo se llega ahí: atención, BERT y la última palabra
Atención. En 2017, el artículo Attention is all you need propuso armar el modelo solo con mecanismos de atención [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:14:54–2:15:18]. La idea: para representar una palabra dentro de su oración, la red «presta atención» a las otras. En el ejemplo del profesor, para representar «ladró» en «El perro café se puso feliz y me ladró», pone 30 % de atención en «ladró», 30 % en «feliz», 30 % en «perro» y 10 % en «café» [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:17:53–2:18:09] [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 35]. Esos porcentajes los calcula otra red, a partir de las correlaciones entre los vectores de las palabras, normalizadas para que sumen 1 [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:26:23–2:28:13]; y el profesor aclaró que los números del ejemplo los puso él para ilustrar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:28:42–2:28:44]. Como cada representación se puede entrenar en paralelo, se pudo entrenar con muchísimos más datos: de ahí los modelos fundacionales (lámina 36) [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:18:24–2:19:17].
BERT. Tapa al azar cerca del 15 % de las palabras (lámina 38) y la red tiene que adivinar la palabra oculta. Así el entrenamiento se vuelve un problema de clasificación: elegir, entre todas las palabras posibles, la que falta [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:20:15–2:21:09]. El paso que convierte eso en un generador de texto:
Repetir eso, palabra tras palabra, es generar texto; por eso se llama modelo generativo [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:21:38–2:22:09] (láminas 39–40, «Auto-Regressive Generative Transformers»). Es exactamente lo que hace el juguete de arriba, con una tabla en vez de una red.
GPT no es ChatGPT, y la palabra «detente»
Ya lo había dicho en la Clase del 31-jul: ChatGPT es un sistema multiagente que tiene un LLM por detrás [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 0:04:51–0:05:08]. Cuando aprietas enter, el modelo genera palabra por palabra y en algún momento genera una palabra especial que no te muestra, «detente»: ahí el sistema se detiene y te toca hablar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:24:28–2:24:38]. ChatGPT usa otras palabras especiales, por ejemplo una que activa el generador de imágenes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:24:43–2:25:07]. Guarda esa idea: es el mecanismo de los agentes (sección 3).
Por qué cuesta caro usarlo. Cada palabra generada es un forward completo por miles de millones de parámetros, para millones de personas a la vez; el gasto no está solo en entrenar [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:30:36–2:31:03]. Qué es un forward: redes_neuronales.html, sección 6.
Por qué alucinan
El ejemplo del profesor: si le preguntas a un LLM solo cómo estará el clima mañana, no tiene forma de saberlo, así que genera una palabra, otra y otra, e inventa [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:27]; está entrenado para generar palabras que sigan la distribución del texto que la humanidad ha escrito [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:42–2:46:54]. [DATITO] En el juguete lo ves directo: después de cada palabra siempre hay una siguiente con su probabilidad. El mecanismo no tiene una casilla para «no sé».
Ejercicio de cálculo
Con la tabla del juguete (la ves en el panel al elegir cada palabra), calcula a mano la probabilidad que le asigna a (a) «hola cómo estás ⟨detente⟩» y a (b) «hola cómo estás muy bien y tú ⟨detente⟩», partiendo de «hola». Después compruébalo en el panel. ¿Cuál es más probable, y qué te dice eso sobre las respuestas largas?
Respuesta correcta y cómo se resuelve
Respuesta: (a) vale 1/4 = 0,25 y (b) vale 1/16 = 0,0625; la corta es cuatro veces más probable.
- La probabilidad de una secuencia es el producto de las probabilidades de cada paso.
- (a) hola→cómo ½ · cómo→estás 1 · estás→⟨detente⟩ ½ = ¼ = 0,25.
- (b) hola→cómo ½ · cómo→estás 1 · estás→muy ½ · muy→bien ½ · bien→y 1 · y→tú ½ · tú→⟨detente⟩ 1 = 1/16 = 0,0625.
- Cociente: 0,25 / 0,0625 = 4.
Qué te dice: cada paso multiplica por un número ≤ 1, así que las secuencias largas tienden a ser menos probables, aunque (b) sea la frase completa del corpus. Por eso el momento en que sale «detente» importa tanto como las palabras: decide dónde termina la respuesta.
Error típico: sumar las probabilidades en vez de multiplicarlas, o creer que la frase del corpus tiene que ser la más probable. Sumar da números mayores que 1 y no representa «esto y después esto»; y el corpus no garantiza nada sobre la probabilidad de la frase completa.
[DATITO] tabla del juguete, contada desde su corpus
Ejercicio de interpretación
La lámina 35 muestra, para «ladró», nueve pesos de atención: 0.0 0.3 0.1 0.0 0.0 0.3 0.0 0.0 0.3. (a) ¿Qué significa el 0,3 de «perro»? (b) ¿Por qué suman 1? (c) ¿Qué no puedes concluir de estos números?
Respuesta correcta y cómo se resuelve
Respuesta: (a) el 30 % de la representación de «ladró» se arma mirando a «perro»; (b) suman 1 porque se normalizan como porcentajes; (c) no puedes concluir que sean los pesos de un modelo real ni que la red «entienda»: son ilustrativos.
Correspondencia palabra→peso: sigue el orden de la frase dicho en clase (El, perro, café, se, puso, feliz, y, me, ladró); el texto extraído de la lámina desordena las palabras, así que la correspondencia es [INFERENCIA], coherente con lo que el profesor dictó.
- (a) «perro» es el contexto que le dice a «ladró» quién ladró: por eso recibe peso.
- (b) Se calculan correlaciones y se normalizan para que sean porcentajes: 0,3 + 0,1 + 0,3 + 0,3 = 1.
- (c) El profesor dijo que los números los puso él para ilustrar; en un modelo real los calcula una red. Y un peso dice cuánto aporta una palabra a un vector, no que haya comprensión.
Error típico: leer el 0,3 como «probabilidad de que la palabra sea perro», o creer que el programador fija esos pesos. Lo primero confunde atención con predicción; lo segundo contradice lo que se explicó en clase.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 35] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:17:53–2:18:09 y 2:26:23–2:28:44]
Ejercicio de transferencia · estaciones meteorológicas
[DATITO] Tienes registros de 30 estaciones meteorológicas agrícolas con lecturas faltantes de temperatura. Alguien propone «hacer lo de BERT» para rellenarlas. ¿Qué sería exactamente? ¿Cuál es la etiqueta? ¿Es un problema de clasificación, como en BERT?
Respuesta correcta y cómo se resuelve
Respuesta: «hacer lo de BERT» sería tapar lecturas conocidas y entrenar un modelo que las reconstruya desde el resto; la etiqueta es la propia lectura tapada, y como la temperatura es un número continuo el problema es de regresión, no de clasificación.
- Tapa al azar una parte de las lecturas que sí conoces y entrena un modelo para reconstruirlas desde las otras horas y las otras estaciones.
- La etiqueta es el dato tapado: autoaprendizaje, como el in-painting de la Clase del 31-jul. Nadie tiene que etiquetar nada.
- BERT es clasificación porque elige entre las palabras de un vocabulario; una temperatura es continua: regresión. Mismo principio, otro tipo de problema.
- Valida con lecturas tapadas que el modelo nunca vio; si no, mides memoria y no reconstrucción (limpieza_preparacion.html).
Error típico: decir «es clasificación, como BERT». Es error porque el tipo de problema lo define el tipo de etiqueta, no el truco de enmascarar.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:20:15–2:21:09] [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:17:14–1:17:56] · caso de estaciones [DATITO]
Producción · explícaselo a alguien
Explícale a alguien que no estudia datos por qué ChatGPT puede inventar un dato con total seguridad. Usa solo dos ideas de esta sección y ninguna palabra técnica sin explicar. Llévalo a Datito.
Respuesta correcta y cómo se resuelve
Respuesta: ChatGPT puede inventar con seguridad porque su modelo está hecho para continuar texto de forma plausible, palabra por palabra, y nada en ese mecanismo verifica si lo que escribe es cierto.
Respuesta modelo:
«Por dentro, ChatGPT tiene un programa que hace una sola cosa: adivinar la palabra que viene, una tras otra, según cómo suele seguir el texto que leyó durante su entrenamiento. Siempre hay una palabra siguiente que “suena bien”, sepa o no la respuesta. Si le preguntas algo que no estaba en lo que leyó, como el clima de mañana, igual arma una respuesta que suena correcta. Suena segura porque imita cómo escribimos las personas, no porque haya comprobado nada.»
- Idea 1: el mecanismo es continuar texto palabra por palabra.
- Idea 2: ese mecanismo no verifica hechos; imita la forma del texto (lámina 45).
Criterios con que Datito lo revisa: dice qué hace el modelo; explica por qué eso no incluye verificar; si nombra ChatGPT, lo separa del modelo que tiene dentro; no promete que «con más datos deja de alucinar».
Error típico: explicarlo como «se equivoca porque le falta información». Es incompleto: aunque le falte, el mecanismo no tiene cómo decir «no sé», y por eso la respuesta sale igual de segura.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45] [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:54] · redacción [DATITO]
Distinción de certamen · P5 (la mitad LLM)
Respuesta correcta y cómo se resuelve
Respuesta: las dos son falsas: la lámina 45 dice que los LLM son malos para hechos, para información posterior a su entrenamiento y para planificar, y que necesitan muchos datos y cómputo.
- Alternativa 1 («excelentes para hechos recientes y planificar»): la lámina 45 dice lo contrario en los tres puntos.
- Alternativa 4 («no requieren grandes cantidades de datos ni cómputo»): la lámina 45 dice que, por tener miles de millones de parámetros, necesitan muchos datos y poder de cómputo.
Error típico: marcar la 1 porque «ChatGPT me responde cosas recientes». Es error porque eso lo hace el sistema con herramientas (un agente), no el LLM solo, y el enunciado pide contrastar con la descripción de clase.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · lámina 45] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P5]
Procedimiento para el papel
- ¿La afirmación habla del modelo (un LLM, GPT) o de un sistema (ChatGPT, un agente)?
- Contrasta con las dos listas de la lámina 45: bueno para / malo para.
- Si la afirmación exige hechos verificados, información nueva o acciones, no describe a un LLM solo.
- Cifras con B: multiplica por 10⁹.
Errores que el formato castiga
- «GPT y ChatGPT son lo mismo.»
- «El LLM busca en internet.» Solo, no: eso requiere una herramienta, y ya es un agente.
- «El modelo aprende mientras conversas con él.» Al usarlo solo hace inferencia.
- Leer «175 billones» como 175 × 10¹².
- «Los porcentajes de atención los fija el programador.» Los calcula una red; los del ejemplo eran ilustrativos.
- Decir que BERT resuelve un problema de regresión: elige una palabra, es clasificación.
3 · Agentes: el LLM dentro de un bucle
Qué agrega este eslabón: al LLM se le dan herramientas, memoria y objetivos, y lo más importante, un bucle: lo que pasa al actuar vuelve y condiciona lo que sigue.
Respuesta correcta y cómo se resuelve
Respuesta: el LLM solo inventa un pronóstico con o sin falla, porque no tiene herramienta ni observación; el agente recibe el error como observación y puede avisar o reintentar, aunque eso no garantiza que no alucine.
- LLM solo: no hay herramienta, así que «la herramienta falla» no cambia nada; genera palabras plausibles e inventa (el ejemplo del clima del profesor).
- Agente: emite el token de herramienta, el sistema la ejecuta, y el resultado —aquí, el error— vuelve a su contexto.
- Con el error en el contexto, la continuación más razonable es avisar o reintentar.
- Pero si el LLM ignora la observación, alucina igual dentro del sistema.
Error típico: «el agente nunca inventa porque tiene herramientas». Es error: el bucle hace que el resultado entre al contexto, no obliga al LLM a usarlo bien.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:15–2:46:27, 2:50:44–2:51:08 y 2:53:37–2:54:19] · simulación [DATITO]
[DATITO] Simulación con textos y cifras ilustrativas. El caso del clima es el ejemplo del profesor [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:48:15–2:48:33].
La separación que hizo el profesor
Un compañero preguntó por las bases de datos vectoriales que permiten buscar en un libro completo, justo después de que el profesor dijera que los LLM son malos con información posterior a su entrenamiento [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:46:59–2:47:17]. La respuesta es la P5 en una línea:
Lámina 47 (diagrama). Memoria, herramientas y objetivos alimentan al agente; el agente produce acciones sobre el entorno, y las observaciones vuelven al agente. El texto extraído de FCD-08 no trae la figura; el diagrama lo transcribe [FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/Resumen_Clase8_DL_LLMs_Agentes.md · sección 8.9.2].
En clase el profesor lo resumió así: el agente tiene por dentro acceso a un LLM que genera texto, además memoria, acceso a herramientas y objetivos muy claros [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:49:30–2:49:46]. Se construye dándole instrucciones (qué tipo de agente es, en qué se especializa, cómo debe responder) y declarándole las herramientas que tiene: una API del clima, otro agente que genera imágenes [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:49:48–2:50:34]. Y así funciona por dentro:
Pregunta de la P5: ¿cuál(es) de estas afirmaciones es(son) correcta(s) según la descripción? (1) los LLM son excelentes para hechos recientes y planificar a largo plazo; (2) un agente puede usar herramientas, almacenar conocimiento y actuar de forma autónoma, mientras que un LLM se limita principalmente al procesamiento de información y generación de texto; (3) los agentes no pueden colaborar con otros agentes ni con humanos; (4) los LLM no requieren grandes cantidades de datos ni poder de cómputo.
Respuesta correcta y cómo se resuelve
Respuesta: solo la 2 es correcta.
- (1) Falsa: la lámina 45 dice que los LLM son malos para hechos, para información posterior a su entrenamiento y para razonar y planificar.
- (2) Correcta: la lámina 46 atribuye al agente herramientas, memoria y acción autónoma, y deja al LLM el procesamiento de información.
- (3) Falsa: la lámina 46 cierra con «pueden colaborar con otros agentes o con humanos».
- (4) Falsa: la lámina 45 dice que necesitan muchos datos y poder de cómputo.
Error típico: dudar de la 2 porque «el agente también genera texto». Es cierto que genera texto, pero la alternativa dice que el LLM se limita a eso, y el agente agrega herramientas, memoria y acción: la afirmación sigue siendo correcta.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 45–46] [FUENTE · Repo: 07_DATITO/04_EJERCICIOS/certamen_2.html · ficha P5, enunciado textual de Canvas]
El bucle no elimina la alucinación. En funciones críticas se arman varios agentes, uno que hace la tarea y otro que la revisa, con un auditor; eso baja la tasa de alucinación, pero igual se puede colar una en el sistema [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:53:37–2:54:19]. Y queda la responsabilidad: si un sistema autónomo falla, ¿quién responde? Por eso hasta hoy los agentes suelen funcionar supervisados, como asistentes del humano [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:54:23–2:54:43]. Ejemplos oficiales (lámina 48): agentes de monitoreo y mantenimiento, operacionales, de análisis documental y de asistencia a operadores.
Un detalle que confirma que el LLM es una pieza: el profesor contó en la Clase del 31-jul que en sus propios proyectos con agentes usa como backbone un LLM pagado, porque corre más rápido que en una GPU local [FUENTE · Repo: 05_CLASES/transcripciones/06Clase_Fundamentos_en_Ciencia_de_Datos_31_de_julio.md · 1:21:54–1:22:47].
Ejercicio de interpretación · leer una traza
[DATITO] Traza ilustrativa de un agente de bodega en una planta:
(a) ¿Qué líneas produce el LLM? (b) ¿Quién ejecuta la línea 4? (c) ¿Dónde se cierra el bucle? (d) ¿La línea 5 garantiza que no hubo alucinación?
Respuesta correcta y cómo se resuelve
Respuesta: (a) las líneas 2, 3, 5 y 6; (b) la línea 4 la ejecuta el sistema que rodea al LLM; (c) el bucle se cierra entre la 4 y la 5; (d) no, la línea 5 no garantiza que no haya alucinación.
- (a) Incluye la 3 y la 6: la llamada a la herramienta y el «detente» también son tokens que genera el LLM.
- (b) El LLM no ejecuta nada; solo emite el token que pide la herramienta.
- (c) El resultado de la acción (línea 4) vuelve al contexto y la línea 5 depende de él. Sin la 4, la 5 sería una invención.
- (d) El LLM pudo leer mal u omitir algo de la observación; por eso existen revisores y supervisión humana.
Error típico: atribuir la línea 4 al LLM («el LLM consultó el inventario»). Es error porque confunde pedir la acción (un token) con ejecutarla.
[FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:50:44–2:51:08 y 2:53:37–2:54:19] · traza [DATITO]
Ejercicio de transferencia · planta concentradora
[DATITO] Dos sistemas en una planta: (A) un LLM al que le pegas las notas del turno y te devuelve el informe redactado; (B) un sistema que cada 5 minutos lee sensores por una API, detecta una vibración anómala, abre una orden de trabajo en el sistema de mantenimiento y consulta si quedó abierta. ¿Cuál es un agente según las láminas 46–47? Nombra qué atributos tiene cada uno y dónde está el bucle.
Respuesta correcta y cómo se resuelve
Respuesta: B es un agente y A no: A es un LLM usado como asistente de escritura, mientras que B percibe, usa herramientas, actúa y observa el resultado de su acción.
- A procesa el texto que le das y genera texto (lámina 45, asistente de escritura). No percibe el entorno por sí mismo, no usa herramientas, no actúa.
- B percibe el entorno (sensores), usa herramientas (la API de sensores y el sistema de mantenimiento), actúa (abre la orden) y observa el resultado (consulta si quedó abierta).
- El bucle de B: abrir la orden → consultar → la respuesta condiciona lo siguiente (lámina 47). Es casi literal el «agente de monitoreo y mantenimiento» de la lámina 48.
- Queda por decidir en B si hay un humano en el proceso (la lámina 46 lo permite) y quién responde si la orden sale mal.
Error típico: llamar agente a A «porque usa IA». Es error porque la definición exige atributos concretos (herramientas, percepción, acción), no el uso de un LLM.
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 45–48] · caso de la planta [DATITO]
Caso auditable: Datito como agente [INFERENCIA]
Este tutor es un sistema con un LLM adentro. Las piezas existen en el repositorio y las puedes abrir:
| Pieza | En Datito | Dónde mirar |
|---|---|---|
| Instrucciones y objetivos | El protocolo pedagógico | .claude/skills/datito/SKILL.md, CLAUDE.md |
| Herramientas | Leer y escribir archivos; consultar el cuaderno de NotebookLM por MCP | allowed-tools en SKILL.md; .mcp.json |
| Memoria | Estado del aprendizaje y registro de sesiones | 07_DATITO/progreso.yaml, 07_DATITO/07_BITACORA/ |
| Varios agentes | Tareas que corren aisladas | datito-visual, datito-corregir (context: fork) |
| Revisor | Auditor de diseño instruccional | .claude/skills/datito-pedagogia/SKILL.md |
Producción · audítalo tú
Para cada atributo de la lámina 46, decide si Datito lo cumple y con qué archivo de la tabla lo pruebas. Después escribe, en cinco líneas, qué lo separa de un chatbot al que le adjuntas documentos. Llévalo a Datito: es la pregunta con que abre este concepto.
Respuesta correcta y cómo se resuelve
Respuesta: lo que hace de Datito un agente y no un chatbot con documentos es que usa herramientas para actuar sobre su entorno (lee y escribe archivos, consulta NotebookLM), guarda memoria entre sesiones y cierra un bucle: lo que escribe (tu progreso) vuelve a leerse y condiciona la sesión siguiente [INFERENCIA].
| Atributo de la lámina 46 | ¿Lo cumple? | Evidencia |
|---|---|---|
| Acciones autónomas | Sí, acotadas | Escribe progreso.yaml y la bitácora sin que tú edites nada |
| Humano en el proceso | Sí | El bucle socrático espera tu respuesta (CLAUDE.md) |
| Memoria | Sí | 07_DATITO/progreso.yaml, 07_DATITO/07_BITACORA/ |
| LLM que procesa y decide | Sí | El modelo que ejecuta SKILL.md |
| Percibe su entorno | Sí | Lee el repositorio y tu estado antes de cada sesión |
| Usa herramientas | Sí | allowed-tools de SKILL.md; MCP en .mcp.json |
| Colabora con otros agentes | Sí | Forks datito-visual, datito-corregir; auditor datito-pedagogia |
Respuesta modelo (cinco líneas):
«Un chatbot con documentos adjuntos solo genera texto a partir de lo que le pegaste: no hace
nada fuera de la conversación y no se entera de nada que pase después. Datito tiene un LLM
adentro, pero además herramientas (leer y escribir archivos, consultar NotebookLM), memoria que
dura entre sesiones (progreso.yaml y la bitácora) y objetivos fijados en sus
instrucciones. Actúa sobre su entorno —registra mi progreso— y en la sesión siguiente lee ese
resultado y decide qué preguntarme. Ese bucle acción → observación es lo que la lámina 47 llama
agente. Igual tiene límites: depende de sus herramientas y puede equivocarse.»
Criterios con que Datito lo revisa: cada atributo con evidencia concreta (un archivo); nombra el bucle (qué acción, qué resultado vuelve, qué cambia después); reconoce lo que no puedes verificar; no confunde «tiene documentos» con «usa herramientas».
Error típico: «es un agente porque tiene mucha información». Es error: tener documentos es contexto, no herramientas ni acción; un chatbot con adjuntos también lo tiene.
[INFERENCIA] sobre .claude/skills/datito/SKILL.md,
CLAUDE.md, .mcp.json y 07_DATITO/ ·
[FUENTE · Repo: 05_CLASES/11_PRESENTACIÓN/_markdown/FCD-2026-2_08_DL_LLMs_Agents.md · láminas 46–47]
Procedimiento para el papel
- Separa el componente (LLM) del sistema (agente): ¿qué sujeto tiene la afirmación?
- Busca en cada opción los atributos de la lámina 46.
- Pregunta si el resultado de una acción vuelve y condiciona lo siguiente (lámina 47).
- Desconfía de los absolutos: «no pueden colaborar», «nunca necesitan un humano», «no alucinan».
Errores que el formato castiga
- «Un agente es un LLM con otro nombre», o «ChatGPT es un LLM».
- «El agente no genera texto, ejecuta.» Genera texto; la llamada a la herramienta es un token.
- «Un agente no alucina.» El bucle y los revisores bajan la tasa, no la anulan.
- «Autónomo significa sin humano.» La lámina 46 permite un humano en el proceso.
- «Los agentes no pueden colaborar con otros agentes ni con humanos.» Es la alternativa 3 de la P5, y es falsa.
- Responder con cómo funciona Datito en vez de con la lámina.
4 · Qué tendría que verte hacer
| Evidencia | Deep learning | LLM | Agentes |
|---|---|---|---|
| EXPLICAR | Qué cambió en 2012 y por qué no fue la idea | Por qué «predecir la siguiente palabra» genera texto | Qué agrega el bucle al LLM |
| APLICAR | Clasificar ítems según la cláusula de la P6 | Probabilidad de una secuencia a mano | Marcar en una traza qué es LLM, herramienta y observación |
| INTERPRETAR | Leer la lámina 8 sin inventarle un umbral | Leer un vector de atención | Decir qué garantiza y qué no una observación |
| TRANSFERIR | Elegir entre clásico y red en otro dominio | «Hacer lo de BERT» con datos continuos | Distinguir agente de asistente en una planta |
Cierre de la Clase 18 · Deep learning, LLM y agentes
Qué aprendiste
- Deep learning: redes profundas que dominan imagen y texto cuando hay muchos datos.
- Con pocos datos tabulares, los algoritmos clásicos suelen ganar.
- Un LLM predice la siguiente palabra.
- Un agente es un LLM con herramientas y objetivos, cuyo resultado vuelve y condiciona lo siguiente.
Qué no debes confundir
- Generar texto ≠ ejecutar acciones y observar su resultado (C2 P5).
- Avance mediante redes ≠ factor que lo hizo posible (C2 P6).
- GPT (el modelo) ≠ ChatGPT (el sistema).
Procedimiento para el papel
- ¿Aprende sus propias variables? Es deep learning.
- ¿Solo genera texto? Es un LLM.
- ¿Actúa con herramientas y observa el resultado? Es un agente.
Viene de: Clase 17 · Redes neuronales · Sigue: Clase 20 · Distinciones del Certamen 1
Vuelve a tu activación: Un chatbot que puede buscar en Internet y leer lo que encuentra, ¿es un LLM o un agente? ¿Cambiarías tu respuesta?
Respuesta correcta y cómo se resuelve
Un agente: actúa con una herramienta y el resultado vuelve y condiciona lo que genera después. [FUENTE · Repo: 05_CLASES/transcripciones/2026-08-21T22_13_35Z_Fundamentos_en_Ciencia_de_Datos.md · 2:50:44]
El cierre es una síntesis de la clase [DATITO]: cada afirmación tiene su fuente en el cuerpo de este visual. Fuente del cierre: 07_DATITO/clases.yaml.