¿Qué es un bucle de agente? Un robot, un sándwich y el arte de volver a intentarlo
Mirar, elegir, actuar, comprobar. Una guía ilustrada y juguetona sobre los bucles de agente, tan sencilla que la entiende un niño de cinco años y con mucho para los mayores.
Imagina un robotito llamado Pip.
Le dices: «Por favor, hazme un sándwich de mermelada».
Pip mira la mesa. Hay pan. Hay mermelada. Hay una cuchara con una cantidad sospechosa de mantequilla de cacahuete.
¿Anuncia Pip: «¡Sándwich terminado!»?
No. Eso sería un discurso, no un sándwich.
Pip necesita mirar, elegir un pasito, darlo y comprobar qué ha pasado. Entonces Pip puede decidir qué hacer a continuación.
Ese patrón que se repite es un bucle de agente.
Toda la idea, en cuatro palabritas
Mirar. Elegir. Actuar. Comprobar.
- Mirar: ¿Qué está pasando ahora mismo?
- Elegir: ¿Qué cosa útil puedo hacer a continuación?
- Actuar: Hacer esa cosa.
- Comprobar: ¿Qué ha pasado de verdad? ¿Hemos terminado?
Si el trabajo no está terminado, se da otra vuelta, con la información nueva.
Un bucle simplemente significa que algo se repite. Un agente es un sistema capaz de dar pasos hacia un objetivo usando las herramientas y los permisos que se le han dado.
Júntalos: un bucle de agente permite a un ayudante actuar, ver el resultado y decidir qué viene después.
De vuelta a la seriísima misión del sándwich
El primer pasito de Pip es abrir el tarro de mermelada.
Actuar: Girar la tapa.
Comprobar: La tapa no se movió.
Aquí viene lo interesante. Pip no debería fingir que el tarro se abrió solo porque abrirlo era el plan.
Y Pip tampoco debería seguir girando para siempre hasta que el sol se convierta en una pasa.
Pip podría probar una alternativa permitida, o decir: «¿Me ayudas con esta tapa?». Pedir ayuda es un resultado útil, no un fracaso del tamaño de un robot.
Una vez abierto el tarro, Pip puede untar la mermelada, juntar el pan y comprobar el resultado frente a lo que le pediste.
¿Dos rebanadas? ¿Mermelada dentro? ¿En un plato? Genial.
¿Un tarro en equilibrio sobre una barra de pan? Creativo. Pero no es un sándwich.
¿Dónde encaja la parte de IA?
Nuestra historia de cocina es de mentira. Las herramientas de un agente de software, en lugar de manejar pan, podrían leer un archivo, buscar en una página, editar un documento o ejecutar una prueba.
En un agente de IA, un modelo de lenguaje puede ayudar a elegir el siguiente paso. El software que lo rodea ejecuta las llamadas a herramientas permitidas y devuelve sus resultados. Después, el modelo tiene otro turno con esa información.
Piensa en tres trabajos distintos:
| Parte | La cocina de mentira de Pip | Versión de software |
|---|---|---|
| Objetivo | Hacer un sándwich de mermelada | Arreglar un enlace roto |
| Quien decide | Elegir el siguiente pasito | El modelo propone una acción |
| Herramienta | Manos y cuchara | Lector de archivos, editor o navegador |
| Observación | La tapa sigue cerrada | La herramienta devuelve un error o un resultado |
| Notas de trabajo | Tarro abierto; pan listo | Historial y resultados relevantes de la tarea |
| Comprobación final | El sándwich pedido está listo | Verificar que el enlace previsto funciona |
Que un modelo sugiera una acción no es lo mismo que esa acción ocurra. Y que una acción ocurra no significa automáticamente que se haya cumplido el objetivo.
«He guardado el archivo» y «he guardado el archivo correcto con el contenido correcto» son afirmaciones distintas. Es en la comprobación donde esa diferencia importa.
Una pequeña aventura: la imagen perdida
Supón que le pides a un ayudante de software que arregle una imagen que falta en una página web.
Un bucle útil podría ser así:
- Mirar: Leer la página e identificar la ruta de la imagen.
- Elegir: Comprobar si la imagen referenciada existe.
- Actuar: Revisar los archivos relevantes.
- Comprobar: La página pide
cat.png, pero el archivo se llamacat.jpg. - Otra vuelta: Actualizar la referencia y comprobar que la página carga la imagen correcta.
- Parar: Informar del cambio y de las comprobaciones que realmente se hicieron.
Si la imagen sigue sin aparecer, «he editado la página» no basta. El resultado debe guiar el siguiente paso.
Fíjate en qué convierte esto en un bucle: la siguiente acción depende de lo que reveló la anterior. No se trata solo de hacer lo mismo una y otra vez.
¿Cada vuelta mejora las cosas?
No. Más actividad no significa automáticamente más progreso.
Aquí tienes un gráfico inventado de la misión del sándwich de Pip. Le damos a Pip un punto por cada hito completado: tarro abierto, mermelada untada, sándwich montado y petición final comprobada.
El tramo plano importa. Si nada cambia, el ayudante tiene que darse cuenta, no celebrar cuántas veces lo ha intentado.
Para los mayores, eso sugiere preguntas útiles: ¿Hemos aprendido algo? ¿Ha cambiado el estado? ¿Estamos repitiendo la misma acción fallida? ¿Merece la pena otro intento para lo que cuesta?
Para todos los demás: si la puerta dice TIRAR, empujar más fuerte no es una estrategia.
Dale al ayudante una valla, no el planeta entero
Un diseño de agente sensato necesita algo más que un botón de repetir.
- Una meta clara. «Encuentra tres fotos de pingüinos» es más fácil de comprobar que «haz que todo sea increíble».
- Permisos adecuados. Poder redactar un correo no debería significar automáticamente poder enviarlo.
- Un presupuesto para parar. Pon límites a los intentos, al tiempo o al gasto. Una tarea atascada no debe convertirse en una tarea infinita.
- Una forma de preguntar. La falta de información, la falta de acceso o una decisión con consecuencias pueden requerir a una persona.
- Comprobaciones honestas. Usa pruebas adecuadas al objetivo. No conviertas «la herramienta respondió» en «todo está bien».
Son principios de diseño, no la promesa de que todos los productos los implementen. Un bucle no hace que un sistema sea seguro o fiable por arte de magia.
En la cocina de Pip: haz el sándwich, no encargues un camión lleno de mermelada y pregunta antes de usar los electrodomésticos de mayores.
¿Un bucle de agente es lo mismo que un script?
No necesariamente, pero la frontera no es «los scripts son tontos y los agentes son listos». Los scripts también pueden tener bucles, condiciones y comprobaciones excelentes.
La diferencia que conviene vigilar es cómo se elige la siguiente acción. En un flujo de trabajo fijo, el desarrollador ha trazado las rutas de antemano. En un bucle de agente guiado por un modelo, el modelo puede elegir entre las acciones disponibles según la tarea y las últimas observaciones. Los sistemas reales pueden mezclar ambos enfoques.
Para un trabajo predecible, un pequeño script puede ser justo lo que hace falta. No necesitas un robot filósofo para tocar una campana a mediodía.
Para una tarea con obstáculos desconocidos, elegir el siguiente paso a partir de pruebas recientes puede ser útil. Esa flexibilidad también hace que los límites y la verificación sean importantes.
La versión para el imán de la nevera
Un bucle de agente es:
Prueba un paso útil. Mira qué ha pasado. Usa lo que has aprendido. Repite solo mientras tenga sentido.
No es magia. No es una garantía. No es «seguir para siempre».
Es una forma de conectar un objetivo, una acción y el resultado real, una y otra vez, hasta que el ayudante termina o necesita parar.
Pip lo explicaría de forma más sencilla:
«Mira. Prueba. Comprueba. Y no digas sándwich hasta que haya un sándwich».