← iniciojavierdiaz.ai
GenAI

Los 5 tipos de agentes de IA (y por qué casi siempre necesitas el más simple)

Javier Díaz·06 de agosto de 2026·8 min de lectura
Los 5 tipos de agentes de IA (y por qué casi siempre necesitas el más simple)

Un termostato es un agente de IA. También lo es AlphaGo. Y entre esos dos extremos cabe casi todo lo que hoy llamamos "agente".

Ese es el problema: la palabra agente se estiró tanto que ya no dice nada. La gente escucha "agente" y piensa en ChatGPT razonando y usando herramientas — y termina metiendo un modelo que aprende de datos donde bastaba una regla de tres líneas. Sobre-ingeniería pura.

Hay una taxonomía clásica —de Russell & Norvig, el libro con el que se enseña IA hace décadas— que ordena esto en cinco tipos. No es trivia académica: es un mapa para elegir cuánta máquina necesita de verdad tu problema. Porque cada escalón que subes te da más adaptabilidad… y te cobra en latencia, datos y complejidad.

Primero, ¿qué es un agente?

Algo simple: percibe su entorno, decide qué hacer y actúa sobre él para lograr un objetivo. Un bucle. Lo único que cambia entre los cinco tipos es qué tan sofisticada es la parte de "decidir".

El bucle de un agente: percibe el entorno, decide una acción y actúa sobre él, en bucle Todo agente es este bucle. Lo que distingue a los cinco tipos es qué pasa dentro de "decide".

La escalera de autonomía

Míralos como escalones: cada uno es el anterior más una capacidad nueva.

1 · Simple Reflex Agent — reglas. Aplica reglas fijas de condición → acción: "si temp < 18°C, enciende la calefacción". Sin memoria: no sabe qué pasó hace un segundo. Ejemplo: un termostato, una puerta automática, un if CPU > 95% → alerta. Rapidísimo y confiable en entornos predecibles; ciego apenas el mundo se vuelve dinámico.

2 · Model-Based Reflex Agent — + memoria. Le agrega un estado interno: un modelo de cómo es el mundo, aunque no lo vea entero. Ejemplo: una aspiradora robótica que recuerda qué parte de la casa ya limpió, o el monitoreo predictivo de una máquina que sabe cómo es su vibración "sana" y detecta la desviación. Reacciona con contexto, pero sigue siendo reactivo: no planifica.

3 · Goal-Based Agent — + planificación. Ya no solo reacciona: simula futuros para decidir qué secuencia de acciones lo acerca a una meta. Ejemplo: un auto autónomo que traza la ruta, o un planificador de producción que evalúa secuencias posibles y elige la que cumple el objetivo del día. Se adapta a condiciones cambiantes. Su límite: le importa llegar a la meta, no qué tan bien llega.

4 · Utility-Based Agent — + optimización. Le pone una función de utilidad: no basta con cumplir la meta, hay que hacerlo de la mejor forma según varios criterios a la vez. Ejemplo: un dron de entrega que pondera velocidad + seguridad + energía y elige la mejor ruta, no cualquiera que llegue. Decide mejor; a cambio, alguien tiene que definir bien esa función (y eso es difícil).

5 · Learning Agent — + aprendizaje. Mejora con la experiencia: usa retroalimentación (recompensas) para actualizarse. En su forma clásica tiene cuatro piezas —un crítico que evalúa, un elemento de aprendizaje que ajusta, un elemento de desempeño que actúa, y un generador de problemas que prueba cosas nuevas—. Ejemplo: AlphaGo, un motor de ajedrez, un sistema de recomendación que afina con cada clic. El más potente y adaptable… y el más caro: necesita muchos datos y tiempo para llegar a su mejor versión.

La escalera de agentes: cada tipo añade una capacidad — reglas, memoria, planificación, optimización, aprendizaje La escalera: Simple Reflex → Learning. Cada escalón = el anterior + una capacidad. No es "peor/mejor": es más máquina.

El resumen en una tabla

TipoMecanismoMemoriaEjemploFortalezaLímiteLatencia
Simple ReflexReglas condición-acciónNoTermostatoRápido en entornos predeciblesCiego al pasado, falla si el entorno cambia🟢 Muy baja
Model-Based+ estado interno del mundoAspiradora robóticaRecuerda, infiere lo no visibleReacciona, no planifica🟢 Baja
Goal-Based+ simula futuros hacia una metaAuto autónomoPlanifica, se adaptaNo juzga la calidad, solo si cumple🟡 Media
Utility-Based+ función de utilidadDron de entregaOptimiza (velocidad, seguridad, energía)Exige una utilidad bien definida🟡 Media-alta
Learning+ aprende de recompensasBot de ajedrezEl más adaptable y potenteNecesita muchos datos, lento en madurar🔴 Alta

Fíjate en la última columna: la latencia (y con ella el costo y la complejidad) sube conforme escalas. Y no es casualidad — es el precio de la adaptabilidad.

El costo de subir la escalera

Espectro: a más adaptabilidad, más latencia, datos y costo — del reflex simple al learning El trade-off en un eje: ganar adaptabilidad cuesta latencia, datos y complejidad. Subir no es gratis.

Aquí está la lección que casi nadie aplica: subir la escalera no es "mejorar", es pagar más. Un termostato con un learning agent sería absurdo: gastarías datos, cómputo y latencia para resolver algo que una regla resuelve instantáneamente y sin fallar. El escalón alto no es superior; es apropiado o no para tu problema.

Es el mismo principio que predica Anthropic para construir agentes: empieza por lo más simple; sube a más autonomía solo cuando la flexibilidad lo justifique. La mayoría de "agentes de IA" que funcionan en producción son más simples de lo que sugiere el marketing. Mínima autonomía, no máxima.

Decisión: ¿necesitas recordar? ¿planificar? ¿optimizar? ¿aprender? — cada sí sube un escalón La pregunta correcta no es "¿qué agente es más avanzado?" sino "¿cuál es el escalón más bajo que resuelve esto?".

¿Y dónde encaja el "agente de IA" moderno?

El agente LLM del que todos hablan (modelo + herramientas + bucle) no es un sexto tipo: es un goal-based / utility-based cuyo "planificar" es razonar (el patrón ReAct), con una capa de aprendizaje que vino del entrenamiento. La taxonomía es el mapa; el agente LLM es un punto en él.

Por eso esta serie tiene sentido leída junta: el function calling es cómo ese agente actúa; el context engineering es qué percibe; y los gates, evals y guardrails son cómo confías en lo que decide. Saber en qué escalón estás te dice cuánta de esa maquinaria necesitas de verdad.

En la nube: dónde vive cada tipo

Elegir el tipo es también elegir la infraestructura. El mapeo, priorizando GCP (mi stack) con su equivalente:

TipoGCPAWSAzureDatabricks
Reflex / Model-basedCloud Functions + Firestore (estado)Lambda + DynamoDBFunctions + Cosmos DBJobs + Delta (estado)
Goal / UtilityVertex AI Agent Engine · OR-Tools (optimización)Bedrock AgentsAI Foundry Agent ServiceMosaic AI Agents
Learning (RL/ML)Vertex AI Training / PipelinesSageMaker (RL)Azure MLMosaic AI Training
Datos + gobiernoBigQuery + DataplexS3 + Lake FormationFabric / PurviewUnity Catalog

(Verifica nombres al leer: esta capa cambia rápido.) El patrón: los tipos bajos son serverless + estado; los altos necesitan una plataforma de datos y entrenamiento — y ahí el costo real no es el modelo, es el pipeline de datos que lo alimenta.

Por qué esto lo veo desde data

La escalera de agentes es, en el fondo, una escalera de dependencia de datos. Un reflex agent no necesita datos históricos; un learning agent vive de ellos: sin un buen dataset, sin feedback loops limpios y sin gobierno, un agente que "aprende" aprende basura. Elegir el escalón alto es comprometerte a sostener toda esa cadena de datos.

Por eso, desde mi silla de Data & AI Manager, la pregunta no es "¿qué tan inteligente puede ser?" sino "¿tengo los datos, la latencia y el gobierno para sostener ese escalón?". Subir sin esa base no te da un agente más listo: te da uno más caro y más frágil. La disciplina de data —no sobre-construir— es exactamente lo que evita el cargo-cult del "agente que aprende" para todo.

La regla de oro

Elige el escalón más bajo que resuelva tu problema. Subir cuesta latencia, datos y complejidad — y rara vez lo necesitas.

Las cuatro preguntas que te llevan al tipo correcto:

  1. ¿Necesita recordar lo que pasó? → sube de Reflex a Model-Based.
  2. ¿Necesita planificar hacia una meta? → Goal-Based.
  3. ¿Necesita elegir la mejor forma, no cualquiera? → Utility-Based.
  4. ¿Necesita mejorar solo con la experiencia? → Learning (y prepárate a alimentar datos).

Si respondes "no" antes de llegar al final, ya tienes tu agente. Y probablemente sea más simple —y más confiable— de lo que esperabas.

Sigue la serie: "cómo se arma un agente, sin humo"

  • Los 5 tipos de agentes — el mapa completo. (estás aquí)
  • Function calling — cómo el agente actúa. (publicado)
  • Context engineering — qué percibe. (publicado)
  • Gates, evals y guardrails — cómo confías en lo que decide. (publicado)
  • ReAct — el bucle pensar → actuar → observar. (próximo)

Referencias