Las Cuatro Capas de un Sistema de Agente de IA: Por Qué 18 Mil Millones de Tokens Me Enseñaron a Dejar de Ajustar Prompts
Hace seis meses, uno de nuestros agentes de IA consumió cuarenta mil tokens, escribió un resumen claro declarando la tarea completa y luego falló en todas las pruebas del conjunto.
Cuarenta mil tokens de fracaso seguro, articulado y bien estructurado.
El instinto — el instinto de todos — es reescribir el aviso. Agrega "asegúrate de que las pruebas pasen." Cambia a un modelo más fuerte. Endurece las instrucciones. Todos lo hemos hecho. Y casi cada vez, es el movimiento equivocado.
El problema no estaba en el aviso. El problema estaba en las capas debajo de él.
Resumen:Las fallas de los agentes de IA son fallas de arquitectura antes de ser fallas de aviso. Cada sistema de agente de IA confiable se construye sobre cuatro capas — Bucle, Gráfico, Arnés, Meta-arnés — y "un mejor aviso no puede compensar una capacidad faltante." Pero la ingeniería de avisos sigue siendo parte de la solución: es el último 5% que aplicasdespuésde que las capas estén sólidas, no lo primero que buscas/aprendes cuando no lo están. Ejecutamos ~18 mil millones de tokens al mes en esta pila — la misma pila que ejecuta la entrega SEO y GEO de Mercury — a aproximadamente 7 centavos por millón de tokens mezclados. Ese número es un logro de arquitectura, no uno de aviso.
Soy James, CEO de Mercury Technology Solutions. Desde mi oficina en Hong Kong, dirijo una consultoría de IA donde los agentes de IA realizan trabajo de producción real — codificación de aplicaciones, tuberías de contenido, auditorías GEO, entregables SEO, informes a clientes — y he aprendido por las malas que la diferencia entre una demostración y un sistema nunca es el modelo. Es la pila alrededor del modelo. Esta pila también es la razón por la que la transformación digital en Mercury significa reconstruir las capas alrededor del modelo de IA, no solo comprar acceso a él.
El Agente de IA Que Me Mintió
Aquí está lo que realmente le faltaba a ese agente de IA fallido.
No tenía un bucle de verificación. Nada en su entorno comprobaba su trabajo. Escribía código, "sentía" que había terminado y reportaba éxito — porque desde dentro de su ventana de contexto, el éxito y la creencia en el éxito son indistinguibles. El modelo no estaba mintiendo. Realmente no podía notar la diferencia.
Ninguna corrección de aviso soluciona eso. Puedes escribir "verifica tu trabajo" hasta que tus dedos sangren, pero si el arnés de IA nunca expone un corredor de pruebas, el agente está pidiendo a un ciego que revise la iluminación.
Es obvio una vez que lo ves. La falla no estaba en el razonamiento. Estaba en la arquitectura que rodeaba el razonamiento.
Las Cuatro Capas
Cada sistema de agente de IA confiable que he construido o estudiado se descompone en cuatro capas. Si omites una, la falla aparece más tarde con una reescritura de aviso adjunta, lo cual es como repintar una pared para arreglar una grieta en los cimientos.
Capa 1: El Bucle — repite hasta que la evidencia diga parar. El agente de IA actúa, verifica el resultado y, o bien se detiene o intenta de nuevo. La decisión de diseño crítica es quién decide la finalización. Un agente confiable se detiene cuando una prueba pasa, una construcción se vuelve verde, una salida se valida — evidencia externa, no confianza interna. Los modelos creen. Los bucles verifican.
Capa 2: El Grafo — decide qué se ejecuta a continuación. El bucle decide si la ejecución continúa; el grafo decide dónde va. Ramas, reintentos, transferencias de especialistas, caminos de respaldo, estado compartido. Una vez que un flujo de trabajo tiene más de una ruta posible, necesitas que el enrutamiento sea explícito e inspeccionable — no improvisado dentro del contexto del modelo en cada ejecución.
Capa 3: El Arnés — hacer que el modelo de IA sea operativo. Herramientas, APIs, archivos, memoria, permisos, contexto, registro. Aquí es donde vive la ingeniería poco glamorosa, y es donde en realidad se originan la mayoría de los fallos de los agentes de IA. La capacidad del modelo y la capacidad del agente son cantidades diferentes. El modelo de IA puede entender exactamente cómo resolver una tarea; si el arnés nunca expone la herramienta o el permiso, la tarea muere allí.
Capa 4: El Meta-arnés — gobernar muchos arneses. Las operaciones reales ejecutan múltiples agentes: un agente de codificación, un agente de investigación, especialistas en dominios, cada uno con sus propias herramientas y políticas. El meta-arnés es la capa común por encima de ellos — orquestación, gobernanza, aislamiento, memoria compartida, portabilidad de contexto. Sin él, no tienes una flota. Tienes silos que comparten una oficina.
En resumen: el bucle hace que el trabajo sea verificable, el gráfico hace que el flujo de trabajo sea estructurado, el arnés hace que el modelo sea operativo, y el meta-arnés hace que la flota sea gobernable.
Ahora, la Herejía: La Ingeniería de Prompts Sigue Importando
Aquí es donde me separo de los puristas que leen "arquitectura primero" como "la ingeniería de prompts está muerta."
Una tontería. La ingeniería de prompts es real, y a gran escala vale dinero real. Pero su valor tiene una condición de orden que la mayoría de los equipos confunden.
Piénsalo como una ecuación:
Salida del agente de IA = (Capacidad de la capa) × (Eficiencia del prompt)
Multiplicación, no adición. Si la capacidad de cualquier capa es cero — sin bucle de verificación, sin ruta, sin herramienta, sin gobernanza — el producto es cero, y ningún multiplicador de prompt lo rescata. Pero una vez que las capas son sólidas, el prompt es el multiplicador que determina cuáneficientementeel modelo utiliza lo que se le ha dado. Ajustar de 1.2 a 1.4 en una pila saludable se compone. Ajustarlo en una pila rota es pulir latón en un barco que se hunde.
Deja de reescribir los prompts para compensar las capas faltantes. Comienza a ajustar los prompts para explotar los completos.
La Prueba de 18 Mil Millones de Tokens: Economía de IA Generativa a Gran Escala
Déjame hacer esto concreto con nuestros propios números, porque aquí es donde la teoría paga el alquiler.
Nuestra flota de agentes de IA procesa aproximadamente 18 mil millones de tokens por mes — trabajo de IA generativa a escala de producción, no demostraciones. Vendido a través de una API premium a precios de lista estándar, ese volumen estaría entre $20,000 y $200,000 USD al mes, dependiendo del nivel del modelo. Nuestro gasto real se sitúa alrededor de $1,200 — una tasa combinada de aproximadamente $0.07 por millón de tokens.
Mismos modelos. Mismas tareas. Dos órdenes de magnitud de diferencia. ¿De dónde provino el ahorro?
No de trucos de indicaciones. Las indicaciones están bien, pero no están haciendo el trabajo pesado. Mira dónde se mueve realmente el dinero:
El bucle eliminó el mayor desperdicio: el fracaso confiado.Antes de la finalización con evidencia, nuestros agentes de IA producían resultados que parecían plausibles pero fallaban en etapas posteriores, desencadenando ciclos de revisión humana y reejecuciones completas — cada una de ellas pura incineración de tokens. Una puerta de prueba que detiene una mala ejecución de IA en el token 8,000 en lugar del token 80,000 es, funcionalmente, un 90% de descuento en el fracaso. La verificación no es un costo adicional. Son los tokens más baratos que gastarás, porque previenen los costosos.
El gráfico dirigió el trabajo al modelo suficiente más barato.Las clases de tareas se mapean a modelos de IA: la extracción rutinaria se ejecuta en un modelo local pequeño, el borrador en uno de nivel medio, y el costoso modelo de frontera solo toca las decisiones que realmente lo necesitan. Ninguna indicación hace que un modelo pequeño sea adecuado para una tarea difícil — esa es una decisión de enrutamiento, tomada una vez, en el gráfico. Esta única capa es la mayor parte de la brecha de dos órdenes de magnitud entre nosotros y los precios de la API minorista.
El arnés hizo que la elección del modelo fuera irrelevante para el diseño de tareas.Debido a que las herramientas, la memoria y los permisos viven en el arnés, cambiar un modelo de IA — Claude por Gemini, GPT por un modelo local — no rediseña el trabajo. Tratamos los modelos de IA como componentes reemplazables — porque lo son. El arnés es el enchufe; el modelo es la bombilla. Los equipos que codifican capacidades en las indicaciones compran un nuevo enchufe cada vez que el mercado de bombillas se mueve.
El meta-arnés amortizó todo a través de la flota.Memoria compartida, políticas compartidas, estándares de verificación compartidos. El duodécimo agente que desplegamos no paga el costo de configuración del primero, porque su entorno es heredado, no reconstruido. La economía del meta-arnés es la razón por la cual el costo marginal de nuestro próximo agente tiende a cero.
Ahora nota lo que la ingeniería de prompts hizo en este sistema: ajustó utilización dentro de cada capa: instrucciones más precisas significaban menos bucles de reintento, señales de enrutamiento más limpias, mejor salida de primera pasada de cada modelo de IA en la flota. Ganancias reales, porcentajes de un solo dígito, acumulándose. Pero los dos órdenes de magnitud vinieron de las capas. El prompting es el ajuste fino en un instrumento que la arquitectura ya construyó.
La versión interactiva de este stack está en nuestro sitio: el bucle que falla una verificación y reintenta es toda la tesis en una animación.
¿Qué tiene esto que ver con SEO y GEO?
Todo, si la visibilidad de la IA es parte de tu negocio.
La oferta principal de Mercury es ayudar a las empresas a capturar los leads que se pierden entre los sistemas de IA y los humanos, lo que incluye hacer que las marcas sean citables dentro de las respuestas de IA generativa, no solo en los rankings de Google. Cada auditoría GEO que enviamos, cada entrega de SEO, cada activo de respuesta que construimos para un cliente se produce con esta misma pila de IA de cuatro capas.
No es una coincidencia; es la economía. GEO a escala empresarial significa cientos de consultas probadas a través de ChatGPT, Perplexity, Gemini y Claude: trabajo repetitivo, estructurado y con mucha verificación. Sin las cuatro capas, esa carga de trabajo es inasequible a precios de token al por menor. Con ellas, una auditoría de citas que arruinaría a una tienda que solo trabaja con prompts es una rutina mensual. La pila es la razón por la que podemos prometer trabajo de visibilidad de IA con márgenes intactos.
Así que cuando un cliente empresarial pregunta por qué sus citas de IA están desactualizadas o su marca es invisible para los LLM, la respuesta sigue la misma disciplina: no reescribas el prompt. Encuentra la capa. Esa es la misma respuesta ya sea que el sistema sea un agente de codificación o un programa completo de SEO y GEO empresarial, y es la base sobre la que Mercury construye los sistemas de los clientes.
La Disciplina de Triage
Aquí está la conclusión operativa. Cuando un agente de IA no rinde, hazte cuatro preguntas antes de tocar un solo prompt:
- Bucle: ¿Hay una prueba, construcción o validación que realmente impida la finalización — o el agente está calificando su propia tarea?
- Gráfico: ¿Son las ramas, reintentos y transferencias explícitas — o improvisadas por ejecución?
- Arnés: ¿El entorno expone la herramienta, la fuente de datos y los permisos que requiere la tarea?
- Meta-arnés: ¿Pueden tus agentes compartir políticas y contexto — o son N silos descoordinados?
Solo cuando las cuatro respuestas son "sí" es cuando el aviso se convierte en la variable de mayor apalancamiento que queda. Eso no es una degradación de la ingeniería de avisos. Esa es su promoción — de muleta a multiplicador.
Yang Wen-li ganó campañas al arreglar la logística mientras todos los demás estudiaban tácticas. La IA agente es la misma guerra. Las capas son las líneas de suministro. El aviso es el manual de campo.
Construye las capas. Luego ajusta el aviso de la IA. En ese orden — siempre.
Mercury Technology Solutions: Acelera la Digitalidad.
Originally published on MTS Blog & Research