Mercury Flux: La Capa de Enrutamiento de IA Detrás de Nuestros Agentes Comerciales
Aquí hay una pregunta que cada empresa que despliega agentes de IA enfrentará en los próximos doce meses: cuando tienes cinco agentes en funcionamiento — un asistente de compras, un gestor de catálogo, un analista, un redactor, un bot de soporte — ¿qué modelo utiliza cada uno?
La respuesta por defecto es el modelo que al equipo que lo construyó le gustó. Cinco aplicaciones, cinco elecciones de modelo codificadas de forma rígida, cinco copias de la misma clave de API en cinco archivos .env, cinco facturas invisibles. Cuando un proveedor tiene una interrupción, cinco aplicaciones fallan de manera independiente. Cuando finanzas pregunta cuánto cuesta la IA por línea de producto, nadie puede responder.
Nos negamos a aceptar esa arquitectura, así que construimos la capa que la corrige. Esta es la historia de Mercury Flux — nuestro motor de enrutamiento de modelos — y los agentes comerciales que funcionan en él. También es un adelanto de cómo implementamos IA agente para clientes empresariales.
Resumen: Codificar un modelo en cada aplicación de IA es como codificar contraseñas en el código fuente.Mercury Flux es una capa de enrutamiento de IA que se sitúa entre cada agente y cada proveedor de modelos — Gemini, GLM, Grok, Kimi, cualquiera de ellos: cada aplicación se autentica con su propia clave, obtiene su propia tabla de rutas (tipo de tarea → modelo → cadena de respaldo) y reporta su propio uso de tokens. Nuestros agentes comerciales — un asistente de compras orientado al cliente y un agente comercial de back-office donde cada escritura espera la aprobación humana — funcionan en esta pila a aproximadamente $0.07 por millón de tokens combinados, alrededor del 2% del costo de API minorista. La misma pila impulsa los pipelines de SEO y GEO detrás de nuestro trabajo de visibilidad de IA. El enrutador decide el modelo. Las aplicaciones nunca lo saben. Ese es el punto.
Soy James, CEO de Mercury Technology Solutions. Construimos puentes de IA a humanos para empresas, y operamos nuestra propia flota de agentes a una escala que hace que las decisiones de arquitectura sean no opcionales: alrededor de 18 mil millones de tokens al mes. Flux es el motor de enrutamiento que mantiene eso asequible, observable y bajo control. Hoy les mostraré lo que hace y por qué los agentes de comercio son su primer cliente real.
El Problema: Dispersión de Modelos
La pila de aplicaciones de IA de 2026 tiene una capa faltante, y la mayoría de los equipos lo sienten sin poder nombrarlo.
Tienes proveedores de modelos — excelentes, multiplicándose: Google, OpenAI, Anthropic, y una ola de fuertes desafiantes. Tienes marcos de agentes. Lo que falta es la pieza que decide qué modelo, para qué carga de trabajo, a qué costo, con qué respaldo, facturado a quién.
Sin esa capa, cada aplicación se convierte en su propia decisión de enrutamiento, hecha una vez, por un desarrollador, en código. Las consecuencias se acumulan silenciosamente:
- Ceguera de costos.Cinco aplicaciones, cinco cuentas de proveedor, sin vista unificada. Nadie puede decir cuánto cuesta el asistente de compras frente al bot de soporte.
- Dispersión de claves.Cada aplicación tiene claves de proveedor en bruto. Rotar una significa una búsqueda en cada repositorio. Una filtración es una filtración de cuenta completa.
- Sin conmutación por error.El proveedor tiene una mala tarde, y cada aplicación que lo codificó se cae con él.
- Bloqueo de modelo.Cambiar una carga de trabajo a un modelo mejor o más barato significa tocar el código de la aplicación, por lo que no sucede, y pagas de más para siempre.
No es que los modelos no sean lo suficientemente buenos; es que la arquitectura no tiene la capacidad de elegir.
Flujo de Mercurio: La Capa Que Elige
El flujo es una capa delgada y despiadada entre tus agentes y los proveedores de modelos. El diseño se ajusta en un párrafo:
Cada aplicación se autentica en Flux con su propia clave — nunca una clave de proveedor. Cada solicitud lleva un nombre de ruta en lugar de un nombre de modelo: bucle-herramienta para trabajos de llamada a herramientas, texto-largo para redacción, análisis para razonamiento profundo. Flux resuelve la ruta contra la tabla de esa aplicación — una cadena ordenada como Grok para disciplina de herramientas, GLM como respaldo — añade las credenciales reales del proveedor y reenvía la llamada. Cada solicitud se registra con contabilidad de tokens por aplicación y por ruta. Los proveedores fallan, Flux se recupera. Los modelos cambian de precio, tú editas una tabla. Las aplicaciones nunca lo notan.
Piénsalo como el panel eléctrico para IA: una alimentación de los servicios públicos (los proveedores), un interruptor para cada circuito (las aplicaciones) y un medidor en cada línea. No necesitas volver a cablear la casa para apagar una lámpara.
La economía proviene de la propia ruta. Los bucles de herramientas funcionan con modelos de IA elegidos por su disciplina de llamada de función. La generación de formato largo se ejecuta donde el costo por token es más bajo. El razonamiento duro obtiene el modelo fronterizo solo cuando la tarea realmente lo necesita. A través de nuestra flota — agentes de comercio, tuberías de contenido SEO, las auditorías GEO que enviamos a clientes empresariales — esto se compone a esa tarifa de $0.07 por millón: dos órdenes de magnitud por debajo de lo que cuesta el mismo volumen de LLM a precios minoristas premium. Una decisión de enrutamiento tomada una vez, en una tabla, en lugar de nunca, en código.
Los Primeros Inquilinos: Agentes de Comercio
La primera carga de trabajo de producción de Flux es un par de agentes de comercio que construimos para implementaciones minoristas, sobre un plano de referencia abierto que endurecimos y extendimos con nuestro propio tiempo de ejecución.
El agente de compras es el que está orientado al cliente. Busca en el catálogo, compara opciones, planifica compras, llena el carrito y responde preguntas sobre pedidos y políticas, con memoria de lo que el cliente le dice. Es la respuesta de la tienda al cambio que está ocurriendo ahora mismo: los compradores que antes preguntaban a Google por "la mejor tienda para dos personas" cada vez más preguntan directamente a ChatGPT, Perplexity o Gemini y esperan que el asistente de la tienda sea más agudo que un resultado de búsqueda. Es rápido, paciente y nunca se cansa de "¿cuál de estos dos es mejor para un balcón pequeño?"
El agente comercial es el que está en la oficina trasera. Explica el rendimiento, mantiene listados, actúa sobre alertas de inventario, ajusta precios, redacta campañas. Y aquí está la parte que importa para las empresas: cada escritura que realiza es propuesta, no ejecutada. Un cambio de precio, un reabastecimiento, una edición de listado: cada uno se presenta como un cambio propuesto que espera la aprobación de un humano a través de una superficie de aprobación. El agente propone; el operador dispone.
La arquitectura de seguridad subyacente es la parte de la que estamos más orgullosos, porque es la parte que las demostraciones nunca te muestran:
- Puertas de procedencia.El carrito solo acepta productos que una herramienta de catálogo devolvió realmente en esta sesión. El modelo no puede alucinar una compra.
- Restricciones en el momento de aplicar.Movimiento de precio demasiado profundo, reabastecimiento demasiado grande, campo protegido tocado: el cambio es rechazado independientemente de quién lo aprobó.
- Contexto cercado.El texto de terceros que el agente lee está sanitizado y delimitado para que una descripción de producto maliciosa no pueda inyectar instrucciones. El agente lee la web; la web no puede leer al agente.
Este es el puente de IA a humano que construimos para ganarnos la vida: la IA hace el trabajo, los humanos aprueban las escrituras.No es un chatbot atornillado a una tienda — un sistema donde la autonomía y la responsabilidad están separadas por diseño.
Lo que el enrutamiento nos compró: una comparación en vivo
Debido a que Flux separa el enrutamiento del código de la aplicación, ejecutamos la misma carga de trabajo de agente de compras a través de dos modelos diferentes editando una línea de configuración. La diferencia fue decisiva.
Un modelo — fuerte en prosa — falló en los contratos de herramientas: llamadas de habilidad mal formadas, búsquedas repetidas, ninguna compra completada. El otro manejó los mismos esquemas de enumeración de manera limpia, cargó sus instrucciones operativas a la primera y completó el flujo completo de búsqueda a carrito — mientras obedecía correctamente una regla en su manual de habilidades que dice que la investigación presenta hallazgos actuales antes de escribir en el carrito. Mismo agente, mismas puertas, mismo aviso. Solo el modelo difería, y el modelo es exactamente la cosa que una capa de enrutamiento te permite cambiar.
Multiplica esa comparación por cada carga de trabajo, cada cliente, cada trimestre. Los modelos mejoran y cambian de precio constantemente; los equipos que pueden re-enrutar en segundos siempre superarán a los equipos que programaron una reestructuración para el próximo sprint. Flux convierte la elección del modelo de un compromiso arquitectónico en una línea de configuración.
Por qué esto es importante para las empresas
Si estás implementando IA agente — comercio o de otro tipo — tres implicaciones:
- El enrutamiento por modelo de aplicación es fundamental.La carga de trabajo decide el modelo de IA: disciplina de herramientas para agentes, contexto largo barato para contenido, frontera solo para juicio. Una capa de enrutamiento convierte esto en una política, no en un accidente por aplicación.
- Las claves y el costo pertenecen en un solo lugar.Las aplicaciones se autentican con el enrutador; solo el enrutador tiene las credenciales del proveedor. El metabolismo de tokens se mide por aplicación, por ruta — así que "¿cuánto cuesta la IA por línea de producto?" se convierte en una consulta, no en una auditoría forense. Trátalo como infraestructura de transformación digital central, no como una herramienta de marketing.
- La autonomía necesita puertas de aprobación.Los agentes que escriben en sistemas de producción —carritos, catálogos, precios— necesitan cambios escalonados y aprobación humana como características arquitectónicas, no como sugerencias de aviso. El plano comercial que ejecutamos demuestra que funciona bajo una carga real de llamadas a herramientas.
¿El 43% de los leads que se pierden en la brecha de IA a humano? Se pierden porque las empresas implementan sistemas totalmente humanos (lentos) o totalmente de IA (no responsables). El puente es la autonomía escalonada: máquinas que funcionan, humanos que aprueban, y una capa de enrutamiento que mantiene todo lo suficientemente asequible como para implementarlo realmente — ya sea que la carga de trabajo sea comercio, SEO, o los programas GEO que hacen que una marca sea citada cuando la IA responde.
Eso es Flujo de Mercurio. Un enrutador. Cada agente. Su propio modelo, su propia factura, su propio interruptor.
Soluciones Tecnológicas de Mercurio: Acelera la Digitalidad.
Originally published on MTS Blog & Research