머큐리 플럭스: 우리의 상거래 에이전트를 위한 AI 라우팅 레이어
AI 에이전트를 배포하는 모든 회사가 12개월 이내에 직면할 질문이 있습니다: 다섯 개의 에이전트가 실행되고 있을 때 — 쇼핑 어시스턴트, 카탈로그 관리자, 분석가, 카피라이터, 지원 봇 — 각 에이전트는 어떤 모델을 사용합니까?
기본적인 대답은 그것을 만든 팀이 좋아하는 모델입니다. 다섯 개의 앱, 다섯 개의 하드코딩된 모델 선택, 다섯 개의 .env 파일에 있는 동일한 API 키의 복사본, 다섯 개의 보이지 않는 청구서. 공급자가 중단되면 다섯 개의 앱이 독립적으로 실패합니다. 재무팀이 제품 라인별 AI 비용을 물어보면, 아무도 대답할 수 없습니다.
우리는 그 아키텍처를 받아들이기를 거부했으므로, 이를 수정하는 레이어를 구축했습니다. 이것은 Mercury Flux — 우리의 모델 라우팅 엔진 — 및 그 위에서 실행되는 상거래 에이전트에 대한 이야기입니다. 또한 기업 고객을 위해 에이전틱 AI를 배포하는 방법에 대한 미리보기이기도 합니다.
TL;DR: 모든 AI 앱에 모델을 하드코딩하는 것은 소스 코드에 비밀번호를 하드코딩하는 것과 같습니다.Mercury Flux는 모든 에이전트와 모든 모델 제공자(Gemini, GLM, Grok, Kimi 등) 사이에 위치한 AI 라우팅 레이어입니다. 각 앱은 고유한 키로 인증하고, 고유한 라우트 테이블(작업 유형 → 모델 → 폴백 체인)을 얻으며, 고유한 토큰 사용량을 보고합니다. 우리의 상거래 에이전트 — 고객을 위한 쇼핑 도우미와 모든 쓰기가 인간의 승인을 기다리는 백오피스 상인 에이전트 — 는 대략 $0.07 per million tokens blended, about 2% of retail API cost. 동일한 스택이 우리의 AI 가시성 작업 뒤에 있는 SEO 및 GEO 파이프라인을 지원합니다. 라우터가 모델을 결정합니다. 앱은 결코 알지 못합니다. 그게 요점입니다.
저는 제임스입니다. 머큐리 테크놀로지 솔루션의 CEO입니다. 우리는 기업을 위한 AI-인간 브리지를 구축하고 있으며, 아키텍처 결정을 선택할 수 없는 규모로 자체 에이전트 플릿을 운영합니다 — 매달 약 180억 개의 토큰. Flux는 이를 저렴하고 관찰 가능하며 통제 가능한 상태로 유지하는 라우팅 엔진입니다. 오늘 저는 그것이 무엇을 하는지, 그리고 상업 에이전트가 그 첫 번째 실제 고객인 이유를 보여드리겠습니다.
문제: 모델 스프롤
2026년의 AI 애플리케이션 스택에는 누락된 레이어가 있으며, 대부분의 팀은 그것을 이름 붙일 수 없지만 느끼고 있습니다.
모델 제공자가 있습니다 — 훌륭한 모델들이 증가하고 있습니다: 구글, OpenAI, Anthropic, 그리고 강력한 도전자들의 물결. 에이전트 프레임워크도 있습니다. 부족한 것은 어떤 모델, 어떤 작업 부하에, 어떤 비용으로, 어떤 대체 수단으로, 누구에게 청구할지를 결정하는 조각입니다.
그 레이어가 없으면 모든 앱은 개발자가 코드에서 한 번 결정한 자체 라우팅 결정이 됩니다. 결과는 조용히 누적됩니다:
- 비용 맹목성.다섯 개의 앱, 다섯 개의 공급자 계정, 통합된 뷰 없음. 쇼핑 어시스턴트의 비용과 지원 봇의 비용을 비교할 수 있는 사람은 없다.
- 키 스프롤.모든 앱이 원시 공급자 키를 보유하고 있다. 하나를 회전시키면 모든 리포를 찾아야 한다. 하나의 유출은 전체 계정 유출이다.
- 페일오버 없음.공급자가 나쁜 오후를 보내면, 그것을 하드코딩한 모든 앱이 함께 다운된다.
- 모델 잠금.더 나은 또는 더 저렴한 모델로 작업 부하를 전환하는 것은 앱 코드를 수정해야 하므로, 그렇게 되지 않고 영원히 과도한 비용을 지불하게 된다.
모델이 충분히 좋지 않아서가 아니라, 아키텍처가 선택할 수 있는 능력이 없기 때문이다.
수은 플럭스: 선택하는 레이어
플럭스는 에이전트와 모델 제공자 사이의 얇고 무자비한 레이어입니다. 디자인은 한 문장으로 요약됩니다:
모든 앱은 자체 키로 플럭스에 인증하며, 결코 제공자 키를 사용하지 않습니다. 각 요청은 모델 이름 대신 경로 이름을 전달합니다: tool-loop 도구 호출 작업을 위한, long-text 초안을 작성하기 위한, 분석 깊은 추론을 위한. Flux는 해당 앱의 테이블에 대해 경로를 해결합니다 — 정렬된 체인처럼 도구 규율을 위한 Grok, 백업으로서의 GLM — 실제 제공자 자격 증명을 추가하고, 호출을 전달합니다. 모든 요청은 앱별, 경로별 토큰 회계와 함께 기록됩니다. 제공자가 다운되면, Flux는 장애 조치를 취합니다. 모델의 가격이 변하면, 테이블을 수정합니다. 앱은 결코 알아차리지 못합니다.
AI를 위한 전기 패널로 생각하세요: 유틸리티(제공자)에서 오는 하나의 피드, 각 회로(앱)에 대한 차단기, 각 선에 대한 미터. 램프를 끄기 위해 집을 다시 배선할 필요는 없습니다.
경제학은 라우팅 자체에서 나옵니다. 도구 루프는 기능 호출 규율을 위해 선택된 AI 모델에서 실행됩니다. 장기 생성은 토큰당 비용이 가장 낮은 곳에서 실행됩니다. 어려운 추론은 작업이 실제로 필요할 때만 최전선 모델을 얻습니다. 우리의 전체 함대 — 상업 에이전트, SEO 콘텐츠 파이프라인, 기업 고객에게 배송하는 GEO 감사 — 이것은 $0.07-백만 혼합 요금으로 누적됩니다: 동일한 LLM 볼륨이 프리미엄 소매 가격에서 드는 비용보다 두 배의 차이가 납니다. 한 번, 테이블에서 이루어진 라우팅 결정, 코드에서 결코 이루어지지 않은.
첫 번째 세입자: 상업 에이전트
Flux의 첫 번째 생산 작업량은 소매 배포를 위해 우리가 구축한 두 개의 상업 에이전트로, 우리가 강화하고 자체 런타임으로 확장한 공개 참조 청사진을 기반으로 합니다.
쇼핑 에이전트는 고객과 대면하는 에이전트입니다. 카탈로그를 검색하고, 옵션을 비교하며, 구매를 계획하고, 장바구니를 채우고, 주문 및 정책 질문에 답변합니다 — 고객이 말하는 내용을 기억합니다. 이는 지금 일어나고 있는 변화에 대한 상점의 답변입니다: 한때 "최고의 2인용 텐트"를 구글에 물었던 구매자들이 점점 더 ChatGPT, Perplexity 또는 Gemini에 직접 질문하고 상점의 어시스턴트가 검색 결과보다 더 날카롭기를 기대합니다. 이는 빠르고, 인내심이 있으며, "이 두 가지 중 어떤 것이 작은 발코니에 더 좋습니까?"라는 질문에 지치지 않습니다.
상인 에이전트는 백오피스 에이전트입니다. 성과를 설명하고, 목록을 유지하며, 재고 알림에 대응하고, 가격을 조정하고, 캠페인을 초안합니다. 그리고 기업에 중요한 부분은 다음과 같습니다: 모든 작성은 실행되지 않고, 제안됩니다. 가격 변경, 재입고, 목록 수정 — 각각은 인간의 승인을 기다리는 제안된 변경으로 전달됩니다. 에이전트는 제안하고, 운영자는 처리합니다.
우리가 가장 자랑스러워하는 안전 아키텍처는 데모에서 절대 보여주지 않는 부분입니다:
- 출처 게이트.장바구니는 실제로 이 세션에서 반환된 제품만을 허용합니다. 모델은 구매를 환상할 수 없습니다.
- 적용 시간에 대한 가드레일.가격이 너무 깊게 이동하거나, 재고가 너무 많거나, 보호된 필드가 수정되면 — 변경 사항은 승인한 사람이 누구든지 관계없이 거부됩니다.
- 제한된 컨텍스트.에이전트가 읽는 제3자 텍스트는 정화되고 구분되어 악의적인 제품 설명이 지침을 주입할 수 없습니다. 에이전트는 웹을 읽고; 웹은 에이전트를 읽을 수 없습니다.
우리가 생계를 위해 구축하는 AI-인간 간의 다리입니다: AI가 작업을 수행하고, 인간이 작성 내용을 승인합니다.상점에 부착된 챗봇이 아니라, 자율성과 책임이 설계에 의해 분리된 시스템입니다.
라우팅이 우리에게 가져다 준 것: 실시간 비교
Flux가 라우팅을 앱 코드와 분리하기 때문에, 우리는 구성의 한 줄을 수정하여 두 가지 다른 모델을 통해 동일한 쇼핑 에이전트 작업을 실행했습니다. 그 차이는 결정적이었습니다.
한 모델은 — 산문에 강했지만 — 도구 계약을 잘못 처리했습니다: 잘못된 기술 호출, 반복된 검색, 완료되지 않은 구매. 다른 모델은 동일한 열거형 스키마를 깔끔하게 처리하고, 첫 번째 시도에서 운영 지침을 로드했으며, 전체 검색-장바구니 흐름을 완료했습니다 — 동시에 기술 매뉴얼의 규칙을 올바르게 준수하면서연구가 장바구니에 쓰기 전에 현재 결과를 제시해야 한다고 말합니다. 동일한 에이전트, 동일한 게이트, 동일한 프롬프트. 오직 모델만 다르고, 모델은 라우팅 레이어가 변경할 수 있게 해주는 것입니다.
그 하나의 비교를 모든 작업량, 모든 클라이언트, 모든 분기로 곱해보세요. 모델은 지속적으로 개선되고 가격이 조정됩니다; 몇 초 만에 재라우팅할 수 있는 팀은 항상 다음 스프린트를 위해 리팩토링을 예약한 팀보다 더 나은 성과를 낼 것입니다. Flux는 모델 선택을 아키텍처 약속에서 구성 라인으로 전환합니다.
이것이 기업에 중요한 이유
에이전틱 AI — 상업적이든 아니든 — 를 배포하고 있다면, 세 가지 의미가 있습니다:
- 앱별 모델 라우팅은 기본입니다.작업 부하가 AI 모델을 결정합니다: 에이전트를 위한 도구 규율, 콘텐츠를 위한 저렴한 긴 맥락, 판단을 위한 최전선만. 라우팅 계층이 이를 정책으로 만들며, 앱별 우연이 아닙니다.
- 키와 비용은 한 곳에 있어야 합니다.앱은 라우터에 인증합니다; 라우터만이 공급자 자격 증명을 보유합니다. 토큰 대사는 앱별, 경로별로 측정됩니다 — 따라서 "AI의 제품 라인당 비용은 얼마인가?"는 쿼리가 되고, 법의학 감사가 아닙니다. 이를 마케팅 도구가 아닌 핵심 디지털 전환 인프라로 취급하세요.
- 자율성에는 승인 게이트가 필요합니다.생산 시스템에 쓰는 에이전트 — 장바구니, 카탈로그, 가격 — 는 건축적 기능으로서 단계적 변경과 인간의 승인이 필요합니다, 프롬프트 제안이 아닙니다. 우리가 운영하는 상거래 청사진은 실제 도구 호출 부하에서 작동함을 증명합니다.
AI와 인간의 간극에서 떨어지는 리드의 43%? 그들은 기업이 전적으로 인간(느림) 또는 전적으로 AI(책임 없는) 시스템을 배포하기 때문에 떨어집니다. 다리 역할을 하는 것은 단계적 자율성입니다: 작동하는 기계, 승인하는 인간, 그리고 전체를 실제로 배포할 수 있을 만큼 저렴하게 유지하는 라우팅 계층 — 작업 부하가 상거래, SEO 또는 AI가 답변할 때 브랜드를 인용 가능하게 만드는 GEO 프로그램이든 간에.
그것은 수은 플럭스. 하나의 라우터. 모든 에이전트. 각자의 모델, 각자의 청구서, 각자의 차단기.
수은 기술 솔루션: 디지털화를 가속화하다.
Originally published on MTS Blog & Research