コンテンツへスキップ
Back to InsightsAI Architecture

マーキュリーフラックス:私たちのコマースエージェントの背後にあるAIルーティングレイヤー

By James Huang2026年9月2日·Updated 2026年9月4日8 min read

AIエージェントを展開するすべての企業が12ヶ月以内に直面する質問があります:5つのエージェントが稼働している場合 — ショッピングアシスタント、カタログマネージャー、アナリスト、コピーライター、サポートボット — 各エージェントはどのモデルを使用しますか?

デフォルトの回答は、それを構築したチームが好むモデルです。5つのアプリ、5つのハードコーディングされたモデル選択、5つの.envファイルに同じAPIキーのコピー、5つの見えない請求書。プロバイダーに障害が発生すると、5つのアプリが独立して失敗します。ファイナンスが製品ラインごとのAIコストを尋ねると、誰も答えられません。

私たちはそのアーキテクチャを受け入れることを拒否したので、それを修正するレイヤーを構築しました。これは、マーキュリーフラックス — 私たちのモデルルーティングエンジン — と、それ上で動作するコマースエージェントの物語です。また、企業クライアント向けにエージェントAIをどのように展開するかのプレビューでもあります。

要点:すべてのAIアプリにモデルをハードコーディングすることは、ソースコードにパスワードをハードコーディングすることの新しい形です。マーキュリーフラックスは、すべてのエージェントとすべてのモデルプロバイダーの間に位置するAIルーティングレイヤーです — ジェミニ、GLM、グロック、キミ、どれでも:各アプリは独自のキーで認証し、独自のルートテーブル(タスクタイプ → モデル → フォールバックチェーン)を取得し、独自のトークン使用量を報告します。私たちのコマースエージェント — 顧客向けのショッピングアシスタントと、すべての書き込みが人間の承認を待つバックオフィスのマーチャントエージェント — は、このスタック上で約$0.07 のコストで百万トークンをブレンドしており、小売APIコストの約2%です. 同じスタックが、私たちのAI可視性作業の背後にあるSEOおよびGEOパイプラインを支えています。ルーターがモデルを決定します。アプリはそれを知りません。それがポイントです。

私はジェームズ、マーキュリーテクノロジーソリューションのCEOです。私たちは企業向けにAIと人間の橋を構築し、アーキテクチャの決定がオプションでない規模で自社のエージェントフリートを運営しています — 月に約180億トークンです。Fluxは、それを手頃で、観察可能で、制御下に保つルーティングエンジンです。今日は、それが何をするのか、そしてなぜ商取引エージェントがその最初の本当の顧客であるのかをお見せします。

問題: モデルのスプロール

2026年のAIアプリケーションスタックには欠けているレイヤーがあり、ほとんどのチームはそれを感じていますが、名前を付けることができません。

モデルプロバイダーがいます — 優れたものが増えています: Google、OpenAI、Anthropic、そして強力な挑戦者の波があります。エージェントフレームワークもあります。欠けているのは、どのモデル、どのワークロード、どのコスト、どのフォールバック、誰に請求するかを決定する部分です。どのモデル、どのワークロード、どのコスト、どのフォールバック、誰に請求するか。

そのレイヤーがないと、すべてのアプリが独自のルーティング決定を行い、開発者がコードで一度だけ行います。その結果は静かに累積します:

  • コストの盲目。5つのアプリ、5つのプロバイダーアカウント、統一されたビューはなし。ショッピングアシスタントのコストとサポートボットのコストを誰も言えない。
  • キーのスプロール。すべてのアプリが生のプロバイダーキーを保持しています。1つを回転させると、すべてのリポジトリを探し回る必要があります。1つの漏洩はフルアカウントの漏洩です。
  • フェイルオーバーなし。プロバイダーが悪い午後を過ごすと、それをハードコーディングしたすべてのアプリが一緒にダウンします。
  • モデルのロックイン。より良いまたは安価なモデルにワークロードを切り替えるにはアプリコードに手を加える必要があるため、実行されず、永遠に過剰支払いをすることになります。

モデルが十分に良くないのではなく、アーキテクチャに選択する能力がないのです。

水星フラックス: 選択するレイヤー

フラックスは、あなたのエージェントとモデルプロバイダーの間にある薄く、容赦のないレイヤーです。デザインは1段落に収まります:

すべてのアプリは、プロバイダーキーではなく、自分のキーでフラックスに認証します。各リクエストは、モデル名の代わりにルート名を持ちます:ツールループ ツール呼び出し作業用、ロングテキスト 草案作成用、分析 深い推論のために。Fluxはそのアプリのテーブルに対してルートを解決します — 順序付けられたチェーンのように ツールの規律のためのGrok、フォールバックとしてのGLM — 実際のプロバイダーの資格情報を追加し、呼び出しを転送します。すべてのリクエストは、アプリごと、ルートごとのトークン会計でログに記録されます。プロバイダーがダウンすると、Fluxはフェイルオーバーします。モデルの価格が変わると、テーブルを編集します。アプリはそれに気づきません。

AIのための電気パネルのように考えてください:ユーティリティからの1つのフィード(プロバイダー)、各回路のためのブレーカー(アプリ)、各ラインのメーター。ランプを消すために家を配線し直す必要はありません。

経済はルーティング自体から生まれます。ツールループは機能呼び出しの規律のために選ばれたAIモデルで実行されます。長文生成は、トークンあたりのコストが最も低い場所で実行されます。ハードな推論は、タスクが実際にそれを必要とする場合にのみ最前線モデルを取得します。私たちのフリート全体 — コマースエージェント、SEOコンテンツパイプライン、エンタープライズクライアントに出荷するGEO監査 — これが$0.07/百万のブレンドレートに累積します:同じLLMボリュームがプレミアム小売価格でかかるコストの2桁のオーダーの下です。一度、テーブルで行われたルーティングの決定は、コードで決して行われません。

最初のテナント:コマースエージェント

Fluxの最初の生産ワークロードは、小売展開のために構築した一対のコマースエージェントで、私たちが強化し、独自のランタイムで拡張したオープンリファレンスブループリントに基づいています。

ショッピングエージェントは顧客向けのものです。カタログを検索し、オプションを比較し、購入を計画し、カートを埋め、注文やポリシーに関する質問に答えます — 顧客が伝えたことを記憶しています。これは、現在起こっている変化に対する店舗の答えです:かつて「最高の2人用テント」をGoogleに尋ねていたバイヤーが、ますますChatGPT、Perplexity、またはGeminiに直接尋ね、店舗のアシスタントが検索結果よりも鋭いことを期待しています。これは迅速で、忍耐強く、「この2つのうちどちらが小さなバルコニーに適していますか?」という質問に疲れることはありません。

マーチャントエージェントはバックオフィスのものです。パフォーマンスを説明し、リスティングを維持し、在庫アラートに対応し、価格を調整し、キャンペーンを草案します。そして、企業にとって重要な部分は、すべての書き込みは実行されず、提案されるものです。価格変更、再入荷、リスティングの編集 — 各変更は人間の承認を待つ提案として行われます。エージェントが提案し、オペレーターが処理します。

その下にある安全アーキテクチャは、私たちが最も誇りに思っている部分です。なぜなら、それはデモでは決して見せない部分だからです:

  • 出所ゲート。カートは、このセッションで実際にカタログツールが返した製品のみを受け付けます。モデルは購入を幻覚することはできません。
  • 適用時のガードレール。価格が深すぎる、再入荷が大きすぎる、保護されたフィールドに触れた — 変更は誰が承認しても拒否されます。
  • フェンシングされたコンテキスト。エージェントが読むサードパーティのテキストは、悪意のある製品説明が指示を注入できないようにサニタイズされ、区切られています。エージェントはウェブを読み、ウェブはエージェントを読むことはできません。

これが私たちが生計を立てるために構築するAIと人間の橋です:AIが作業を行い、人間が書き込みを承認します。店舗に取り付けられたチャットボットではなく、自律性と説明責任が設計によって分離されたシステムです。

ルーティングが私たちにもたらしたもの: ライブ比較

Fluxがルーティングをアプリコードから分離するため、1行の設定を編集することで、同じショッピングエージェントのワークロードを2つの異なるモデルで実行しました。その違いは決定的でした。

1つのモデル — プローズに強い — はツール契約を誤って処理しました: 不正なスキル呼び出し、繰り返しの検索、未完了の購入。もう1つは同じ列挙スキーマをクリーンに処理し、最初の試みで操作指示を読み込み、検索からカートへのフローを完了しました — その間、スキルマニュアルのルールに正しく従って研究はカートに書き込む前に現在の発見を提示するというものです。同じエージェント、同じゲート、同じプロンプト。異なるのはモデルだけであり、モデルはルーティングレイヤーによって変更できるものです。

この1つの比較をすべてのワークロード、すべてのクライアント、すべての四半期に掛け算してください。モデルは常に改善され、再価格設定されます; 数秒で再ルーティングできるチームは、次のスプリントでリファクタリングを予定したチームを常に上回ります。Fluxはモデルの選択をアーキテクチャのコミットメントから設定行に変えます。

これが企業にとって重要な理由

エージェントAIを展開している場合 — 商取引またはその他の用途 — 3つの影響があります:

  1. アプリごとのモデルルーティングは基本的な要件です。ワークロードがAIモデルを決定します:エージェントのためのツールの規律、コンテンツのための安価な長文コンテキスト、判断のためのフロンティアのみ。ルーティングレイヤーはこれをポリシーにし、アプリごとの偶発的なものではなくします。
  2. キーとコストは一つの場所に属します。アプリはルーターに認証します;ルーターだけがプロバイダーの資格情報を保持します。トークンの代謝はアプリごと、ルートごとに測定されるため、「AIは製品ラインごとにどれくらいのコストがかかるのか?」はクエリとなり、法医学的な監査ではなくなります。これをコアなデジタルトランスフォーメーションインフラとして扱い、マーケティングツールではないとします。
  3. 自律性には承認ゲートが必要です。生産システムに書き込むエージェント — カート、カタログ、価格 — は、アーキテクチャの特徴として段階的な変更と人間の承認を必要とします。私たちが運営するコマースのブループリントは、実際のツール呼び出しの負荷の下で機能することを証明しています。

AIから人間へのギャップで落ちるリードの43%?それらは、企業が全人間(遅い)または全AI(説明責任なし)システムを展開するために落ちます。橋は段階的自律性です:機能する機械、承認する人間、そして全体を実際に展開できるほど手頃な価格に保つルーティングレイヤー — ワークロードがコマース、SEO、またはAIが回答する際にブランドを引用可能にするGEOプログラムであっても。

それは水星フラックス. 1つのルーター。すべてのエージェント。独自のモデル、独自の請求書、独自のブレーカー。

水星テクノロジーソリューション:デジタリティを加速する。