コンテンツへスキップ
Back to InsightsAI Architecture

AIエージェントシステムの4つの層:18億トークンが私にプロンプト調整をやめさせた理由

By James Huang2026年8月31日·Updated 2026年9月4日9 min read

6ヶ月前、私たちのAIエージェントの1つが4万トークンを消費し、タスク完了を宣言するクリーンな要約を書き、その後、スイート内のすべてのテストに失敗しました。

自信に満ち、明確で、構造的に整った失敗の4万トークン。

本能 — 誰もが持つ本能 — はプロンプトを書き直すことです。「テストが通ることを確認してください。」より強力なモデルに切り替えます。指示を厳密にします。私たちは皆それをやってきました。そしてほとんど毎回、それは間違った手段です。

問題はプロンプトにありませんでした。問題はその下の層にありました。

要約:AIエージェントの失敗は、プロンプトの失敗の前にアーキテクチャの失敗です。信頼できるAIエージェントシステムは、4つの層 — ループ、グラフ、ハーネス、メタハーネス — に基づいて構築されており、「より良いプロンプトは欠けている能力を補うことはできません。」しかし、プロンプトエンジニアリングは依然として解決策の一部です:それは適用する最後の5%です。後に層が健全であるときに、最初に手を伸ばす/学ぶべきことではありません。私たちはこのスタックで毎月約180億トークンを処理しています — MercuryのSEOおよびGEO配信を実行するのと同じスタックで — 約100万トークンあたり7セントでブレンドされています。その数字はアーキテクチャの成果であり、プロンプトの成果ではありません。

私はJames、Mercury Technology SolutionsのCEOです。香港のオフィスから、AIエージェントが実際の生産作業を行うAIコンサルタントを運営しています — アプリケーションのコーディング、コンテンツパイプライン、GEO監査、SEO成果物、クライアント報告 — そして、デモとシステムの違いは決してモデルではないことを痛感しました。それはモデルの周りのスタックです。このスタックが、MercuryにおけるデジタルトランスフォーメーションがAIモデルの周りの層を再構築することを意味する理由でもあります。単にそれへのアクセスを購入するのではなく。

私に嘘をついたAIエージェント

失敗したAIエージェントが実際に欠けていたものはこれです。

検証ループがありませんでした。環境内の何もその作業をチェックしませんでした。コードを書き、「完了した」と「感じ」、成功を報告しました — なぜなら、そのコンテキストウィンドウの内部からは、成功と信念は区別がつかないからです。モデルは嘘をついていませんでした。本当に違いを判断できなかったのです。

どんなプロンプトもそれを修正することはできません。指が血が出るまで「作業を確認してください」と書いても、AIハーネスがテストランナーを露出しない限り、エージェントは盲目の人に照明をチェックするように頼んでいるのです。

それを見れば明らかです。失敗は推論にあったのではなく、推論を取り囲むアーキテクチャにあったのです。

四つの層

私が構築または研究したすべての信頼できるAIエージェントシステムは、四つの層に分解されます。一つをスキップすると、失敗は後でプロンプトの書き換えが付随して現れます。これは、基礎のひび割れを修正するために壁を再塗装するようなものです。

レイヤー 1: ループ — 証拠が停止を示すまで繰り返す。 AI エージェントは行動し、結果を確認し、停止するか再試行します。重要な設計上の決定は 誰が完了を決定するかです。信頼できるエージェントは、テストが合格したとき、ビルドが成功したとき、出力が検証されたときに停止します — 外部の証拠であり、内部の自信ではありません。モデルは信じます。ループは検証します。

レイヤー 2: グラフ — 次に何を実行するかを決定します。 ループは 実行が続くかどうかを決定します; グラフは決定します どこに行くのか。分岐、再試行、専門家の引き継ぎ、フォールバックパス、共有状態。一度ワークフローに複数の可能なルートがある場合、ルーティングは明示的で検査可能である必要があります — モデルのコンテキスト内で毎回即興で行われるべきではありません。

レイヤー3: ハーネス — AIモデルを運用可能にする。ツール、API、ファイル、メモリ、権限、コンテキスト、ログ記録。ここが地味なエンジニアリングが存在する場所であり、実際にほとんどのAIエージェントの失敗が発生する場所です。モデルの能力とエージェントの能力は異なる量です。AIモデルはタスクを解決する方法を正確に理解しているかもしれませんが、ハーネスがツールや権限を決して公開しない場合、そのタスクはそこで死にます。

レイヤー4: メタハーネス — 多くのハーネスを管理する。実際の操作は複数のエージェントを実行します: コーディングエージェント、リサーチエージェント、ドメインスペシャリスト、それぞれ独自のツールとポリシーを持っています。メタハーネスはそれらの上にある共通のレイヤーです — オーケストレーション、ガバナンス、アイソレーション、共有メモリ、コンテキストのポータビリティ。それがなければ、艦隊は持っていません。オフィスを共有しているサイロがあります。

要するに: ループは作業を検証可能にし、グラフはワークフローを構造化し、ハーネスはモデルを運用可能にし、メタハーネスは艦隊を管理可能にします。

さて、異端:プロンプトエンジニアリングはまだ重要です

ここで私は、「アーキテクチャファースト」を「プロンプトエンジニアリングは死んだ」と読む純粋主義者たちと意見が分かれます。

馬鹿げている。プロンプトエンジニアリングは現実のものであり、大規模では実際の価値があります。しかし、その価値にはほとんどのチームが逆に理解している順序条件があります。

それを方程式として考えてみてください:

AIエージェントの出力 = (レイヤーの能力) × (プロンプトの効率)

掛け算、足し算ではありません。どのレイヤーの能力がゼロであれば — 検証ループなし、ルートなし、ツールなし、ガバナンスなし — 製品はゼロになり、どんなプロンプトの乗数もそれを救うことはできません。しかし、レイヤーがしっかりしていると、プロンプトは与えられたものをどれだけ効率的にモデルが使用するかを決定する乗数です。健全なスタックで1.2から1.4に調整することは、複利効果を生みます。壊れたスタックで調整することは、沈む船の上で真鍮を磨くようなものです。

欠落しているレイヤーを補うためにプロンプトを再構築するのをやめて、完全なものを活用するためにプロンプトを調整し始めましょう。

180億トークンの証明:スケールでの生成AI経済

理論が実を結ぶのはここですので、私たち自身の数字で具体的に示しましょう。

私たちのAIエージェント艦隊は、約毎月180億トークンを処理します — 生成AIの作業は生産スケールで行われ、デモではありません。標準のリスト価格でプレミアムAPIを通じて販売される場合、そのボリュームはモデルのティアに応じて、月に約20,000ドルから200,000ドルの間になります。実際の支出は約$1,200 — 約100万トークンあたり0.07ドルの混合レートです。

同じモデル。同じタスク。2桁の違い。どこから節約が来たのでしょうか?

プロンプトのトリックからではありません。プロンプトは問題ありませんが、実際に重い作業を行っているわけではありません。お金が実際にどこに動いているかを見てください:

ループは最大の無駄を排除しました:自信のある失敗。証拠ゲート付きの完了前、私たちのAIエージェントは、下流で失敗するような見かけ上の出力を生成し、人間のレビューサイクルと完全な再実行を引き起こしました — それらはすべて純粋なトークンの焼却でした。トークン8,000で悪いAIの実行を止めるテストゲートは、機能的には失敗に対する90%の割引です。検証はオーバーヘッドではありません。それは、あなたが今までに使う中で最も安いトークンであり、高価なトークンを防ぐからです。

グラフは作業を最も安価な十分なモデルにルーティングしました。タスククラスはAIモデルにマッピングされます:ルーチン抽出は小さなローカルモデルで実行され、ドラフトは中程度のモデルで行われ、高価なフロンティアモデルは実際に必要な決定にのみ触れます。単一のプロンプトが小さなモデルを難しいタスクに適切にすることはありません — それは一度だけ行われるルーティングの決定です。この1層が私たちと小売APIの価格設定との間の2桁の差の大部分を占めています。

ハーネスはタスク設計に対するモデル選択を無関係にしました。ツール、メモリ、権限がハーネスに存在するため、AIモデルを交換すること — ClaudeからGemini、GPTからローカルモデルへの切り替え — は作業を再設計することはありません。私たちはAIモデルを交換可能なコンポーネントのように扱います — それが実際にそうだからです。ハーネスはソケットであり、モデルは電球です。プロンプトに機能をハードコーディングするチームは、電球市場が動くたびに新しいソケットを購入します。

メタハーネスは艦隊全体にわたってすべてを償却しました。共有メモリ、共有ポリシー、共有検証基準。私たちが展開する12番目のエージェントは、最初のエージェントのセットアップコストを支払う必要がありません。なぜなら、その環境は再構築されるのではなく、継承されるからです。メタハーネス経済学が、次のエージェントの限界コストがゼロに近づく理由です。

さて、このシステムでプロンプトエンジニアリングが何をしたのかに注目してください:それは利用率を各層内で調整しました — より厳密な指示はリトライループを減らし、クリーンなルーティング信号を提供し、艦隊内のすべてのAIモデルからの初回出力を改善しました。実際の利益は、1桁のパーセンテージで、複利的に増加します。しかし、2桁のオーダーは層から来ました。プロンプティングは、すでに構築されたアーキテクチャの楽器の微調整です。

このスタックのインタラクティブバージョンは私たちのサイトにあります — チェックに失敗してリトライするループは、1つのアニメーションで全体の主題です。

これはSEOとGEOに何の関係がありますか?

すべて、AIの可視性があなたのビジネスの一部である場合。

マーキュリーのコアオファリングは、企業がAIシステムと人間の間のギャップで落ちてしまうリードをキャッチするのを助けることです — これは、ブランドを生成AIの回答の中で引用可能にすることを含み、単にGoogleのランキングだけではありません。私たちが提供するすべてのGEO監査、すべてのSEO成果物、クライアントのために構築するすべての回答資産は、この同じ4層のAIスタックによって生産されています。

それは偶然ではありません。それは経済です。企業規模でのGEOは、ChatGPT、Perplexity、Gemini、Claudeを通じてテストされた数百のクエリを意味します — 繰り返し、構造化され、検証が重視される作業です。4層がなければ、その作業負荷は小売トークン価格では手が届きません。それがあれば、プロンプトのみのショップを破産させるような引用監査が、定期的な月次作業になります。このスタックがあるからこそ、私たちはマージンを維持したままAI可視性の作業を約束できるのです。

したがって、企業クライアントがなぜ彼らのAI引用が古くなっているのか、または彼らのブランドがLLMに見えないのかを尋ねると、その答えは同じ規律に従います:プロンプトを書き直さないでください。レイヤーを見つけてください。それは、システムがコーディングエージェントであろうと、全体の企業SEOおよびGEOプログラムであろうと同じ答えです — そしてそれはマーキュリーがクライアントシステムを構築する基盤です。

トリアージの規律

ここでの運用上の要点です。AIエージェントが期待通りに機能しない場合、4つの質問を実行してください 前にあなたが一つのプロンプトに触れる前に:

  1. ループ:テスト、ビルド、または検証が実際に完了を制限しているのか、それともエージェントが自分の宿題を採点しているのか?
  2. グラフ:ブランチ、リトライ、ハンドオフは明示的か、それとも実行ごとに即興で行われているのか?
  3. ハーネス:環境は、タスクに必要なツール、データソース、および権限を公開しているか?
  4. メタハーネス:あなたのエージェントはポリシーとコンテキストを共有できるか、それともNの調整されていないサイロなのか?

すべての4つの回答が「はい」のときのみ、プロンプトは残された最も高い影響力の変数になります。それはプロンプトエンジニアリングの降格ではありません。それはその昇進です — 足場から乗数へ。

ヤン・ウェンリーは、他の誰も戦術を研究している間に物流を修正することでキャンペーンに勝ちました。エージェンティックAIも同じ戦争です。層は供給ラインです。プロンプトはフィールドマニュアルです。

層を構築します。その後、AIプロンプトを調整します。その順序で — 常に。

マーキュリーテクノロジーソリューションズ:デジタリティを加速します。