跳至内容
Back to InsightsAI Architecture

AI代理系统的四个层次:为什么180亿个标记让我停止调整提示

By James Huang2026年8月31日·Updated 2026年9月4日9 min read

六个月前,我们的一个AI代理消耗了四万个标记,写了一份清晰的总结声明任务完成,然后在测试套件中失败了每一个测试。

四万个自信、清晰、结构良好的失败标记。

本能——每个人的本能——是重写提示。添加“确保测试通过。”切换到更强大的模型。收紧指令。我们都这样做过。几乎每次,这都是错误的举动。

问题不在于提示。问题在于其底层的结构。

简而言之:AI代理的失败是架构的失败,而不是提示的失败。每个可靠的AI代理系统都是建立在四个层次之上的——循环、图形、工具、元工具——而“更好的提示无法弥补缺失的能力。”但提示工程仍然是解决方案的一部分:这是你在层次合理后应用的最后5%,而不是在层次不合理时首先接触/学习的内容。我们每月在这个堆栈上运行约180亿个标记——同样的堆栈运行着Mercury的SEO和GEO交付——每百万个标记的混合成本大约为7美分。这个数字是架构成就,而不是提示成就。在层次合理后,而不是在层次不合理时你首先接触/学习的内容。我们每月在这个堆栈上运行约180亿个标记——同样的堆栈运行着Mercury的SEO和GEO交付——每百万个标记的混合成本大约为7美分。这个数字是架构成就,而不是提示成就。

我是James,Mercury Technology Solutions的首席执行官。在我位于香港的办公室,我经营一家AI咨询公司,AI代理在这里进行真实的生产工作——编码应用程序、内容管道、GEO审计、SEO交付、客户报告——我通过艰难的方式学到了演示和系统之间的区别从来不是模型。是围绕模型的堆栈。这也是为什么在Mercury的数字化转型意味着重建围绕AI模型的层次,而不仅仅是购买对它的访问。

那个对我撒谎的AI代理

这就是那个失败的 AI 代理实际上缺失的东西。

它没有验证循环。它的环境中没有任何东西检查它的工作。它编写代码,"感觉" 完成,并报告成功——因为在它的上下文窗口中,成功和信念在成功中是无法区分的。模型并没有撒谎。它确实无法分辨差异。

没有提示可以解决这个问题。你可以写“验证你的工作”直到手指流血,但如果 AI 套件从未暴露测试运行器,代理就像是在让一个盲人检查照明。

一旦你看到这一点,就很明显。失败不在于推理,而在于围绕推理的架构。

四个层次

我构建或研究过的每个可靠的 AI 代理系统都分解为四个层次。跳过一个,失败会在后面以提示重写的形式出现,这就像是为了修复基础裂缝而重新粉刷墙壁。

层级 1:循环 — 重复直到证据表明停止。 AI 代理执行,检查结果,然后停止或重试。关键设计决策是 谁决定完成。一个可靠的代理在测试通过、构建成功、输出验证时停止 — 外部证据,而非内部信心。模型相信。循环验证。

层级 2:图形 — 决定接下来运行什么。 循环决定 是否 继续执行;图形决定 在哪里它去哪里。分支、重试、专业人员交接、后备路径、共享状态。一旦工作流有多个可能的路线,您需要路由是明确和可检查的——而不是在每次运行时在模型的上下文中即兴发挥。

第 3 层:工具 — 使 AI 模型可操作。工具、API、文件、内存、权限、上下文、日志。这是那些不那么光鲜的工程所在,也是大多数 AI 代理失败的实际来源。模型能力和代理能力是不同的量。AI 模型可能确切地理解如何解决任务;如果工具或权限从未在工具中暴露,任务就会在此终止。

第 4 层:元工具 — 管理多个工具。实际操作运行多个代理:一个编码代理、一个研究代理、领域专家,每个都有自己的工具和政策。元工具是它们之上的共同层——编排、治理、隔离、共享内存、上下文可移植性。没有它,您就没有舰队。您只有恰好共享一个办公室的孤岛。

简而言之:循环使工作可验证,图使工作流结构化,工具使模型可操作,元工具使舰队可治理。

现在,异端:提示工程仍然重要

在这里,我与那些将“架构优先”解读为“提示工程已经死了”的纯粹主义者分道扬镳。

胡说。提示工程是真实存在的,并且在规模上是值得真正金钱的。但它的价值有一个排序条件,大多数团队却搞反了。

把它想象成一个方程:

AI代理输出 = (层能力)×(提示效率)

是乘法,而不是加法。如果任何层的能力为零——没有验证循环,没有路线,没有工具,没有治理——产品就是零,任何提示乘数都无法拯救它。但一旦各层稳固,提示就是决定模型如何高效地使用它所获得的内容的乘数。在健康的堆栈上将1.2调优到1.4是复合的。在破损的堆栈上调优就像是在沉船上抛光黄铜。

停止重写提示以弥补缺失的层。开始调整提示以利用完整的层。

180亿令牌证明:大规模生成AI经济学

让我用我们自己的数字来具体说明,因为这是理论付诸实践的地方。

我们的AI代理舰队每月处理大约180亿令牌—— 生成AI在生产规模下的工作,而不是演示。通过高端API以标准列表价格零售,这个量每月的费用将在20,000到200,000美元之间,具体取决于模型层级。我们的实际支出约为$1,200 — 每百万令牌的混合费率大约为$0.07。

相同的模型。相同的任务。两个数量级的差异。节省的来源是什么?

不是来自提示的技巧。提示很好,但它们并没有承担主要工作。看看钱实际上是如何流动的:

循环消除了最大的浪费:自信的失败。在证据门控完成之前,我们的 AI 代理会生成看似合理的输出,但在下游失败,触发人工审核周期和全面重跑——每一次都是纯粹的令牌焚烧。一个在令牌 8,000 处停止糟糕 AI 运行的测试门,而不是在令牌 80,000 处,从功能上讲,是对失败的 90% 折扣。验证不是开销。它是你花费的最便宜的令牌,因为它们可以防止昂贵的令牌。

图表将工作路由到最便宜的足够模型。任务类别映射到 AI 模型:常规提取在小型本地模型上运行,草拟在中型模型上进行,而昂贵的前沿模型仅处理实际需要的决策。没有单一的提示可以使小模型适合困难任务——这是一个路由决策,在图中一次性做出。这个单层是我们与零售 API 定价之间两倍数量级差距的主要部分。

工具、内存和权限都在外壳中,使得模型选择与任务设计无关。因为工具、内存和权限都在外壳中,替换 AI 模型——Claude 替换为 Gemini,GPT 替换为本地模型——并不需要重新设计工作。我们将 AI 模型视为可替换的组件——因为它们确实是。外壳是插座;模型是灯泡。将能力硬编码到提示中的团队每次灯泡市场变动时都需要购买一个新的插座。

元外壳将所有成本在整个车队中摊销。共享内存,共享政策,共享验证标准。我们部署的第十二个代理不需要支付第一个的设置成本,因为它的环境是继承的,而不是重建的。元框架经济学是我们下一个代理的边际成本趋向于零的原因。

现在注意一下提示工程在这个系统中做了什么:它调整了利用率—— 更紧凑的指令意味着更少的重试循环,更清晰的路由信号,以及每个 AI 模型的更好首次输出。真正的收益,个位数百分比,复合增长。但两个数量级的提升来自于各个层次。提示是架构已经构建的仪器上的微调。

这个堆栈的交互版本在我们的网站上——循环失败检查并重试的过程在一个动画中展示了整个论点。

这与 SEO 和 GEO 有什么关系?

如果人工智能可见性是您业务的一部分,那就一切皆有可能。

水星的核心服务是帮助企业捕捉那些在人工智能系统与人类之间掉落的潜在客户——这包括使品牌在生成式人工智能回答中可引用,而不仅仅是谷歌排名。我们交付的每一个GEO审计、每一个SEO交付物、为客户构建的每一个答案资产都是由这同样的四层人工智能堆栈生成的。

这不是巧合;这是经济学。企业规模的GEO意味着在ChatGPT、Perplexity、Gemini和Claude上测试数百个查询——重复、结构化、验证密集的工作。没有这四层,这种工作负载在零售代币价格下是无法承受的。有了它们,一个会使仅依赖提示的商店破产的引用审计变成了常规的每月运行。这个堆栈就是我们能够承诺保持人工智能可见性工作的利润率不变的原因。

因此,当企业客户询问他们的人工智能引用为何过时或他们的品牌为何在大型语言模型中不可见时,答案遵循相同的原则:不要重写提示。找到层级。这是无论系统是编码代理还是整个企业SEO和GEO程序的相同答案——也是水星为客户系统构建的基础。

分类学科

这里是操作要点。当一个人工智能代理表现不佳时,提出四个问题在您触碰任何提示之前:

  1. 循环:是否有测试、构建或验证实际限制完成——还是代理在自我评分?
  2. 图表:分支、重试和交接是否明确——还是每次运行时即兴发挥?
  3. 工具:环境是否暴露任务所需的工具、数据源和权限?
  4. 元工具:你的代理能否共享政策和上下文——还是它们是 N 个不协调的孤岛?

只有当四个答案都是"是"时,提示才成为剩下的最高杠杆变量。这不是提示工程的降级。这是它的升级——从拐杖到倍增器。

杨文理通过修复后勤赢得了战役,而其他人则研究战术。代理 AI 就是同样的战争。层次就是供应线。提示是现场手册。

构建层次。然后调整 AI 提示。按这个顺序——始终如此。

水星科技解决方案:加速数字化。