AI代理系統的四個層級:為什麼180億個標記讓我停止調整提示
六個月前,我們的一個AI代理消耗了四萬個標記,寫了一個清晰的摘要宣告任務完成,然後在所有測試中失敗。
四萬個自信、口齒伶俐、結構良好的失敗。
本能 — 每個人的本能 — 是重寫提示。添加「確保測試通過。」切換到更強大的模型。收緊指示。我們都這樣做過。而幾乎每次,這都是錯誤的舉動。
問題不在於提示。問題在於其底層的結構。
簡而言之:AI 代理的失敗在於架構的失敗,而不是提示的失敗。每個可靠的 AI 代理系統都是建立在四個層次上 — Loop、Graph、Harness、Meta-harness — 而「更好的提示無法彌補缺失的能力。」但提示工程仍然是解決方案的一部分:它是你在層次穩固後應用的最後 5%,而不是在它們不穩固時你首先接觸/學習的東西。我們每月在這個堆疊上運行約 180 億個標記 — 同樣的堆疊運行著 Mercury 的 SEO 和 GEO 交付 — 每百萬個標記的混合成本約為 7 美分。這個數字是架構的成就,而不是提示的成就。在層次穩固之後,而不是在它們不穩固時你首先接觸/學習的東西。我們每月在這個堆疊上運行約 180 億個標記 — 同樣的堆疊運行著 Mercury 的 SEO 和 GEO 交付 — 每百萬個標記的混合成本約為 7 美分。這個數字是架構的成就,而不是提示的成就。
我是 James,Mercury Technology Solutions 的 CEO。從我在香港的辦公室,我經營一家 AI 諮詢公司,AI 代理在這裡進行實際的生產工作 — 編碼應用程式、內容管道、GEO 審核、SEO 交付、客戶報告 — 我已經艱難地學到,演示和系統之間的區別從來不是模型。是圍繞模型的堆疊。這個堆疊也是為什麼在 Mercury 的數位轉型意味著重建圍繞 AI 模型的層次,而不僅僅是購買對它的訪問權限。
對我撒謊的 AI 代理
這就是那個失敗的 AI 代理實際上缺少的東西。
它沒有驗證迴圈。它的環境中沒有任何東西檢查它的工作。它寫了程式碼,"感覺" 完成了,並報告成功——因為在它的上下文視窗中,成功和信念在成功中是無法區分的。這個模型並不是在說謊。它真的無法分辨差異。
沒有提示能修正這一點。你可以寫 "驗證你的工作" 直到手指流血,但如果 AI 環境從未暴露測試執行器,這個代理就像是在要求一個盲人檢查燈光。
一旦你看到這一點,就會明顯。失敗不在於推理,而是在於圍繞推理的架構。
四個層次
我所建立或研究的每一個可靠的 AI 代理系統都可以分解為四個層次。跳過一個層次,失敗會在後面顯現,並附帶一個提示重寫,這就像是重新粉刷牆壁來修復基礎裂縫。
層級 1:循環 — 重複直到證據顯示停止。 AI 代理執行、檢查結果,然後停止或重試。關鍵的設計決策是 誰決定完成。一個可靠的代理在測試通過、構建成功、輸出驗證時停止 — 外部證據,而非內部信心。模型相信。循環驗證。
層級 2:圖形 — 決定接下來執行什麼。 循環決定 是否 繼續執行;圖形決定 在哪裡它去的地方。分支、重試、專家交接、後備路徑、共享狀態。一旦工作流程有多條可能的路徑,你需要路由是明確且可檢查的——而不是在每次運行時即興創作於模型的上下文中。
第 3 層:工具架 — 使 AI 模型可運作。工具、API、檔案、記憶體、權限、上下文、日誌。這裡是那些不引人注目的工程所在,也是大多數 AI 代理失敗的根源。模型能力和代理能力是不同的量。AI 模型可能完全理解如何解決一個任務;如果工具架從未暴露工具或權限,任務就會在那裡終止。
第 4 層:元工具架 — 管理多個工具架。實際操作運行多個代理:一個編碼代理、一個研究代理、領域專家,每個都有自己的工具和政策。元工具架是它們之上的共同層——協調、治理、隔離、共享記憶體、上下文可攜性。沒有它,你就沒有艦隊。你只有偶然共享辦公室的孤島。
簡而言之:循環使工作可驗證,圖形使工作流程結構化,工具架使模型可運作,而元工具架使艦隊可治理。
現在,異端:提示工程仍然重要
這就是我與那些將「架構優先」解讀為「提示工程已死」的純粹主義者分道揚鑣的地方。
胡說。提示工程是真實的,並且在規模上是值得真正金錢的。但它的價值有一個排序條件,大多數團隊卻搞反了。
把它想成一個方程式:
AI代理輸出 = (層級能力) × (提示效率)
是乘法,而不是加法。如果任何層的能力為零——沒有驗證迴圈、沒有路徑、沒有工具、沒有治理——那麼產品就是零,沒有任何提示乘數能拯救它。但一旦這些層是穩固的,提示就是決定模型如何有效率地使用它所獲得的東西的乘數。在健康的堆疊上將1.2調整到1.4是有增益的。在破損的堆疊上調整則是對沉船上的黃銅進行拋光。
停止重寫提示以彌補缺失的層級。開始調整提示以利用完整的層級。
180億標記的證明:大規模生成式AI經濟學
讓我用我們自己的數據來具體說明,因為這是理論付出代價的地方。
我們的AI代理艦隊每月處理大約180億標記 — 生成式AI在生產規模下的工作,而不是演示。以標準價格透過高級API零售,這個量的費用會在每月$20,000到$200,000美元之間,具體取決於模型層級。我們的實際支出約為$1,200 — 每百萬標記的綜合費率約為$0.07。
相同的模型。相同的任務。兩個數量級的差異。節省的來源在哪裡?
不是來自提示的技巧。提示很好,但它們並沒有承擔重任。看看錢實際流動的地方:
這個循環消除了最大的浪費:自信的失敗。在證據門檻完成之前,我們的 AI 代理會產生看似合理的輸出,但在下游失敗,觸發人類審查循環和全面重跑——每一次都是純粹的標記焚燒。一個在標記 8,000 處停止不良 AI 執行的測試門檻,功能上相當於對失敗的 90% 折扣。驗證不是額外開支。它是你將花費的最便宜的標記,因為它們可以防止昂貴的標記。
圖表將工作路由到最便宜的足夠模型。任務類別映射到 AI 模型:例行提取在小型本地模型上運行,草擬在中型模型上運行,而昂貴的前沿模型僅處理實際需要的決策。沒有單一的提示能使小型模型適合艱難的任務——這是一個路由決策,在圖表中一次性做出。這一層是我們與零售 API 價格之間兩個數量級差距的主要部分。
這個鞍座使模型選擇與任務設計無關。因為工具、記憶和權限都存在於鞍座中,替換 AI 模型——Claude 變成 Gemini,GPT 變成本地模型——不需要重新設計工作。我們將 AI 模型視為可替換的組件——因為它們就是。鞍座是插座;模型是燈泡。將能力硬編碼到提示中的團隊每次燈泡市場變動時都會購買一個新的插座。
元鞍座在整個車隊中攤銷了一切。共享記憶、共享政策、共享驗證標準。我們部署的第十二個代理不需要支付第一個的設置成本,因為它的環境是繼承的,而不是重建的。元束經濟學是我們下一個代理的邊際成本趨向於零的原因。
現在注意這個系統中的提示工程做了什麼:它調整了利用率 — 更緊湊的指令意味著更少的重試循環、更清晰的路由信號、每個 AI 模型的更好首次輸出。實際收益,單位數百分比,複利增長。但這兩個數量級來自於層級。提示是架構已經建立的儀器上的微調。
這個堆疊的互動版本在我們的網站上 — 失敗檢查並重試的循環是整個論文在一個動畫中的呈現。
這與 SEO 和 GEO 有什麼關係?
一切,如果 AI 可見性是您業務的一部分。
Mercury 的核心服務是幫助企業捕捉在 AI 系統和人類之間掉落的潛在客戶——這包括讓品牌在生成式 AI 答案中可引用,而不僅僅是 Google 排名。我們發送的每一個 GEO 審核、每一個 SEO 交付物、每一個為客戶建立的答案資產都是由這同樣的四層 AI 堆疊產生的。
這不是巧合;這是經濟學。企業規模的 GEO 意味著在 ChatGPT、Perplexity、Gemini 和 Claude 上測試數百個查詢——重複性、結構化、驗證密集的工作。沒有這四層,這樣的工作量在零售代幣價格下是無法承擔的。有了它們,一個會讓僅依賴提示的商店破產的引用審核變成了例行的每月運行。這個堆疊就是為什麼我們能夠承諾 AI 可見性工作保持利潤率不變的原因。
所以當企業客戶詢問為什麼他們的 AI 引用過時或他們的品牌對 LLMs 隱形時,答案遵循相同的原則:不要重寫提示。找到層級。這是相同的答案,無論系統是編碼代理還是整個企業 SEO 和 GEO 計劃——這是 Mercury 為客戶系統建立的基礎。
分流紀律
這裡是操作上的要點。當 AI 代理表現不佳時,提出四個問題 在您觸碰任何提示之前:
- 迴圈:是否有測試、建置或驗證實際上限制完成——還是代理在自我評分?
- 圖形:分支、重試和交接是否明確——還是每次執行都即興發揮?
- 工具:環境是否暴露出任務所需的工具、資料來源和權限?
- 元工具:你的代理是否能共享政策和上下文——還是它們是 N 個不協調的孤島?
只有當所有四個答案都是「是」時,提示才成為剩下的最高槓桿變數。這不是提示工程的降級,而是它的升級——從拐杖變成倍增器。
楊文理通過改善物流贏得了選舉,而其他人則專注於戰術。主動式人工智慧就是同樣的戰爭。層次就是供應線。提示是現場手冊。
建立層次。然後調整人工智慧提示。這個順序——永遠如此。
水星科技解決方案:加速數位化。
Originally published on MTS Blog & Research