跳至内容
Back to InsightsAI

我每月消耗180亿个令牌,费用为1200美元。

By James Huang2026年8月27日·Updated 2026年8月28日8 min read
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

我每月消耗180亿个令牌,费用为1200美元。

简而言之:我过去几个月的平均令牌消耗约为每月180亿个。按Claude零售价格计算——无论是否缓存——每月认知费用为2万到20万美元。我的实际账单约为1200美元。差距不是折扣,而是架构。我拥有我的数据、我的工作流逻辑,并且通过我的路由引擎Mercury Flux,在每一次调用中选择模型。其他人优化他们使用的AI量。真正的杠杆是你为相同输出支付的费用。租用模型,拥有其他一切。

我是詹姆斯,水星科技解决方案的首席执行官,来自香港。

昨天我终于做了我一直在回避的会计工作:提取了几个月的日志并测量了我的代币代谢。结果大约是每月180亿个代币。持续的。

两种反应,按顺序:

  1. 这解释了很多。书籍章节、博客文章、审计包、代理舰队、1187篇文章的档案管道——这一切都不是魔法。这是吞吐量。工业级别的认知。

  2. 等等——这对普通人来说要花多少钱?

180亿代币实际上是什么

每月180亿个代币是每天6亿个。这大约是每秒7000个代币,全天候,无需休息。

一个重度知识工作者在聊天订阅上进行操作——比如每月200次详细对话——消耗几百万个代币。极端月份可以算作1000万个。我的代谢率比这个高三个数量级。

这是人们对人工智能生产力的误解。"我使用人工智能"和"我与人工智能合作"之间的区别不是提示技巧,而是数量。令牌吞吐量是我们对认知表面积的最接近的代理——一个人加机器系统每天可以进行多少阅读、草拟、审查、交叉检查和迭代。大多数人受到他们的订阅级别的限制,从未注意到这个上限,因为他们从未依赖于它。

零售幻觉

以零售价格定价相同的消耗。以Claude作为基准——而Claude是正确的基准,因为对于严肃的代理工作,团队实际上会选择它——混合费率大约在每百万个令牌1美元到10美元之间,具体取决于级别、上下文以及缓存为您节省了多少。

以这些费率计算的180亿个令牌:$18,000到$180,000每月。称之为$20K–$200K的代谢。

这里有一个不舒服的真相:几乎没有个人,也几乎没有企业部门,批准这个数字。因此,没有人以这个代谢运作。他们将自己的认知限制在预算允许的范围内,然后想知道为什么他们的人工智能输出感觉与其他人一样——因为确实如此。订阅级别是您思维的速度限制。

"人工智能没有让每个人的生产力提高10倍"的真正原因比讨论所承认的要简单:10倍的生产力是一个令牌数量现象,而几乎没有人能以零售价格负担得起这些令牌。

实际账单

我的实际支出:大约 每月 $1,200。

分摊开来。这大约是 每百万个令牌七美分,涵盖所有内容——草拟、编码、研究、翻译、群体。在最便宜的零售场景下,相同的认知成本高出15倍。在现实的代理场景下——长上下文、前沿模型、缓存未命中——则高达100倍及以上。

低于最便宜的Claude场景的6%。低于最差情况的1%。

不,我并不是在所有地方都使用更差的模型。你所阅读的输出——书籍章节、审计报告、这篇文章——都不是七分钱的质量。关键不在于“便宜模型”。关键在于仅在前沿质量真正改变结果的地方支付前沿价格。

租用模型,拥有其他一切

节省并不是一个黑客技巧。它们是基于原则的三个早期所有权决策的结果:

1. 拥有数据。每个记忆文件、每日笔记、实体卡片、会议记录和决策日志都存储在我控制的机器上的文件中,以我可以读取的格式cat。没有任何重要内容存放在供应商的数据库中,检索费用会永远累积。供应商持有权重;我持有上下文。上下文是增值的资产。

2. 拥有工作流程逻辑。提示、代理利用的工具、质量门、管道——本地代码、版本控制、可检查、可重构。当一个工作流程产生价值时,这个价值会落入我的代码库,而不是别人的模板库。供应商可以租用我的智能,但不能租用我自己的判断,已编码。

3. 拥有模型选择。这是造成经济损失的关键。在我和每个模型之间是我的路由引擎——Mercury Flux。每个调用都根据任务进行分类,并路由到在该类别中价格与质量最优的模型,当某个提供者出现问题时会有备用链。

原则是操盘人,而不是消费者:操盘人不购买品牌。操盘人调度能力。

路由护城河

每个人都将AI账单视为成本 = 令牌 × 价格,然后优化令牌——更短的提示、更少的调用、更少的AI。很好。但这是在向下优化你的新陈代谢。限制认知以节省开支是一种贫困策略。

另一个术语是价格——价格不是一个常量。它是路由的函数。

认知成本 = 代币 × 混合价格,其中混合价格 = Σ (任务类别的代币份额 × 该类别的最佳价格)。

在我的技术栈中,绝大多数代币——检索、分类、摘要、翻译、初稿生成——都流向成本仅为前沿价格一小部分的模型。前沿模型处理最后一公里:章节的最终剪辑、架构决策、面向客户的判断。昂贵的智能是特种部队,部署在最大杠杆点——而不是占据每条街道的常规军队。没有将军会派特种部队去巡逻每个街区。没有操作员应该派前沿模型去总结网页。

路由护城河:谁控制模型选择,谁就控制相同输出的成本。模型质量是供应商的护城河。选择是你的。

注意价格下降时发生的情况——它们会下降。前沿与中层之间的差距不会缩小;它是一个差距。路由在任何价格制度下捕捉差距。今天的前沿成为明天的中层,而路由器会自动重新索引。护城河不会因通货紧缩而侵蚀。它会重新索引。

为什么群体改变一切

没有人考虑的二阶效应:成本结构决定组织结构。

以零售价格计算,一个由15名代理人组成的委员会——一个起草者、四个评论者、一个事实检查员、一个风格执行者,平行审查——是一个会议演示。没有人会在每个交付物上配置委员会,费用为每百万个令牌10美元。在七美分的混合费用下,委员会是一个项目。我的群体在Mac Studio上运行。它嗡嗡作响。它不向我开票。

廉价的认知使劳动分工变得可负担。你不再构建“一个聊天机器人”,而是开始构建一个代理人的组织结构图——起草者、审查者、审计员、图书管理员——将路由作为人力资源部门。这就是输出量背后的实际机制。不是天才提示,而是人员配置。

企业版

如果你是CAIO或CTO,请对你的组织进行同样的审计。你的团队在某处消耗令牌;唯一的问题是它是通过你的路由层流动,还是通过最近的按钮流动。

我咨询生活中的两点:

  • 代理工作流程在零售价格下会消亡。 实际上推动数字的工作流程——在ChatGPT、Perplexity和Gemini之间进行持续的地理审计;引用监控;实体跟踪;在AI与人类交接间隙中始终在线的潜在客户资格审查——从设计上就是令牌熔炉。在零售环境下,它们是死胎,大家都得出“AI很贵”的结论。经过路由,它们就是定时任务。

  • 供应商锁定就是在租用你自己的工作流程。每年没有路由层,升级路径就是多花钱,少移动。SaaS 曾经教会企业这个教训。AI 正在再次教导这一点,带来复利效应。

停止购买零售智能。开始像计算一样调度它——按任务定价,按调用可交换,在重要的层面上拥有它。

你周一的工作

  1. 测量你的新陈代谢。在所有工具中拉取真实的令牌计数,持续 30 天。你无法管理一个你从未见过的数字。大多数团队的估计偏差在 10 倍左右。

  2. 将你的状态转移到你拥有的文件中。内存、决策、工作流逻辑——从供应商孤岛中转移到你的代码库。一个周末的工作。它将永远复利。

  3. 在你和每个模型之间放置一个路由器。这不一定要是 Flux — 构建精简版。任务分类、模型映射、回退链、成本记录。即使是一个粗略的路由器也能在第一个月节省 5–10 倍的费用。

  4. 重新投资差额。节省并不是重点。重点是 2 万美元的代谢在 1200 美元的成本下能买到什么:委员会、群体、体量、速度。你与其他人之间的差距不再是人才,而是吞吐量。

2026 年最昂贵的 AI 策略不是选择错误的模型。是因为你从未构建选择层而支付每个令牌的前沿价格。

租用模型。拥有路由。保留差额 — 然后将差额用于更多的认知。

水星科技解决方案:加速数字化。

Originally published on MTS Blog & Research