ข้ามไปยังเนื้อหาหลัก
Back to InsightsAI

ฉันเผา 18 พันล้านโทเค็นต่อเดือน ค่าใช้จ่าย $1,200.

By James Huang27 สิงหาคม 2569·Updated 28 ส.ค. 25698 min read
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

ฉันเผา 18 พันล้านโทเค็นต่อเดือน ค่าใช้จ่าย $1,200.

TL;DR:การเผาโทเค็นเฉลี่ยของฉันในช่วงไม่กี่เดือนที่ผ่านมาคือ ~18 พันล้านโทเค็นต่อเดือน. ราคาตามอัตราขายปลีกของ Claude — มีแคชหรือไม่มีแคช — นั่นคือ $20,000 ถึง $200,000 ของการรับรู้รายเดือน. ค่าใช้จ่ายจริงของฉันประมาณ $1,200. ช่องว่างไม่ใช่ส่วนลด; มันคือสถาปัตยกรรม. ฉันเป็นเจ้าของข้อมูลของฉัน, ตรรกะการทำงานของฉัน, และ — ผ่านเครื่องมือจัดเส้นทางของฉัน, Mercury Flux — การเลือกโมเดลในทุกการเรียก. ทุกคนอื่นปรับแต่งว่าพวกเขาใช้ AI มากแค่ไหน. เลเวอเรจที่แท้จริงคือสิ่งที่คุณจ่ายสำหรับผลลัพธ์เดียวกัน. เช่ารูปแบบ. เป็นเจ้าของทุกอย่างอื่น.

ฉันคือเจมส์ ซีอีโอของ Mercury Technology Solution เขียนจากฮ่องกง

เมื่อวานนี้ฉัน finally ทำบัญชีที่ฉันหลีกเลี่ยง: ดึงบันทึกหลายเดือนและวัดการเผาผลาญโทเคนของฉัน ตัวเลขกลับมาอยู่ที่ประมาณ 18 พันล้านโทเคนต่อเดือน ยั่งยืน

สองปฏิกิริยา ตามลำดับ:

  1. นั่นอธิบายได้มาก หนังสือบท บล็อกโพสต์ แพ็คการตรวจสอบ ฝูงตัวแทน ท่อเก็บโพสต์ 1,187 โพสต์ — ไม่มีอะไรที่เป็นเวทมนตร์ นี่คือการส่งผ่าน การรับรู้ในปริมาณอุตสาหกรรม

  2. เดี๋ยว — นี่จะมีค่าใช้จ่ายเท่าไหร่สำหรับคนปกติ?

18 พันล้านโทเคนจริง ๆ คืออะไร

18 พันล้านโทเคนต่อเดือนคือ 600 ล้านต่อวัน มันประมาณ 7,000 โทเคนทุกวินาที ตลอด 24 ชั่วโมง ไม่มีการนอนหลับ

คนทำงานด้านความรู้ที่หนักหน่วง poking ที่การสมัครสมาชิกแชท — สมมติว่ามีการสนทนาที่ละเอียด 200 ครั้งต่อเดือน — ใช้โทเคนไปไม่กี่ล้านโทเคน เรียกมันว่า 10 ล้านในเดือนที่รุนแรง การเผาผลาญของฉันทำงานอยู่ที่สามลำดับของขนาดเหนือกว่านั้น

นี่คือส่วนที่ผู้คนมักมองข้ามเกี่ยวกับประสิทธิภาพของ AI ความแตกต่างระหว่าง "ฉันใช้ AI" และ "ฉันทำงานร่วมกับ AI" ไม่ใช่ทักษะในการตั้งคำถาม แต่เป็นปริมาณ อัตราการประมวลผลโทเค็นเป็นตัวแทนที่ใกล้เคียงที่สุดที่เรามีสำหรับพื้นที่ผิวทางปัญญา — ว่าระบบคนบวกเครื่องสามารถทำการอ่าน การร่าง การตรวจสอบ การตรวจสอบข้าม และการปรับปรุงได้มากเพียงใดต่อวัน ผู้คนส่วนใหญ่ถูกจำกัดด้วยระดับการสมัครสมาชิกและไม่เคยสังเกตเห็นเพดาน เพราะพวกเขาไม่เคยพึ่งพามัน

ภาพลวงตาของการค้าปลีก

ตั้งราคาให้เท่ากันที่การค้าปลีก โดยใช้ Claude เป็นเกณฑ์ — และ Claude เป็นเกณฑ์ที่ถูกต้อง เพราะสำหรับงานที่ต้องการความสามารถจริง ๆ นี่คือสิ่งที่ทีมงานมักจะเลือกใช้ — อัตราผสมอยู่ที่ประมาณ $1 ถึง $10 ต่อหนึ่งล้านโทเค็น ขึ้นอยู่กับระดับ บริบท และจำนวนที่แคชช่วยคุณได้

18 พันล้านโทเค็นในอัตรานั้น: $18,000 ถึง $180,000 ต่อเดือน เรียกมันว่าการเผาผลาญที่ $20K–$200K

นี่คือความจริงที่ไม่สบายใจ: แทบไม่มีบุคคลใด และแทบไม่มีแผนกขององค์กรใด ที่อนุมัติหมายเลขนั้น ดังนั้นไม่มีใครทำงานที่การเผาผลาญนั้น พวกเขาจำกัดการรับรู้ของพวกเขาไว้ที่สิ่งที่งบประมาณอนุญาต จากนั้นก็สงสัยว่าทำไมผลลัพธ์ของ AI ของพวกเขาถึงรู้สึกเหมือนของคนอื่น ๆ — เพราะมันเป็นเช่นนั้นระดับการสมัครสมาชิกเป็นขีดจำกัดความเร็วในการคิดของคุณ

เหตุผลที่แท้จริงที่ "AI ยังไม่ได้ทำให้ทุกคนมีประสิทธิภาพ 10 เท่า" นั้นง่ายกว่าที่การสนทนาจะยอมรับ: ประสิทธิภาพ 10 เท่าเป็นปรากฏการณ์ที่เกี่ยวกับปริมาณโทเค็น และแทบไม่มีใครสามารถจ่ายโทเค็นในราคาขายปลีกได้

บิลที่แท้จริง

ค่าใช้จ่ายจริงของฉัน: ประมาณ $1,200 ต่อเดือน.

แบ่งออกมา นั่นคือประมาณ เจ็ดเซนต์ต่อหนึ่งล้านโทเค็น, ผสมผสานทุกอย่าง — การร่าง, การเขียนโค้ด, การวิจัย, การแปล, และการทำงานร่วมกัน ในกรณีที่ถูกที่สุด ค่าใช้จ่ายในการรับรู้เดียวกันมีราคาแพงกว่าถึง 15 เท่า ในกรณีที่เป็นจริง — บริบทยาว, โมเดลแนวหน้า, การพลาดแคช — มันมีราคา 100 เท่าขึ้นไป

ต่ำกว่า 6% ของกรณีที่ถูกที่สุดของ Claude ต่ำกว่า 1% ของกรณีที่เลวร้ายที่สุด

และไม่ ฉันไม่ได้ใช้โมเดลที่แย่กว่าทุกที่ ผลลัพธ์ที่คุณอ่าน — บทในหนังสือ, รายงานการตรวจสอบ, โพสต์นี้ — ไม่ใช่คุณภาพเจ็ดเซนต์ กลเม็ดคือไม่ใช่ "โมเดลราคาถูก" กลเม็ดคือ การจ่ายราคาชั้นนำเฉพาะเมื่อคุณภาพชั้นนำเปลี่ยนผลลัพธ์จริงๆ

เช่าโมเดล, เป็นเจ้าของทุกอย่างอื่น

การประหยัดไม่ใช่การแฮ็ก มันเป็นผลจากการตัดสินใจเกี่ยวกับการเป็นเจ้าของสามอย่างที่ทำในช่วงแรก ตามหลักการ:

1. เป็นเจ้าของข้อมูลไฟล์ความจำทุกไฟล์, โน้ตประจำวัน, การ์ดเอนทิตี, บันทึกการสนทนา, และบันทึกการตัดสินใจทั้งหมดอยู่ในไฟล์บนเครื่องที่ฉันควบคุม ในรูปแบบที่ฉันสามารถอ่านได้ด้วย cat. ไม่มีสิ่งใดที่สำคัญนั่งอยู่ในฐานข้อมูลของผู้ขายที่ค่าธรรมเนียมการเรียกคืนเพิ่มขึ้นตลอดไป ผู้ขายถือหนัก; ฉันถือบริบท บริบทคือสินทรัพย์ที่มีค่าเพิ่มขึ้น

2. เป็นเจ้าของตรรกะการทำงาน.คำสั่งที่ตัวแทนใช้, เกณฑ์คุณภาพ, ท่อส่งข้อมูล — โค้ดท้องถิ่น, ควบคุมเวอร์ชัน, ตรวจสอบได้, ปรับปรุงได้ เมื่อการทำงานสร้างคุณค่า คุณค่าจะไปอยู่ในที่เก็บของฉัน ไม่ใช่ในห้องสมุดเทมเพลตของคนอื่น ผู้ขายสามารถเช่าความฉลาดจากฉันได้ แต่พวกเขาไม่สามารถเช่าการตัดสินใจของฉันที่ถูกเข้ารหัสได้.

3. เป็นเจ้าของการเลือกโมเดล.นี่คือสิ่งที่ทำให้เกิดความเสียหายทางเศรษฐกิจ ระหว่างฉันกับโมเดลแต่ละตัวมีเครื่องยนต์การจัดเส้นทางของฉัน — Mercury Flux ทุกการเรียกจะถูกจัดประเภทตามงานและส่งไปยังโมเดลที่ชนะในด้านราคา-คุณภาพสำหรับประเภทนั้น โดยมีสายสำรองเมื่อผู้ให้บริการไม่สามารถทำงานได้.

หลักการคือ 操盤人 ไม่ใช่ผู้บริโภค: ผู้ดำเนินการไม่ซื้อแบรนด์ ผู้ดำเนินการส่งมอบความสามารถ.

คูน้ำการจัดเส้นทาง

ทุกคนมองบิล AI เป็นค่าใช้จ่าย = โทเค็น × ราคา แล้วทำการปรับแต่งโทเค็น — คำสั่งที่สั้นลง, การเรียกที่น้อยลง, AI ที่น้อยลง ดี แต่การทำเช่นนั้นคือการปรับแต่งการเผาผลาญของคุณให้ต่ำลง การจำกัดการรับรู้เพื่อลดค่าใช้จ่ายเป็นกลยุทธ์ความยากจน.

อีกคำหนึ่งคือราคา — และราคาไม่ใช่ค่าคงที่ มันเป็นฟังก์ชันของการจัดเส้นทาง.

ต้นทุนของการรับรู้ = โทเค็น × ราคาผสม, โดยที่ ราคาผสม = Σ (ส่วนแบ่งของโทเค็นตามประเภทงาน × ราคาที่ดีที่สุดสำหรับประเภทนั้น).

ในสแต็กของฉัน โทเค็นส่วนใหญ่ — การดึงข้อมูล, การจำแนกประเภท, การสรุป, การแปล, การสร้างร่างแรก — จะถูกส่งไปยังโมเดลที่มีต้นทุนเพียงเศษเสี้ยวของอัตราแนวหน้า โมเดลแนวหน้าจัดการกับระยะสุดท้าย: การตัดตอนสุดท้ายของบท, การตัดสินใจด้านสถาปัตยกรรม, การตัดสินใจที่เผชิญหน้ากับลูกค้า ปัญญาที่มีค่าใช้จ่ายสูงคือหน่วยพิเศษที่ถูกส่งไปยังจุดที่มีอำนาจสูงสุด — ไม่ใช่กองทัพประจำที่ยึดครองทุกถนน ไม่มีนายพลคนไหนส่งหน่วยพิเศษไปลาดตระเวนทุกบล็อก ไม่มีผู้ปฏิบัติงานคนไหนควรส่งโมเดลแนวหน้าไปสรุปหน้าเว็บ.

ร่องน้ำการจัดเส้นทาง: ใครก็ตามที่ควบคุมการเลือกโมเดลจะควบคุมต้นทุนของผลลัพธ์ที่เหมือนกัน คุณภาพของโมเดลคือร่องน้ำของผู้ขาย การเลือกคือของคุณ.

สังเกตสิ่งที่เกิดขึ้นเมื่อราคาลดลง — และมันจะลดลง ช่องว่างระหว่างแนวหน้าและระดับกลางจะไม่ปิด; มันคือการกระจาย การจัดเส้นทางจับการกระจายในทุกระบอบราคา แนวหน้าของวันนี้กลายเป็นระดับกลางของวันพรุ่งนี้ และตัวจัดเส้นทางจะทำการจัดทำดัชนีใหม่โดยอัตโนมัติ ร่องน้ำจะไม่สึกกร่อนด้วยการลดราคา มันจะทำการจัดทำดัชนีใหม่.

ทำไมฝูงชนจึงเปลี่ยนทุกอย่าง

ผลกระทบอันดับสองที่ไม่มีใครคำนวณ: โครงสร้างต้นทุนกำหนดโครงสร้างองค์กร.

ในราคาขายปลีก สภาที่มีตัวแทน 15 คน — ผู้ร่างหนึ่งคน นักวิจารณ์สี่คน ผู้ตรวจสอบข้อเท็จจริง หน่วยงานควบคุมสไตล์ ที่ตรวจสอบพร้อมกัน — เป็นการสาธิตการพูดคุยในที่ประชุม ไม่มีใครจัดสภาสำหรับการส่งมอบทุกชิ้นในราคา 10 ดอลลาร์ต่อหนึ่งล้านโทเคน ในราคาเจ็ดเซนต์แบบผสม สภานั้นเป็นรายการในงบประมาณ ฝูงของฉันใช้ชีวิตอยู่บน Mac Studio มันทำงานเงียบ ๆ มันไม่เรียกเก็บเงินจากฉัน

การรับรู้ที่ราคาถูกทำให้การแบ่งงานมีราคาไม่แพง คุณหยุดสร้าง "แชทบอท" และเริ่มสร้างแผนผังองค์กรของตัวแทน — ผู้ร่าง ผู้ตรวจสอบ ผู้ตรวจสอบบัญชี หอสมุด — โดยมีการจัดเส้นทางเป็นแผนกทรัพยากรบุคคล นั่นคือกลไกที่แท้จริงเบื้องหลังปริมาณผลผลิต ไม่ใช่การกระตุ้นอัจฉริยะ การจัดสรรบุคลากร

เวอร์ชันองค์กร

หากคุณเป็น CAIO หรือ CTO ให้ทำการตรวจสอบเดียวกันกับองค์กรของคุณ ทีมของคุณกำลังเผาโทเคนที่ไหนสักแห่ง; คำถามเดียวคือมันไหลผ่านชั้นการจัดเส้นทางของคุณหรือผ่านปุ่มใดก็ตามที่ใกล้ที่สุด

สองหมายเหตุจากชีวิตการให้คำปรึกษาของฉัน:

  • การทำงานที่มีตัวแทนตายที่ราคาขายปลีกการทำงานที่จริง ๆ แล้วเคลื่อนที่ตัวเลข — การตรวจสอบ GEO อย่างต่อเนื่องข้าม ChatGPT, Perplexity, และ Gemini; การตรวจสอบการอ้างอิง; การติดตามเอนทิตี; การคัดเลือกผู้นำที่เปิดตลอดเวลาในช่องว่างการส่งผ่านจาก AI สู่มนุษย์ — เป็นเตาหลอมโทเคนโดยการออกแบบ ที่ราคาขายปลีก พวกมันเกิดมาพร้อมกับความตาย และทุกคนสรุปว่า "AI มีราคาแพง" เมื่อถูกจัดเส้นทาง พวกมันคือ cron jobs

  • การล็อคผู้ขายคือการเช่ากระบวนการทำงานของคุณกลับทุกปีที่ไม่มีเลเยอร์การจัดการเส้นทาง การอัปเกรดจะต้องจ่ายมากขึ้น แต่เคลื่อนที่น้อยลง SaaS สอนบทเรียนนี้ให้กับองค์กรแล้วครั้งหนึ่ง AI กำลังสอนมันอีกครั้ง โดยมีดอกเบี้ยทบต้น

หยุดซื้อข้อมูลเชิงลึกแบบค้าปลีก เริ่มกำหนดตารางเวลาเหมือนการประมวลผล — ค้นหาราคาแต่ละงาน สามารถสลับได้ตามการเรียกใช้ เป็นเจ้าของที่เลเยอร์ที่สำคัญ

สิ่งที่คุณทำในวันจันทร์

  1. วัดอัตราการเผาผลาญของคุณดึงจำนวนโทเค็นจริงจากเครื่องมือทั้งหมดเป็นเวลา 30 วัน คุณไม่สามารถจัดการกับตัวเลขที่คุณไม่เคยเห็นได้ ทีมส่วนใหญ่ผิดพลาดไป 10 เท่าในทิศทางใดทิศทางหนึ่ง

  2. ย้ายสถานะของคุณไปยังไฟล์ที่คุณเป็นเจ้าของหน่วยความจำ การตัดสินใจ ลอจิกการทำงาน — ออกจากซิลอสของผู้ขาย เข้าสู่ที่เก็บของคุณ ทำงานในวันหยุดสุดสัปดาห์ มันจะทบต้นตลอดไป

  3. ใส่เราเตอร์ระหว่างคุณกับโมเดลทุกตัวมันไม่จำเป็นต้องเป็น Flux — สร้างเวอร์ชันที่บางลง การจำแนกประเภทงาน การแมพโมเดล โซ่สำรอง การบันทึกค่าใช้จ่าย แม้แต่เราเตอร์ที่หยาบก็ลดค่าใช้จ่ายได้ 5–10 เท่าในเดือนแรก

  4. นำส่วนต่างไปลงทุนใหม่การประหยัดไม่ใช่จุดประสงค์ จุดประสงค์คือสิ่งที่การเผาผลาญ $20K ที่มีค่าใช้จ่าย $1.2K ซื้อได้: สภา ฝูงชน ปริมาณ ความเร็ว ช่องว่างระหว่างคุณและคนอื่น ๆ จะไม่ใช่พรสวรรค์อีกต่อไป แต่จะกลายเป็นการประมวลผล

กลยุทธ์ AI ที่แพงที่สุดในปี 2026 ไม่ใช่การเลือกโมเดลที่ผิด แต่คือการจ่ายราคาชายแดนสำหรับทุกโทเค็นเพราะคุณไม่เคยสร้างเลเยอร์ที่เลือก

เช่ารูปแบบ โมเดลการจัดเส้นทางเป็นของคุณ รักษาส่วนต่าง — จากนั้นใช้ส่วนต่างในการเพิ่มการรับรู้

โซลูชันเทคโนโลยี Mercury: เร่งความเป็นดิจิทัล

Originally published on MTS Blog & Research