Token 降本增效 · 1 / 13

和用戶對賭的生意

不知道你有沒有這種感受:我們總想為用戶提供更好的 AI 服務,但在商業化層面,是和用戶在對賭——產品用得越好,用戶用得越多,利潤反而越薄。見到消費帳單嘅時候,會唔會窒息。

定價即架構成本構成延遲與吞吐毛利保衞戰
先説結論
Token 成本不僅是財務帳單,更是延遲與吞吐量的直接映射。省下來的每一個 Token,既是錢,也是首字延遲,也是同一張顯卡能扛住的併發。所以這一章叫「定價即架構」:讀懂廠商的定價結構,本質上是在讀懂推理算力的成本曲綫,然後把你的應用架構設計到便宜的那一側。
互動演示 · 用得越好,虧得越快

一個訂閲制 AI 產品的簡化帳本:會員費固定,Token 成本跟着用量走。拖動「人均日調用次數」,看看當用戶真的愛上你的產品時,帳本發生了什麼。

15 次/天
8k Token
月收入
Token 成本
毛利

這就是「對賭」的含義:你的最忠誠用戶,同時是你成本表上最貴的一行。靠漲價和限流硬頂只是緩兵之計,真正的出路是讓每一次調用本身變便宜——這正是後面十二節要幹的事。

為什麼説「定價即架構」

Token 的價格牌不是財務部門隨手定的,它精確反映了推理算力的邊際成本曲綫:Prefill 與 Decode 的算力差異、KV Cache 的顯存佔用、長上下文的注意力開銷。所以每一條定價規則背後,都藏着一條給工程師的暗語:

💰它是帳單

每百萬 Token 幾塊錢,乘上調用量就是月帳單。千萬級調用下,10% 的浪費就是一個人的工資。

⚡它是延遲

輸入越長,Prefill 越久,首字延遲越高。用戶還沒看到第一個字,耐心可能已經消磨沒了。

🧠它是質素

上下文塞得越滿,有效資訊越容易被廢話淹沒。高信噪比 = 高智能,省 Token 常常順帶提升效果。

Prefill 與 Decode 兩個階段的算力差異
推理分兩個階段:Prefill(吃輸入,算力密集、可並行)和 Decode(吐輸出,逐字生成、顯存帶寬受限)。輸入價和輸出價的差距,正是這兩種資源消耗的差距。(圖:作者分享原稿)
這一章的路綫圖
①
定價即架構(第 1–3 節)

Token 是怎麼數出來的、中文為什麼天生貴、報價表怎麼讀出 T0 / T1 / T2 三個梯隊。

②
三大跳檔陷阱(第 4–6 節)

GLM 的 200 Token 輸出斷崖、Qwen 的 32k 輸入紅綫、圖片的 32 像素對齊税。價格跳變的邊界綫,就是架構設計的紅綫。

③
Agent 的帳單(第 7–8 節)

循環執行讓 Input 累積膨脹,I/O Ratio 高達 62:1;四大成本陷阱與熔斷機制。

④
四層實戰優化(第 9–12 節)

語法層砍格式税、語義層做雙重蒸餾、架構層保 KV Cache 命中、輸出層管住模型的嘴。

⑤
收官(第 13 節)

省 Token 的本質是提高資訊密度。附 18 份按主題分類的延伸閲讀。

本節要點
✓

AI 商業化是和用戶的對賭。固定收費 + 按量成本的組合下,最忠誠的用戶就是最貴的用戶。

✓

Token 成本三重身份:帳單、延遲、質素。省 Token 不是摳門,是同時優化三件事。

✓

定價即架構。價格牌反映算力成本曲綫,讀懂它,把應用設計到便宜的那一側。

內容來源:本章整理自作者的團隊內部分享《AI Token 降本增效策略分享》(2026)。文中價格均為作者當時拿到的折後價,僅用於演示計算方法,實際請以各廠商官網即時報價為準。