Token 降本增效 · 3 / 13

報價表速覽與三大梯隊

把常用模型的定價攤開在一張表上,你會看到三個清晰的梯隊。但僅僅知道哪個貴、哪個便宜是遠遠不夠的——真正的成本刺客,藏在那些價格跳變的邊界線裡。

T0 旗艦T1 主力T2 走量快取價
報價表全景

下面是作者團隊當時主要使用的模型定價(已折算折扣後,單位:元 / 百萬 Token)。三列分別是非快取輸入、快取輸入、輸出——注意快取價普遍只有標準價的兩成甚至更低,這個巨大的差價就是第 11 節 KV Cache 的伏筆。

模型檔位輸入(非快取)輸入(快取)輸出
GLM-4.6
(355B A32)
Input ≤32k · Output ≤20010.24
Input ≤32k · Output >2001.50.37
Input 32k–200k20.48
Qwen3-MaxInput 0–32k1.60.326.4
Input 32k–128k3.20.6412.8
Input 128k–252k4.80.9619.2
Qwen-Plus
(235B A30)
0–128k · 非思考0.40.081
0–128k · 思考模式0.40.084
Qwen-FlashInput 0–128k0.0750.0150.75
Input 128k–256k0.30.063
GLM-4.5V / 4.5-AirInput 0–32k103
Input 32k–64k206

紅色數字是「跳檔後」的價格。同一個模型內部,價格能差 2–3 倍——這些邊界線是第 4、5、6 節的主角。

三大梯隊
T0 · 旗艦

Qwen3-Max、GLM-4.6(長輸出檔)

輸出昂貴,能力天花板。留給複雜推理、程式碼生成、多模型仲裁這類「答錯了損失更大」的任務。

T1 · 主力

Qwen-Plus、GLM-4.5-Air

性價比均衡。日常對話、RAG 問答、摘要歸納的主力,大部分請求應該落在這一層。

T2 · 走量

Qwen-Flash

近乎免費(快取輸入 0.015 元/M)。資料清洗、意圖分類、高頻監控隨便跑,也是給大模型「打下手」的最佳人選。

懂技術的人看模型參數,懂經營的人看定價階梯。做 AI 工程,兩個都要懂。
互動演練 · 這個任務該用哪個梯隊

五個真實業務場景,選一個你認為最合適的梯隊。原則:能用便宜的絕不用貴的,但答錯代價大的別省。

本節要點

先分梯隊再選型:T0 管難題、T1 管日常、T2 管走量。大部分成本事故是「用 T0 幹 T2 的活」。

快取價是標準價的 1/5 甚至更低。能不能吃到這個折扣,取決於你的架構設計(見第 11 節)。

同一模型內部價格能差 2–3 倍。跳檔邊界線(輸出 200、輸入 32k)比模型選型本身更值得盯。

內容來源:整理自作者團隊內部分享《AI Token 降本增效策略分享》。表中為作者當時的折後協議價,各家牌價與折扣隨時在變,選型前請核對 DeepSeek 定價、阿里雲百鍊與智譜開放平臺的即時報價。