Token 降本增效 · 3 / 13
報價表速覽與三大梯隊
把常用模型的定價攤開在一張表上,你會看到三個清晰的梯隊。但僅僅知道哪個貴、哪個便宜是遠遠不夠的——真正的成本刺客,藏在那些價格跳變的邊界線裡。
T0 旗艦T1 主力T2 走量快取價
報價表全景
下面是作者團隊當時主要使用的模型定價(已折算折扣後,單位:元 / 百萬 Token)。三列分別是非快取輸入、快取輸入、輸出——注意快取價普遍只有標準價的兩成甚至更低,這個巨大的差價就是第 11 節 KV Cache 的伏筆。
| 模型 | 檔位 | 輸入(非快取) | 輸入(快取) | 輸出 |
|---|---|---|---|---|
| GLM-4.6 (355B A32) | Input ≤32k · Output ≤200 | 1 | 0.2 | 4 |
| Input ≤32k · Output >200 | 1.5 | 0.3 | 7 | |
| Input 32k–200k | 2 | 0.4 | 8 | |
| Qwen3-Max | Input 0–32k | 1.6 | 0.32 | 6.4 |
| Input 32k–128k | 3.2 | 0.64 | 12.8 | |
| Input 128k–252k | 4.8 | 0.96 | 19.2 | |
| Qwen-Plus (235B A30) | 0–128k · 非思考 | 0.4 | 0.08 | 1 |
| 0–128k · 思考模式 | 0.4 | 0.08 | 4 | |
| Qwen-Flash | Input 0–128k | 0.075 | 0.015 | 0.75 |
| Input 128k–256k | 0.3 | 0.06 | 3 | |
| GLM-4.5V / 4.5-Air | Input 0–32k | 1 | 0 | 3 |
| Input 32k–64k | 2 | 0 | 6 |
紅色數字是「跳檔後」的價格。同一個模型內部,價格能差 2–3 倍——這些邊界線是第 4、5、6 節的主角。
三大梯隊
T0 · 旗艦
Qwen3-Max、GLM-4.6(長輸出檔)
輸出昂貴,能力天花板。留給複雜推理、程式碼生成、多模型仲裁這類「答錯了損失更大」的任務。
T1 · 主力
Qwen-Plus、GLM-4.5-Air
性價比均衡。日常對話、RAG 問答、摘要歸納的主力,大部分請求應該落在這一層。
T2 · 走量
Qwen-Flash
近乎免費(快取輸入 0.015 元/M)。資料清洗、意圖分類、高頻監控隨便跑,也是給大模型「打下手」的最佳人選。
懂技術的人看模型參數,懂經營的人看定價階梯。做 AI 工程,兩個都要懂。
互動演練 · 這個任務該用哪個梯隊
五個真實業務場景,選一個你認為最合適的梯隊。原則:能用便宜的絕不用貴的,但答錯代價大的別省。
本節要點
✓
先分梯隊再選型:T0 管難題、T1 管日常、T2 管走量。大部分成本事故是「用 T0 幹 T2 的活」。
✓
快取價是標準價的 1/5 甚至更低。能不能吃到這個折扣,取決於你的架構設計(見第 11 節)。
✓
同一模型內部價格能差 2–3 倍。跳檔邊界線(輸出 200、輸入 32k)比模型選型本身更值得盯。
內容來源:整理自作者團隊內部分享《AI Token 降本增效策略分享》。表中為作者當時的折後協議價,各家牌價與折扣隨時在變,選型前請核對 DeepSeek 定價、阿里雲百鍊與智譜開放平臺的即時報價。