Token 降本增效 · 4 / 13

GLM 的短輸出博弈:200 Token 斷崖

觀察 GLM-4.6 的定價結構,會發現一個神奇的設計:它不按輸入長度分檔,而是按輸出長度分檔,分界線在 200 個 Token。輸出 199 和輸出 201,適用完全不同的價格。

輸出分檔回溯計價任務拆分邊界波動
現象:不僅輸出漲價,輸入也回溯漲價
指標Output ≤ 200Output > 200變化幅度
輸出單價4 元/M7 元/M+75%
輸入單價1 元/M1.5 元/M+50%

最容易被忽略的一點:只要輸出超過 200 Token,前面傳入的幾千個 Token 的輸入也要按更高的價格重新結算。輸出多寫兩個字,整單回溯漲價。

智譜為什麼這麼定價

這反映了推理算力的邊際成本曲線。短輸出(<200 Token)非常輕量:Decode 階段壓力小、KV Cache 佔用有限,可能幾十毫秒就完成了。但輸出一旦變長,每多生成一個 Token,KV Cache 就多佔一份顯存,Attention 就多算一輪——成本非線性增長。

廠商透過價格槓桿傳遞訊號:鼓勵短平快的任務,懲罰冗長的生成。
互動演示 · 在斷崖邊反覆橫跳的帳單

場景:從使用者評論中提取結構化 JSON(sentiment / aspects / pain_points / suggestions)。Prompt 已經很規範,但你無法預知每條評論會提取出多少內容——簡單評論 150 Token,使用者多吐槽兩個點就變 230。拖動滑塊感受這個「結構性衝突」。

150 Tokens
100← 200 斷崖 →320
輸入單價(3k 上下文)
1 元/M
輸出單價
4 元/M
單次呼叫成本
業務波動性與定價斷崖的結構性衝突
業務輸出天然在 150–230 之間波動,而斷崖恰好畫在 200:這是業務波動性與定價斷崖的結構性衝突。(圖:作者分享原稿)
四種應對策略
策略做法代價
任務拆分把提取任務拆成多次呼叫,每次只提取 1–2 個欄位呼叫次數增加,延遲上升
欄位分級核心欄位即時提取,次要欄位非同步補充或後處理架構複雜度增加
接受波動 + 監控允許偶發跳檔,但建立監控看整體分佈成本可控但非最優
模型降級價格敏感的高頻任務切到 Qwen-Flash 等走量模型可能犧牲少量精度

核心判斷點是:這個任務的輸出,天然落在哪個區間?如果大部分請求在 100–150、偶發超 200,可以接受。如果分佈中位數就在 180–220,說明任務天然踩在斷崖上——必須重新設計任務粒度,或者乾脆換一個不按輸出分檔的模型。類似的情況也出現在程式碼生成場景:一個 20 行的函式就能輕鬆佔用 100+ Token,稍複雜的修改建議就會突破 200。

本節要點

GLM-4.6 按輸出長度分檔,200 是斷崖:輸出 +75%,輸入回溯 +50%。

定價結構反映算力成本:長輸出的 KV Cache 與 Attention 開銷非線性增長,廠商在用價格趕你走短平快路線。

先看任務的輸出分佈,再選策略。中位數踩在斷崖上的任務,要麼重切粒度,要麼換計費模式不同的模型。

內容來源:整理自作者團隊內部分享《AI Token 降本增效策略分享》「GLM-4.6 的短輸出博弈」。價格為作者當時折後價,請以智譜開放平臺即時報價為準。