成本優化
KV Cache:用空間換時間
每輪對話,模型都要對所有歷史 Token 做 Attention 計算。KV Cache 把已算過的 K/V 矩陣緩存下來,下輪只計算新增 Token。
原理
類比:
無緩存 = 每次上課都從頭默寫所有課本
有緩存 = 課本拍好存檔,今天只看今天的新筆記
無緩存 = 每次上課都從頭默寫所有課本
有緩存 = 課本拍好存檔,今天只看今天的新筆記
無 KV Cache
每輪:System Prompt + 全部歷史 全量重算
第 N 輪成本 = 第 1 到 N 輪所有 Token 之和
第 N 輪成本 = 第 1 到 N 輪所有 Token 之和
有 KV Cache
歷史 Token 的 K/V 已緩存,只算本輪新 Token
第 N 輪成本 ≈ 本輪新增那幾個 Token
第 N 輪成本 ≈ 本輪新增那幾個 Token
逐輪對比演示
模式:
System Prompt
重複計算
緩存命中
新增計算
點擊「下一輪」開始演示 · 每格 = 固定 token 量,SYS 始終不變
0
已演示輪次
0T
無緩存累計算量
0T
有緩存累計算量
—
節省比例
結論:對話輪次越多,KV Cache 節省越大。保持 System Prompt 不變是最簡單、最有效的優化手段。
關鍵提醒
System Prompt 越長,KV Cache 越值錢。
5000 Token 的系統提示詞,1000 輪對話後,KV Cache 節省約 80% 總成本。保持 System Prompt 不變 = 緩存命中。
5000 Token 的系統提示詞,1000 輪對話後,KV Cache 節省約 80% 總成本。保持 System Prompt 不變 = 緩存命中。
⚠️ 隱藏大坑:分佈式推理伺服器
雲端 LLM 通常跑在多台推理伺服器上。你的請求可能每次被路由到不同節點,那台節點沒有你的前文緩存,隱式緩存永遠 MISS。
雲端 LLM 通常跑在多台推理伺服器上。你的請求可能每次被路由到不同節點,那台節點沒有你的前文緩存,隱式緩存永遠 MISS。
下一課預告:顯式緩存:一行程式碼保證命中,含 Claude / Qwen / OpenAI 程式碼示例與命中率模擬對比。