成本優化
多輪對話為什麼越來越貴?
LLM 按輸入 Token 數計費。每一輪對話,都要把所有歷史記錄重新發給模型:歷史越長,Token 越多,費用越高。拖動滑塊模擬費用累積。
費用模擬器
每輪輸入構成
每輪輸入構成視覺化(紅色 = 當前輪,灰色 = 歷史)
逐輪費用明細
| 輪次 | 新增 Token | 本輪輸入 | 費用 |
|---|
為什麼最後幾輪這麼貴?
第 10 輪的輸入 = System Prompt + 前 9 輪的所有問答 + 本輪問題。每輪都在給模型重新背誦一遍整個對話歷史。
第 10 輪的輸入 = System Prompt + 前 9 輪的所有問答 + 本輪問題。每輪都在給模型重新背誦一遍整個對話歷史。
📈
成本隨輪次線性增長。 下一步:KV Cache 如何透過快取把重複計算費用降低 70% 以上。