成本優化

多輪對話為什麼越來越貴?

LLM 按輸入 Token 數計費。每一輪對話,都要把所有歷史記錄重新發給模型:歷史越長,Token 越多,費用越高。拖動滑塊模擬費用累積。

費用模擬器
當前是第幾輪對話 第 1 輪
—
本輪輸入 Token
—
本輪費用
—
累計總費用
每輪輸入構成
每輪輸入構成視覺化(紅色 = 當前輪,灰色 = 歷史)
逐輪費用明細
輪次新增 Token本輪輸入費用
為什麼最後幾輪這麼貴?
第 10 輪的輸入 = System Prompt + 前 9 輪的所有問答 + 本輪問題。每輪都在給模型重新背誦一遍整個對話歷史。
📈 成本隨輪次線性增長。 下一步:KV Cache 如何透過快取把重複計算費用降低 70% 以上。