Token 降本增效 · 13 / 13 · 收官
算力時代的極簡主義
做完這幾層優化,你基本上已經跑贏 90% 的粗放型 AI 產品了。收官這一節,把整個專題串成一張清單,再聊聊「省錢」背後的那件更重要的事。
全景回顧資訊密度延伸閱讀
省 Token 的本質:提高資訊密度
回顧一下,我們聊了 BPE、報價梯隊、跳檔陷阱、Agent 帳單、YAML 格式、壓縮演算法、KV Cache、停止序列……看起來都是在省錢、砍成本。但往深了想:省 Token 這件事,本質上是在提高資訊密度。過濾掉格式噪音、文件廢話、重複計算之後,餵給模型的都是精華。密度越高,注意力越不容易分散,幻覺也越少。
高訊雜比 = 高智慧
還有個副產品:快。Token 少了,首字出得快,端到端延遲短——C 端產品裡,這直接決定使用者願不願意繼續用。下次審工程化方案時,用一個標準卡一卡:這裡的每一個 Token,都在為最終結果貢獻價值嗎?如果不是,考慮把它幹掉。把算力留給真正的思考——這才是 AI 時代精益計算的美學。
全景清單:13 節內容一張表
跳檔陷阱
GLM 200 斷崖:輸出多 2 個 Token,連輸入都回溯漲價。Qwen 32k 紅線:越線全量結算,預算感知截斷。圖片稅:32 畫素對齊 + 解析度詛咒,按任務分級。
| 三條通用紅線 | 閾值 | 動作 |
|---|---|---|
| 單次輸入 | < 32k Tokens | 預算感知截斷(RAG、多圖、多輪歷史通用) |
| Agent 輪次 | < 10 輪 | 熔斷機制兜底 |
| I/O Ratio | 監控 > 50:1 | Agent 在空轉,先查流程 |
延伸閱讀 · 十八個主題
原分享附帶了一份按主題分類的閱讀材料,從上下文工程、推理框架核心到經濟學模型,覆蓋本專題所有關鍵論斷的原始出處。按需展開。
一、閉源生態的「上下文工程」與顯存優化
拆解 Manus 如何用 "Mask, Don't Remove" 策略把 KV Cache 命中率從 20% 提到 95%——理解閉源模型為何在 Agent 場景成本更低的核心文獻。
生產環境中 KV Cache 對成本的決定性影響,以及 vLLM 分散式部署下的快取失效問題與解法。
二、推理框架核心:vLLM vs SGLang
深度解析 SGLang 的 RadixAttention 如何用樹狀結構管理顯存,以及多輪對話場景為何比 vLLM 更有優勢。
針對多輪對話和共享前綴場景的基準測試,量化兩種框架在吞吐量和顯存利用率上的差異。
三、硬體底層:華為昇騰 910B vs NVIDIA
極詳盡的 GPU 規格資料庫:H20、H100 與昇騰 910B 的顯存頻寬、互聯速度對比,分析「顯存牆」最權威的資料來源之一。
910B 相比 910A 的架構權衡,解釋理論算力與實際效能的差距。
MLA 架構模型在 910B 上無法開圖模式的具體原因,運算元適配的軟肋。
四、理論原理:注意力匯聚
為什麼前幾個 Token 會吸附大量注意力權重——理解 Prefix Caching 為何會固化生成路徑、降低多樣性的理論基礎。
五、VLM 視覺經濟學與解析度研究
「解析度詛咒」和視覺 Token 冗餘高達 85% 的核心來源:動態解析度選擇如何降本不降精度。
How LLMs See Images and What It Really Costs You(Medium)
GPT-4o 的 Patching 機制(512×512 圖塊與 85/170 Token 計費),理解 OpenAI 階梯式成本結構。
Google Gemini API Pricing & Tokenization(Google Cloud 官方文件)
Gemini 的 258 Token 固定費率與 768px 大圖分塊機制,對比 GPT-4o 成本效益的關鍵依據。
六、Agent 成本陷阱與 SWE-bench 實證
史丹佛團隊的 SWE-bench 回顧:「單題成本 $4.60」「生成編輯階段佔 60% 成本」的資料出處。
揭示 Agent 任務「輸入主導」現象(輸入 Token 佔 95%)與「逆縮放」悖論。
七、Prompt 壓縮、RAG 與幻覺
微軟的 Prompt 壓縮經典研究:壓縮率(5x vs 20x)與精度下降的量化基準,為何過度壓縮會丟邏輯。
RAG 系統的成本權衡:Re-Ranking 成本可高達向量檢索 5000 倍的經濟學分析。
長上下文和對抗性輸入下模型幻覺率的基準測試。
八、核心理論與架構:模型路由
「模型路由」領域最基礎的研究之一:用偏好資料訓練路由模型,降本的同時保持高效能。
「任務分解」讓端側小模型與雲端大模型協同工作,端雲混合架構必讀。
用困惑度作為動態閾值,自動判斷何時進入「深思」模式——路由觸發機制的解法。
九、企業級實戰案例
Notion 如何按任務型別(寫作 vs 問答)把請求路由到不同後端模型——「產品架構即路由」。
AI 客服處理 2/3 使用者對話的商業資料:平均處理時長 11 分鐘降到 2 分鐘。
程式碼補全這個延遲最敏感的場景,如何結合本地上下文和雲端模型做毫秒級路由。
十、端側與分類器技術
端側 3B 模型的設計權衡、4k 上下文限制、LoRA adapter 微調。
1B 以下參數模型的極限與「Deep and Thin」架構優化。
為什麼有時最簡單的正則匹配和關鍵詞檢測反而是最高效的路由手段。
用極少樣本訓練高效意圖分類器——低成本路由器的核心元件。
十一、MCP 協議核心與架構哲學
MCP「資源-工具-提示」三大原語的官方定義與設計哲學。
Code Execution vs. Tool Calling(Anthropic 工程部落格)
「透過程式碼執行減少 98% Token 消耗」的原始研究,兩種模式的詳細對比。
十二、巨頭博弈與戰略分歧
微軟如何把 MCP「降級」為 Semantic Kernel 的一個外掛源——「擁抱與擴充」戰略。
官方文件明確目前僅支援只讀操作:微軟對 AI 代理寫操作的謹慎與責任規避。
OpenAI 如何透過定義「AI 的 README」控制智慧體的指令互動層。
十三、安全風險與企業治理
「影子智慧體」、資料洩露,以及 MCP 如何繞過傳統 DLP 系統。
拼寫錯誤攻擊(Typosquatting)和惡意 MCP 包的案例分析。
企業內網穿透風險與缺乏細粒度鑑權(Confused Deputy)的技術細節。
十四、未來架構:智慧體閘道
「閘道優先」架構解決 MCP 安全問題的最新實踐,Agent Gateway 與傳統 API Gateway 的區別。
十五、核心框架與方法論
BootstrapFewShot、MIPROv2 等優化器的工作原理:用程式設計方式優化 Prompt。
程式碼生成任務中迭代式測試與自我修正流程的開創性工作。
十六、前沿演算法
如何透過 LLM 自我評估過濾「相似但有害」的 Few-Shot 樣本。
在 LLM 管道中實施斷言來自動糾錯和回溯——Flow Engineering 穩定性的關鍵。
十七、經濟學模型與 ROI 分析
反直覺的結論:大規模場景下 RAG 可能比微調更貴的臨界點在哪裡。
根據 Token 價格和呼叫量估算 SFT 回本週期的實用工具。
十八、企業級監控與基礎設施
如何監控 TTFT、Token 效率以及識別異常查詢模式的深度指南。
如何設定相似度閾值來平衡快取命中率與準確性。
收官寄語
✓
省 Token = 提高資訊密度:噪音濾掉之後,注意力更集中、幻覺更少、速度更快。
✓
一個審方案的標準:這裡的每一個 Token,都在為最終結果貢獻價值嗎?不是,就幹掉。
✓
把算力留給真正的思考——這才是 AI 時代精益計算的美學。
內容來源:本專題整理自作者團隊內部分享《AI Token 降本增效策略分享》。想繼續深入工程側,推薦接著看進階實戰篇章的 RAG、Agent 與上下文工程章節。