Token 降本增效 · 12 / 13

輸出層:管住模型的嘴

實戰四層的最後一層。輸出 Token 比輸入貴好幾倍(回看第 3 節報價表),而且直接決定介面返回速度。管住模型的嘴,有三類合適的操作:指令層、程式碼層、工程層。

負向約束Diff 輸出停止序列
指令層 · 寫明確的負向約束

很多人知道要求「請簡潔回答」,但這是有問題的——「簡潔」對模型來說太抽象了,它不知道你要多簡潔。有效的寫法是把「別幹什麼」列清楚:

✗ 模糊約束
請簡潔回答。 →「當然,這是您要的程式碼。它實作了 一個簡單的功能……希望對您有幫助。」
✓ 明確的負向約束
不要寒暄、不要總結、不要客套, 直接輸出結果。 (英文:No yapping. No preamble, no postscript.) → def function(): return True

實測下來,Agentic 場景能砍掉 30% 的廢話。說白了就是告訴它:別整那些有的沒的,直接上結果。

Be concise 與 No yapping 的輸出對比
「Be concise」是玄學,「No preamble, no postscript」是指令:程式碼生成任務平均減少 30% 廢話消耗。(圖:作者分享原稿)
程式碼層 · 潤色用 Diff,別重寫整段

這是文字潤色場景最大的成本坑:使用者說「把這句話改通順一點」,模型把 2,000 字的文章從頭輸出一遍。就算約束到只輸出那個段落,Token 也在嘩嘩地燒。

換個思路:讓模型只輸出修改的部分——用 Diff 格式標出「原文→改後」,或者直接返回正規表示式,程式拿到後再做替換。只動那兩三個詞,1 秒搞定:成本差幾十倍,體驗還更好——速度快,使用者還能直接看到改了哪裡,不用自己對比。

- 我們的產品在市場上是很有競爭力的存在 + 我們的產品很有市場競爭力 或返回替換指令:{"find": "在市場上是很有競爭力的存在", "replace": "很有市場競爭力"}
工程層 · 停止序列做物理截斷

在 Prompt 裡寫「請只輸出 3 項」,模型聽不聽是玄學——可能輸出 3 項,也可能 5 項再加一段總結。但停止序列(stop sequence)是物理截斷,和模型「聽不聽話」無關:API 檢測到指定字串就直接掐斷生成流,被掐掉的部分不計費、不進歷史上下文。

簡單,粗暴,但好用。有效控制輸出,就是控制成本和使用者體驗。

本節要點

負向約束要具體:「不要寒暄、不要總結、不要客套」比「請簡潔」有效得多,Agentic 場景砍 30% 廢話。

潤色輸出 Diff 或替換指令,別讓模型重寫整段:成本差幾十倍,使用者體驗反而更好。

停止序列是物理開關:列表掐「4.」、單行答案掐換行、JSON 掐「}」、防自問自答掐「使用者:」。

內容來源:整理自作者團隊內部分享《AI Token 降本增效策略分享》實戰篇「04|輸出」。停止序列參數見各家 API 文件(OpenAI 相容介面為 stop 欄位,最多可設 4 個序列)。