輸出層:管住模型的嘴
實戰四層的最後一層。輸出 Token 比輸入貴好幾倍(回看第 3 節報價表),而且直接決定接口返回速度。管住模型的嘴,有三類合適的操作:指令層、程式碼層、工程層。
很多人知道要求「請簡潔回答」,但這是有問題的——「簡潔」對模型來説太抽象了,它不知道你要多簡潔。有效的寫法是把「別幹什麼」列清楚:
實測下來,Agentic 場景能砍掉 30% 的廢話。説白了就是告訴它:別整那些有的沒的,直接上結果。
這是文字潤色場景最大的成本坑:用戶説「幫我將呢句改到通順啲」,模型把 2,000 字的文章從頭輸出一遍。就算約束到只輸出那個段落,Token 也在嘩嘩地燒。
換個思路:讓模型只輸出修改的部分——用 Diff 格式標出「原文→改後」,或者直接返回正則表達式,程式拿到後再做替換。只動那兩三個詞,1 秒搞定:成本差幾十倍,體驗還更好——速度快,用戶還能直接看到改了哪裏,不用自己對比。
在 Prompt 裏寫「請只輸出 3 項」,模型聽不聽是玄學——可能輸出 3 項,也可能 5 項再加一段總結。但停止序列(stop sequence)是物理截斷,和模型「聽不聽話」無關:API 檢測到指定字串就直接掐斷生成流,被掐掉的部分不計費、不進歷史上下文。
簡單,粗暴,但好用。有效控制輸出,就是控制成本和用戶體驗。
負向約束要具體:「不要寒暄、不要總結、不要客套」比「請簡潔」有效得多,Agentic 場景砍 30% 廢話。
潤色輸出 Diff 或替換指令,別讓模型重寫整段:成本差幾十倍,用戶體驗反而更好。
停止序列是物理開關:列表掐「4.」、單行答案掐換行、JSON 掐「}」、防自問自答掐「用戶:」。
內容來源:整理自作者團隊內部分享《AI Token 降本增效策略分享》實戰篇「04|輸出」。停止序列參數見各家 API 文檔(OpenAI 相容接口為 stop 字段,最多可設 4 個序列)。