工程指標及格了,用戶為什麼還罵慢?
前面的章節教你把延遲壓下來、把成本摳下來、把幻覺率降下來。這一章換一塊秒錶:用戶腦子裏那塊。它和伺服器的秒錶走時不同,打分、續費、卸載都跟着它走。第一課先跑個實驗,再把這塊表的走時怪癖逐個拆開。
下面四個面板背後是同一次請求:同一個問題,同樣 5 秒出完整答案。區別只有一個:這 5 秒裏給用戶看什麼。點按鈕讓四個同時開跑,留意自己的體感。
方案 A · 空白凍結
什麼都不給方案 B · 轉圈等待
告訴你它活着方案 C · 流式輸出
先給一部分方案 D · 步驟外顯
讓你看它在幹嘛剛才多數人最難受的是空白面板。空白除了難受,還有個隱藏代價:它會放大你對時長的估計。感知時間研究把「一邊等一邊關注時間」的計時叫前瞻計時:注意力越多押在時間本身上,主觀時長越膨脹,緊張情緒再把它拉長一截。Zakay 與 Block 的注意閘門模型是這條規律最常被引用的解釋。結論先放這,你自己測一遍更有説服力。
點「開始」後,左邊面板會進入一段沒有進度、沒有轉圈、沒有文案的等待。憑體感,覺得過了 8 秒就按停。儘量別在心裏數拍子,那是作弊。
這就是空白凍結在數據後台看不見的那筆賬:伺服器記 5 秒,用戶記 6 秒半。無回饋等待的高估誤差,實驗裏兩三成很常見。你產品的「體感延遲」比監控面板上的 P99 更糟,且差距由介面決定。
秒錶既然開在用戶心裏,工程預算就要花在他計時的區間。下面這台聊天機器人的總時長鎖死 5 秒,你只能動一個參數:首字時間 TTFT(從發送到看見第一個字)。拖滑塊,點「重放」,右邊按所選 TTFT 重演一次打字流,體感分跟着變。
把前面的體感整理成三條可複用的規律。每一檔都有個 mini 演示,三檔都切一遍。
用戶的開表點在按下發送,收表點在看見第一個字。首字之後他的注意力交給了閲讀,邊讀邊到的內容幾乎沒被記進等待的帳本。工程團隊盯總時長的 P99,用戶只記首字,兩塊表對不上,差評就從縫裏鑽出來。實驗三裏 TTFT 那根槓桿的長度,就是這條怪癖給的。
同一次等待:5 秒後答案落地。切換兩種結局,看回憶裏的時長怎麼變。
物理上都是那一次 5 秒。追記式的時間靠事後重建,情緒越糟,重建出來的等待越長。所以延遲和幻覺在差評裏常常擠進同一句話:又慢又蠢。答案質素的問題會連坐到速度頭上;反過來,好答案也能替你把慢遮掉一截。第 4 課峯終定律會把這條用在結尾設計上。
AI 產品有三個天生毛病:慢(推理要時間)、會錯(幻覺壓不淨)、不透明(用戶看不見它在幹嘛)。工程手段短期內只能緩解這三樣,但用戶的評價由感知產生,感知可以設計。你在前面章節學的流式輸出、模型路由、語義緩存、Agent 進度彙報,每一個都還有一重心理學開關的身份,這一章教你什麼時候為了心理效果去撥它。
慢、會錯、不透明,每個毛病後面都排着幾課;再往後是關係和錢。點卡片翻面,看每一課要解決用戶的哪句抱怨。
✅ 這一課想和你分享的
- 盯兩塊秒錶:伺服器計物理時長,用戶從發送計到首字,考核指標裏給 TTFT 單開一行
- 別讓介面空白:無回饋等待會被放大兩三成,超過 1 秒就給回饋,超過 3 秒就給進展
- 預算先壓首字:接流式、先出提綱、分段返回,排期都在升級機器前面
- 錯誤當場兜住:時間記憶跟着情緒走,答非所問會把慢一起寫進差評