信任校準:最好的使用者是半信半疑的
前四課都在給體驗掙分,這一課踩一腳剎車:信任這個指標,目標值從來就沒定在滿分。AI 會出錯是改不掉的物理現實,所以健康的使用者長這樣:該信的場景放心用,該查的場景留個心眼。往哪邊偏都要交學費。這一課先看兩筆真實學費,再給你三件能親手撥弄的校準工具。
⚠ 過度信任:把幻覺當真相用
2023 年紐約的 Mata v. Avianca 案:執業律師用 ChatGPT 檢索判例,把 6 個查無此案的編造判例原樣抄進法庭文書,法官逐個核實後律師吃了罰單、上了全球新聞。類似的事故此後接連發生:AI 的輸出流暢、自信、格式規範,每一個表面特徵都在誘導「它很可靠」的判斷,而這些特徵和內容真偽互不相干。
⚠ 信任不足:AI 變成昂貴的擺設
另一頭的翻車安靜得多:企業買了 AI 工具,員工試了一次撞上錯誤,從此每條輸出都逐句複核,複核成本超過自己寫,最後乾脆不用了。採購的錢照付,效率一分沒漲。信任不足不上新聞,只出現在「AI 工具活躍率 8%」的內部檢討裡。
判斷口訣先給你:盯著「風險 × 可核驗性」看,別盯著「AI 強大與否」看。同樣是全盤採納,用在週報上是校準,用在法庭上是過度。六個場景,你來當校準師。
第一件校準工具:來源引用,要能點開的那種。想核實的使用者一鍵到原文,壓住過度信任;懶得核實的使用者看到「有出處」也建立了合理的底氣,補上信任不足。一舉兩得的前提是引用真實可點:裝飾性的假引用被戳穿一次,比沒有引用糟糕十倍。下面這條 AI 回答掛了三個角標,逐個點開,和原文比對。
第二件工具:置信度。第一篇章講過,模型不知道自己不知道,讓它自報把握靠不住。但產品層有誠實的代理訊號:檢索命中了幾篇文件、相關度多高、多個來源是否一致、知識截止日期蓋住問題了沒有。下面是同一條用藥回答,三組開關對應三個產品決策,撥一撥,看右邊的回答和使用者的信任校準度怎麼變。
第三件工具管的就一件事:那行「AI 可能出錯,請核實重要資訊」的小字,到底有沒有人在看。心理學的答案叫橫幅盲視(banner blindness):Benway & Lane(1998)用眼動實驗發現,恆定出現在固定位置的元素,會被大腦當成背景紋理直接濾掉。下面連點五條回答,親眼看這行小字怎麼消失。
✅ 這一課想和你分享的
- 把信任目標定在校準:全信的出事故,不信的白花錢,產品要把使用者往對角線上拉
- 引用做成能點開的:把「信我」換成「你可以驗」,同時提防裝飾性假引用反噬
- 置信度用代理訊號說:檢索命中數、相關度、來源一致性,比模型自報的把握誠實
- 警告有條件地出現:恆定免責三天就隱形,低置信時帶原因彈出才會被讀