長期記憶

記憶注入的成本問題

記了 1000 條記憶,每次對話全塞進 system prompt?還是按需檢索相關的幾條?全量注入簡單但貴且噪聲多,按需檢索省錢但可能漏。

拖動滑塊,感受記憶數量的影響
記憶條數 100 條
10條 100條 1,000條 10,000條
全量注入(全部塞進 prompt)
注入 tokens—
每次調用成本—
噪聲佔比—
實現複雜度 極簡
按需檢索(只注入相關的)
注入 tokens—
每次調用成本—
噪聲佔比—
實現複雜度 需要檢索系統
推薦策略
記憶注入的推薦做法
用戶發消息
新一輪對話開始
→
語義檢索
找相關記憶
(3~10條)
→
精準注入
只塞相關的
進 system prompt
→
模型回覆
有上下文的
高質素回答
核心原則:記憶的價值在於每次能拿出最相關的幾條,記了多少條並不重要。全量注入在記憶少的時候可行,但隨着記憶增長,按需檢索是唯一可擴展的方案。
記憶不是越多越好。1000 條全塞進去,AI 反而找不到重點。好的記憶系統像一個稱職的秘書:不會把整個檔案櫃搬到會議室,只會提前把今天會議需要的三份文件放在桌上。