在对话历史长度超过模型的上下文窗口限制时,可以采用哪些上下文压缩方法来处理?请给出各类方法的机制并分析其优缺点。
考察说明
考察对LLM上下文管理策略的理解及权衡分析。
回答思路
- 【回答框架 1】核心策略包括截断、摘要、向量检索和滑动窗口。截断直接丢弃最早消息,简单但丢失重要信息;摘要生成历史要点,保留核心但可能失真且增加计算开销。
- 【回答框架 2】滑动窗口固定最近N轮,实时性高,但长对话早期信息完全丢失;向量检索将历史编码为向量存库,按相关性召回,能保留全局信息,但需要额外索引和检索延迟。
- 【回答框架 3】混合策略:最近消息用原样,早期消息用摘要+向量检索兜底,平衡效果与成本。
- 【关键点 1】截断简单但有信息丢失风险。
- 【关键点 2】摘要保留要点但可能失真。
- 【关键点 3】滑动窗口适合短时记忆场景。
- 【关键点 4】向量检索支持长程依赖但需额外存储和计算。
- 【关键点 5】实际方案应结合多种策略。
- 【易错点 1】不能保证摘要完全不失真。
- 【易错点 2】向量检索存在召回不准确的风险。
- 【易错点 3】混合方案可能引入更大延迟。