人工智能面试题更新 2026-08-05

在对话历史长度超过模型的上下文窗口限制时,可以采用哪些上下文压缩方法来处理?请给出各类方法的机制并分析其优缺点。

人工智能技术原理方案权衡LLM

考察说明

考察对LLM上下文管理策略的理解及权衡分析。

回答思路

  1. 【回答框架 1】核心策略包括截断、摘要、向量检索和滑动窗口。截断直接丢弃最早消息,简单但丢失重要信息;摘要生成历史要点,保留核心但可能失真且增加计算开销。
  2. 【回答框架 2】滑动窗口固定最近N轮,实时性高,但长对话早期信息完全丢失;向量检索将历史编码为向量存库,按相关性召回,能保留全局信息,但需要额外索引和检索延迟。
  3. 【回答框架 3】混合策略:最近消息用原样,早期消息用摘要+向量检索兜底,平衡效果与成本。
  4. 【关键点 1】截断简单但有信息丢失风险。
  5. 【关键点 2】摘要保留要点但可能失真。
  6. 【关键点 3】滑动窗口适合短时记忆场景。
  7. 【关键点 4】向量检索支持长程依赖但需额外存储和计算。
  8. 【关键点 5】实际方案应结合多种策略。
  9. 【易错点 1】不能保证摘要完全不失真。
  10. 【易错点 2】向量检索存在召回不准确的风险。
  11. 【易错点 3】混合方案可能引入更大延迟。