用户希望把整份长报告和全部历史对话都交给模型,你会怎样解释上下文窗口的限制,并设计更可靠的处理方式?
考察说明
考查对上下文窗口、信息筛选以及质量、延迟和成本取舍的理解。
回答思路
- 上下文窗口同时容纳系统指令、用户输入、历史对话、检索资料、工具结果和预留输出,并不是只计算用户上传文档的长度。
- 能放入更多内容不等于回答一定更好,无关信息、重复材料和相互冲突的版本会稀释关键证据,同时增加延迟和费用。
- 应根据当前任务先筛选相关章节,再按标题、段落或语义边界切分;需要全局理解时可以先分段抽取,再做带来源的汇总。
- 历史对话只保留当前目标、已确认约束和关键事实,较早内容可以生成可追溯摘要,但不能让多次压缩悄悄改变原意。
- 方案评估要同时观察关键信息召回、最终答案质量、端到端高分位延迟和成功任务成本,不能只看是否发生长度报错。
- 当材料超过可靠处理范围时,产品应让用户缩小问题、分批处理或选择章节,并明确哪些内容没有被纳入,而不是静默截断。