人工智能面试题更新 2026-08-05

在 RAG 应用中,为了提升检索精度,数据清洗与预处理环节应如何进行?

人工智能性能优化系统设计技术选型RAG

考察说明

考查候选人对 RAG 数据管道中数据质量管理的理解与实践能力。

回答思路

  1. 【回答框架 1】数据清洗是 RAG 检索精度的基石。核心任务包括去除重复项、噪音字符和 HTML 标签,确保文本语义完整。对于 PDF 等格式,需处理表格、页眉页脚等非正文内容,避免污染向量索引。清洗需保留关键信息,如标题层级和列表结构,以辅助后续切块。
  2. 【回答框架 2】预处理的关键在于分块(chunking)策略。常见方法有固定大小切块、递归字符切块和基于文档结构的切块。分块大小直接影响检索精度:过小导致语义缺失,过大引入噪音。需结合嵌入模型的 max token 限制和查询长度调整,并通过召回率评估迭代优化。
  3. 【回答框架 3】除文本清洗外,还需考虑元数据标注和去重。为每个块添加上下文信息(如来源、章节),便于过滤和排序。精确去重和语义去重可减少冗余向量,提升检索效率。此外,需补充同义词和缩写规范,增强泛化能力。
  4. 【回答框架 4】质量评估与迭代机制不可或缺。建立评估集,使用命中率、MRR 等指标衡量清洗与分块效果。根据失败案例反向调整清洗规则和分块参数。注意动态文档,设置更新策略以保持索引新鲜度。
  5. 【关键点 1】数据清洗去除噪音,保留语义结构,是检索精度的前提。
  6. 【关键点 2】分块策略需平衡语义完整性与噪音,并匹配嵌入模型的限制。
  7. 【关键点 3】元数据和去重提升检索效率与精确性。
  8. 【关键点 4】建立评估集迭代优化清洗与分块参数。
  9. 【易错点 1】过度清洗可能丢失语义信息,如去除标点或停用词不当。
  10. 【易错点 2】分块大小固定不变可能不适应不同文档类型,需动态调整。
  11. 【易错点 3】忽略元数据会降低过滤能力,影响 RAG 回答的准确性。