人工智能面试题更新 2026-08-05

在真实应用场景中,完成 RAG 系统的调优后,应当采用哪些效果评估标准和评估方法?请结合具体的应用场景说明评估指标的选择依据与实施方式。

人工智能系统设计技术原理方案权衡LLMRAG

考察说明

考查候选人对 RAG 系统评估体系的理解,是否掌握指标选取、评估方法及真实场景下的落地考量。

回答思路

  1. 【回答框架 1】RAG 效果评估主要从检索质量和生成质量两个维度展开。检索质量常用召回率 Recall@K、命中率 Hit Rate、MRR(平均倒数排名)和 NDCG 等指标,衡量检索模块能否返回足够相关且排序靠前的文档块。生成质量则关注答案的准确性、忠实度、相关性和完整性,常用指标包括准确率、忠实度(faithfulness)、答案相关性(answer relevance)等,可通过人工评分或利用大模型作为评判者(LLM-as-a-judge)进行自动化评估。
  2. 【回答框架 2】在真实应用场景中,评估需要结合具体的业务目标。例如在客服场景,可能更看重答案的准确性和用户问题解决率,需要结合用户反馈和业务转化指标;在知识库问答场景,可能更关注召回率和答案的忠实度,确保答案有据可循。评估标准应与业务指标挂钩,如回答采纳率、用户满意度、任务完成率等,同时兼顾离线评估和线上评估。
  3. 【回答框架 3】离线评估通常构建标准评估集,包含问题、标准答案和相关的文档块标注。可采用 RAGAS 等评估框架,计算忠实度、答案相关性、上下文相关性等指标。策略上可先分别评估检索模块(如 Recall@K、MRR)和生成模块(如基于标准答案的相似度、LLM 评分),再进行端到端评估。在线评估可采用 A/B 测试,对比调优前后的效果,并监控用户行为指标。
  4. 【回答框架 4】在实际实施中,还需考虑评估成本与效率。人工评估准确但耗时,适用于小样本抽查;自动化评估如 LLM-as-a-judge 可扩展但需校准,避免评委偏差。建议结合多种评估方法,采用分层抽样、定期更新评估集,并持续收集线上反馈进行监控。最终形成一个闭环:调优、评估、上线、监控、再优化。
  5. 【关键点 1】RAG 评估分为检索质量(Recall@K、MRR)和生成质量(忠实度、相关性)两个层面。
  6. 【关键点 2】真实场景需结合业务目标选择评估指标,如客服关注解决率,知识库关注忠实度。
  7. 【关键点 3】离线评估使用标准评估集和 RAGAS 等框架,在线评估使用 A/B 测试和用户行为监控。
  8. 【关键点 4】评估方法需平衡人工与自动化,通过协同使用确保结果可靠。
  9. 【关键点 5】评估应形成闭环,支持持续优化和监控。
  10. 【易错点 1】只关注离线指标而忽略线上业务效果,导致评估与业务脱节。
  11. 【易错点 2】过度依赖 LLM-as-a-judge,未做校准,可能引入评委偏差。
  12. 【易错点 3】评估集构建不严谨,样本偏差或标注不一致,影响评估有效性。