人工智能面试题更新 2026-08-05

在大模型评测体系中,幻觉问题通常如何被定义和量化?请结合常见的评测方法、指标和数据集,说明如何系统性地评估大模型生成内容中的幻觉现象,并指出各类方法的局限。

人工智能问题拆解技术原理

考察说明

考查对大模型幻觉评测的全面理解,包括定义、指标、数据集及方法论上的挑战。

回答思路

  1. 【回答框架 1】幻觉的定义:大模型生成与事实不符、与输入上下文不一致或无法由来源支持的内容。常见分类:事实性幻觉(与外部事实矛盾)和忠实性幻觉(与用户指令或上下文矛盾)。评测核心是评估生成内容的事实准确性和一致性。
  2. 【回答框架 2】评测方法可分为基于事实的评测、基于语义的评测和基于一致性的人工评测。基于事实的评测常利用知识库或权威语料构建问答对,模型生成答案后与标准答案进行文本匹配或利用蕴含模型判断事实;基于语义的评测使用NLI模型或相似度计算来判断生成内容与参考事实的语义一致性;人工评测则直接由标注者判断生成内容是否自相矛盾或与事实不符。
  3. 【回答框架 3】常用数据集如TruthfulQA(设计诱导模型产生虚假答案的问题)、HaluEval(包含幻觉样本的问答和摘要数据集)和FELM(面向事实性错误定位)。指标包括准确率、F1、ROUGE、BERTScore以及专门设计的幻觉指标如FactKB(事实知识库评分)和FActScore(事实精确率)。FActScore将长文本拆分为原子事实,逐项核对来源,是较细粒度的评测。
  4. 【回答框架 4】评测流程一般包括:构建或选择包含明确事实信息的测试集;让模型生成答案或续写;将生成内容拆分为可验证的事实单元;利用检索或外部知识源进行事实核对,或利用NLI模型进行蕴含判断;最后汇总为量化指标。为提高可靠性,可结合自动化指标和人工抽检。
  5. 【回答框架 5】局限性:单一指标难以覆盖多样幻觉;自动核对依赖外部知识库的完备性和时效性;NLI模型本身有误差;模型可能生成看似合理但无依据的内容,难以通过文本匹配识别。因此评测需多维度结合,并注意评测集与模型训练数据重叠导致的泄露问题。
  6. 【关键点 1】幻觉分为事实性与忠实性两类,评测需分别设计。
  7. 【关键点 2】FActScore将生成内容拆分为原子事实逐一核对,是细粒度评测常用方法。
  8. 【关键点 3】TruthfulQA、HaluEval等数据集可用于评测,但需注意数据泄露风险。
  9. 【关键点 4】自动评测指标受限于知识库完备性,需结合人工抽检提升可靠性。
  10. 【关键点 5】评测方法无统一金标准,应针对应用场景选择并组合多种策略。
  11. 【易错点 1】只依赖ROUGE或BERTScore等文本相似度指标,无法捕捉事实错误。
  12. 【易错点 2】使用未与模型训练数据隔离的评测集,结果失真。
  13. 【易错点 3】忽略幻觉的定义边界,将风格差异或主观意见误判为幻觉。