一个 AI 助手经常给出语气自信但事实错误的答案,你会从哪些原因排查,并怎样降低这种问题对用户的影响?
考察说明
考查对幻觉成因、治理方法和失败体验设计的理解。
回答思路
- 需要区分模型知识不足、用户问题含糊、上下文包含错误信息、检索没有找到正确资料以及生成阶段忽略证据等不同原因,因为它们对应的修复方法不同。
- 对事实型问题应提供可信资料并要求答案绑定证据,引用内容还要由系统检查是否真的支持结论,不能只验证引用链接存在。
- 为信息不足、资料冲突和低置信场景设计明确的拒答或澄清路径,让模型说明缺少什么,而不是强制它每次都给出完整答案。
- 金额、日期、库存和权限等可由程序确定的数据应通过工具查询和规则校验,避免让模型凭语言概率自行生成。
- 评测集应收集真实高风险问题、诱导性问题和已知失败案例,并按错误严重程度统计,而不只是计算整体回答通过率。
- 用户界面可以展示来源、适用时间和人工确认状态,高影响结论进入业务流程前还应设置人工审批。