新模型和新交互界面同时准备上线,团队希望一次 A/B 测试完成验证。你会怎样设计实验才能知道是谁产生了效果?
考察说明
考查 AI 产品实验归因和实验风险控制。
回答思路
- 先明确要验证的是模型质量、交互可用性还是两者组合,若资源允许应采用因子实验或分阶段测试隔离变量。
- 随机分流前检查用户、任务和历史使用差异,并保证同一用户在实验期内体验稳定,避免来回切换污染判断。
- 核心指标使用真实任务完成、采纳和后续复用,模型质量还需通过盲评或可核验字段补充,不能只看按钮点击。
- 设置严重错误、延迟、成本和投诉等护栏,任何版本触发高风险阈值都应暂停,而不是等统计显著后再处理。
- 记录每次请求的模型、提示、界面版本和工具状态,防止实验期间其他配置变化使结果无法解释。
- 若样本量不足以同时检验多个因素,应先做离线模型比较,再在线测试交互,不用复杂实验制造虚假的确定结论。