你会怎样评估一个会规划步骤并调用多个工具的 Agent,而不是只看它最后一句回答是否正确?
考察说明
考查 Agent 结果评测、轨迹评测和回归测试设计。
回答思路
- 测试集应覆盖正常任务、参数缺失、工具失败、权限不足、用户中途修改目标和恶意输入,并为每类任务定义允许的终态。
- 结果指标包括任务是否完成、业务数据是否正确和副作用是否符合预期,不能由模型自己判断成功与否。
- 轨迹指标检查是否选择了正确工具、参数是否合法、是否重复调用、是否跳过确认以及步骤和调用成本是否合理。
- 对非确定性输出应在相同条件下多次运行,统计成功率和严重失败分布,避免一次通过掩盖不稳定性。
- 工具依赖可使用可控模拟器复现超时、脏数据和部分成功,同时保留少量真实环境端到端验证,防止测试桩与生产行为脱节。
- 每次修改模型、提示、工具或记忆策略都运行版本化回归集;线上再监控人工接管率、重复执行和高风险异常,并把事故转为测试案例。