新模型发布后 Agent 的工具调用错误率突然升高,你作为当班工程师会怎样止损、定位和恢复?
考察说明
考查 AI 生产事故中的版本隔离、证据定位和安全恢复能力。
回答思路
- 先暂停新版本、切回已验证模型或关闭高风险工具,确保错误不会继续产生业务副作用。
- 按模型、提示、工具和用户场景切分错误,比较发布前后结构校验、工具选择与业务结果定位变化点。
- 保存失败链路中的版本、输入摘要、工具 schema、校验错误和执行状态,同时按隐私要求控制原文访问。
- 修复应针对契约不兼容、提示失效或模型行为变化的根因,并用事故样本和邻近场景做回归与灰度。
- 恢复后持续监控并完成时间线、影响范围和防复发复盘,补充发布门槛与自动回滚而非只改提示词。