一次生产事故同时涉及客户 SSO、实施伙伴的连接器、模型供应商和你们的平台,各方都说自己的系统正常。你作为 FDE 会怎样组织联合处置?
考察说明
考查跨组织事故指挥、证据协作和责任升级机制。
回答思路
- 先按用户影响和业务风险确定事故级别,指定单一事件负责人、记录员和客户沟通人,避免四个团队各自开群并给出冲突结论。
- 建立共享时间线,统一请求标识、租户、版本、配置变更和依赖状态,只交换排障必要且经客户批准的证据,不在群里传播原始敏感数据。
- 用接口契约划分 SSO、连接器、模型和平台的预期输入输出,要求各方提供可验证结果,在交界处复现而不是依靠“本系统监控正常”的声明。
- 在 war room 中明确每个假设的负责人、验证动作和更新时间,客户 FDE 负责推动闭环但不替无权限的供应商直接做生产变更。
- 按照固定节奏向业务方说明已确认影响、临时替代和下一次更新时间;根因未证实时不推责,也不承诺无法验证的恢复时间。
- 恢复后共同完成时间线、根因、责任边界和改进项,补充跨团队演练、升级联系人与证据格式,验证同类事故能更快定位。