活动流量突然放大十倍,模型供应商开始限流。你会怎样设计排队、退避和降级,保证核心请求不被拖垮?
考察说明
考查模型服务的流量治理、优先级和受控降级能力。
回答思路
- 先按业务风险和时效划分请求优先级,为关键交互预留容量,离线生成与低价值任务可以延后。
- 入口设置有界队列和并发限制,超过容量时尽早返回明确状态,避免请求无限堆积耗尽全部资源。
- 对限流响应使用带随机抖动的指数退避并尊重服务端提示,但为每个任务设置截止时间和最大尝试。
- 降级可切换已验证的轻量模型、缓存结果或人工流程,不能用不兼容模型静默返回低质量答案。
- 监控排队时间、拒绝率、供应商配额和成功任务成本,并通过压测和故障演练校准限流参数。