客户将在财报季把 AI 助手从日常流量提升到十倍,但预算和模型配额都有限。你会怎样做容量与降级设计?
考察说明
考查容量规划、成本约束和业务优先级。
回答思路
- 先用历史业务量和活动计划估算并发、任务结构、上下文长度与峰值持续时间,区分必须实时完成和可以排队的请求。
- 对完整链路做压测,观察模型配额、检索、连接器、数据库和人工队列的瓶颈,并以高分位时延和成功任务成本而非单接口吞吐验收。
- 按业务价值和风险设置优先级,关键实时任务保留容量,低优先级总结可批处理或排队,重复查询可以使用经过权限校验的缓存。
- 与客户财务和业务共同设定预算、配额告警与超限动作,模型路由和上下文压缩必须通过质量评测,不能静默换成明显较差结果。
- 在峰值前进行演练,验证限流、排队、备用模型、只读搜索和人工流程,并明确每种降级对用户显示的状态与恢复时间。
- 若预测容量仍不足,应提前缩小开放人群或功能,而不是到峰值当天随机拒绝;实际流量数据再用于修正后续扩容计划。