如果你在 GPU 资源有限的条件下同时提供推理和微调服务,如何做资源分配和任务调度以保证时延和吞吐?
考察说明
考察在有限GPU资源下平衡推理服务时延与训练吞吐的资源分配和调度设计能力
回答思路
- 能区分在线推理和离线微调对QoS的不同要求
- 提出基于任务的时延敏感度或优先级进行资源隔离或分时调度的方案
- 讨论弹性伸缩、批处理、抢占与排队策略,保障推理时延下限
- 说明利用监控指标(时延、GPU利用率)驱动动态调优、权衡与取舍
- 能给出可落地的调度机制和压测验证方法
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。