结合出行推荐 Agent,你会如何设计强化学习中的 Reward 函数?
考察说明
考察强化学习在Agent优化中的实际设计能力,特别是Reward函数的设计原则与业务结合
回答思路
- 能明确Reward函数需对齐业务目标,如用户满意度、出行效率、成本等
- 能区分即时奖励与长期累积奖励,并设计稀疏或密集奖励机制
- 能考虑负奖励与约束条件,避免推荐不合理方案
- 能结合出行场景提出具体奖励项,如时间、费用、舒适度、接驳便利性
- 能讨论Reward平衡与奖励塑形(Reward Shaping)策略
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。