人工智能面试题更新 2026-08-05

结合出行推荐 Agent,你会如何设计强化学习中的 Reward 函数?

高德地图人工智能业务理解系统设计方案权衡

考察说明

考察强化学习在Agent优化中的实际设计能力,特别是Reward函数的设计原则与业务结合

回答思路

  1. 能明确Reward函数需对齐业务目标,如用户满意度、出行效率、成本等
  2. 能区分即时奖励与长期累积奖励,并设计稀疏或密集奖励机制
  3. 能考虑负奖励与约束条件,避免推荐不合理方案
  4. 能结合出行场景提出具体奖励项,如时间、费用、舒适度、接驳便利性
  5. 能讨论Reward平衡与奖励塑形(Reward Shaping)策略
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。