AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
请介绍强化学习中的奖励函数(reward fun…
人工智能面试题
更新 2026-08-05
请介绍强化学习中的奖励函数(reward function)的设计与作用。
深圳虾皮信息科技有限公司
人工智能
互联网/IT
问题拆解
技术原理
方案权衡
考察说明
考察对强化学习奖励函数基本原理、设计要点和潜在问题的理解
回答思路
说明奖励函数的定义与在强化学习中的作用
覆盖奖励设计的主要原则(如稀疏奖励、密集奖励、reward shaping)
讨论奖励误导(reward hacking)等常见问题及应对
结合实际场景举例说明设计考量
换一题
上一题
请讲解整个Transformer架构的组成和工作原理。
下一题
请对比PPO与GRPO两种强化学习算法的核心思想与主要区别。
本题还出现在
互联网/IT行业面试题
深圳虾皮信息科技有限公司面试题