AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
PPO、DPO、GRPO、DAPO等RL算法的原…
人工智能面试题
更新 2026-08-05
PPO、DPO、GRPO、DAPO等RL算法的原理和区别。
字节跳动
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对大模型强化学习算法核心机制与演进脉络的理解
回答思路
准确解释PPO的智能体与裁剪目标
说明DPO如何将偏好转化为隐式奖励避免显式RL
区分GRPO的分组采样与PPO评论家差异
理解DAPO在GRPO上的改进点如动态采样和损失裁剪
换一题
上一题
强化学习训练不稳定的主要原因有哪些?请结合具体场景说明。
下一题
请描述你在实际项目中设计提示词(Prompt)的方法和原则。
本题还出现在
互联网/IT行业面试题
字节跳动面试题