AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
字节跳动面试题
PPO、DPO、GRPO、DAPO等RL算法的原…
字节跳动面试题
更新 2026-08-05
PPO、DPO、GRPO、DAPO等RL算法的原理和区别。
字节跳动
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对大模型强化学习算法核心机制与演进脉络的理解
回答思路
准确解释PPO的智能体与裁剪目标
说明DPO如何将偏好转化为隐式奖励避免显式RL
区分GRPO的分组采样与PPO评论家差异
理解DAPO在GRPO上的改进点如动态采样和损失裁剪
换一题
上一题
MVVM、MVP、MVC三种架构的区别是什么?
下一题
请解释双 Token 无感刷新的工作原理。
本题还出现在
互联网/IT行业面试题
人工智能面试题