AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
快手面试题
请介绍PPO和GRPO在大语言模型强化学习训练中…
快手面试题
更新 2026-08-05
请介绍PPO和GRPO在大语言模型强化学习训练中的主要问题,并说明DAPO如何针对性地解决这些问题。
快手
人工智能
互联网/IT
持续改进
技术原理
方案权衡
考察说明
考察对LLM强化学习算法演进的理解及DAPO改进点的掌握
回答思路
准确指出PPO或GRPO的关键缺陷,如熵崩溃、奖励噪声、训练不稳定
清晰说明DAPO的核心改进机制(如动态采样、裁剪策略、奖励归一化等)
能够对比改进前后效果并解释原因
展示对相关论文或实践细节的了解
能延伸讨论局限或替代方案
换一题
上一题
面向年中/年末大促,如何在1周内完成“玩法预验收”?请列出必须通过的验收项与对应量化阈值(性能、风控、回款、体验等)。
下一题
线程池的七个参数是什么?如果 corePoolSize 为 1、maximumPoolSize 为 100,并发量会如何变化?
本题还出现在
互联网/IT行业面试题
人工智能面试题