AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
DeepSeek 使用的 GRPO 相比于 Op…
人工智能面试题
更新 2026-08-05
DeepSeek 使用的 GRPO 相比于 OpenAI 的 PPO 做了哪些改进?
腾讯
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对 GRPO 与 PPO 差异的理解,验证对前沿强化学习训练的认知
回答思路
说明 PPO 依赖 Critic 模型估计优势函数
说明 GRPO 使用组内相对得分取代 Critic 网络
提到减少内存与计算开销、简化训练流程
能提到 GRPO 适合 LLM 场景的稀疏奖励
换一题
上一题
在降维过程中,你是如何具体实施embedding降维的?
下一题
针对大语言模型,有哪些常用的模型优化方法?请列举并简要说明。
本题还出现在
互联网/IT行业面试题
腾讯面试题