AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
腾讯面试题
DeepSeek 使用的 GRPO 相比于 Op…
腾讯面试题
更新 2026-08-05
DeepSeek 使用的 GRPO 相比于 OpenAI 的 PPO 做了哪些改进?
腾讯
人工智能
互联网/IT
技术原理
方案权衡
考察说明
考察对 GRPO 与 PPO 差异的理解,验证对前沿强化学习训练的认知
回答思路
说明 PPO 依赖 Critic 模型估计优势函数
说明 GRPO 使用组内相对得分取代 Critic 网络
提到减少内存与计算开销、简化训练流程
能提到 GRPO 适合 LLM 场景的稀疏奖励
换一题
上一题
前端在 hash 模式下如何监听 URL 变化?
下一题
请介绍 Redis 的常用数据结构及其适用场景。
本题还出现在
互联网/IT行业面试题
人工智能面试题