AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
请介绍你对DeepSeek采用的GRPO(Gro…
互联网/IT行业面试题
更新 2026-08-05
请介绍你对DeepSeek采用的GRPO(Group Relative Policy Optimization)训练方法的理解。
字节跳动
人工智能
互联网/IT
持续改进
技术原理
技术选型
考察说明
考察对GRPO核心思想和相对比较优化机制的理解
回答思路
能说明GRPO与PPO的主要区别,即去掉Critic模型、基于组内相对奖励估计优势
能解释组内采样与基准归一化的基本流程
能结合DeepSeek-R1等公开信息说明GRPO在推理强化学习中的应用背景
换一题
上一题
请分享你在强化学习项目中调参的经验,包括关键参数的选择、调试策略以及遇到的典型问题。
下一题
请生成十个形式为A?B的数学表达式,要求A和B都是0-9的整数,?为加号或减号,且每个表达式的结果都在0到9之间。
本题还出现在
字节跳动面试题
人工智能面试题