AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
京邦达面试题
在强化学习训练大语言模型时,PPO 和 GRPO…
京邦达面试题
更新 2026-08-05
在强化学习训练大语言模型时,PPO 和 GRPO 分别适用于哪些场景?请说明各自的适用条件与选择依据。
京邦达
人工智能
物流/供应链
技术原理
技术选型
方案权衡
考察说明
考察对两种强化学习算法的适用场景、相对优劣及选择依据的理解
回答思路
能明确区分 PPO 与 GRPO 的核心机制差异,如 critic 模型与组内基线
能结合资源约束、训练稳定性、任务特性说明选择理由
能指出 GRPO 对内存和计算成本的降低及其适用边界
能提及 PPO 在需要价值函数辅助或异质任务中的优势
换一题
上一题
你觉得你的沟通交流能力在同龄人中是你的短板吗?
下一题
你在项目或团队合作中通常承担什么角色?
本题还出现在
物流/供应链行业面试题
人工智能面试题