AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
物流/供应链行业面试题
在强化学习训练大语言模型时,PPO 和 GRPO…
物流/供应链行业面试题
更新 2026-08-05
在强化学习训练大语言模型时,PPO 和 GRPO 分别适用于哪些场景?请说明各自的适用条件与选择依据。
京邦达
人工智能
物流/供应链
技术原理
技术选型
方案权衡
考察说明
考察对两种强化学习算法的适用场景、相对优劣及选择依据的理解
回答思路
能明确区分 PPO 与 GRPO 的核心机制差异,如 critic 模型与组内基线
能结合资源约束、训练稳定性、任务特性说明选择理由
能指出 GRPO 对内存和计算成本的降低及其适用边界
能提及 PPO 在需要价值函数辅助或异质任务中的优势
换一题
上一题
为什么会出现死锁问题,怎么解决死锁问题?
下一题
Spring AOP 有几种实现方式?每种实现方式的差别是什么?
本题还出现在
人工智能面试题
京邦达面试题