AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
阿里巴巴面试题
DeepSeek-R1的强化学习训练方式与传统R…
阿里巴巴面试题
更新 2026-08-05
DeepSeek-R1的强化学习训练方式与传统RLHF有何不同?
阿里巴巴
百度
人工智能
专业服务
电商
持续改进
技术原理
方案权衡
考察说明
考察对R1中强化学习训练机制的理解
回答思路
指出R1采用纯强化学习(如GRPO)而非传统RLHF
说明无需人工标注的奖励模型
强调在推理任务中通过规则验证激励思考过程
换一题
上一题
请解释Spring MVC中双重拦截器(Interceptor)的含义,并说明如何配置。
下一题
说一下 LoRA 是什么原理
本题还出现在
电商行业面试题
专业服务行业面试题
百度面试题
人工智能面试题