AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
电商行业面试题
请概述 DeepSeek-R1 的训练过程,重点…
电商行业面试题
更新 2026-08-05
请概述 DeepSeek-R1 的训练过程,重点说明从基础模型到推理增强模型的关键阶段。
阿里巴巴
人工智能
电商
问题拆解
技术原理
考察说明
考察对强化学习在推理模型训练中的应用及多阶段训练流程的理解
回答思路
能描述 R1 的冷启动、推理强化学习和拒绝采样等关键阶段
解释 GRPO 或类似强化学习算法在其中的作用
说明如何通过规则奖励而非训练奖励模型来引导推理
能讨论训练过程中解决的语言混杂问题和格式奖励设计
换一题
上一题
Redis 是单线程的吗?请解释其线程模型与适用边界。
下一题
面对两亿个手机号码,如何找出其中重复的手机号?有哪些更高效的方案?
本题还出现在
人工智能面试题
阿里巴巴面试题