AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
阿里巴巴面试题
请概述 DeepSeek-R1 的训练过程,重点…
阿里巴巴面试题
更新 2026-08-05
请概述 DeepSeek-R1 的训练过程,重点说明从基础模型到推理增强模型的关键阶段。
阿里巴巴
人工智能
电商
问题拆解
技术原理
考察说明
考察对强化学习在推理模型训练中的应用及多阶段训练流程的理解
回答思路
能描述 R1 的冷启动、推理强化学习和拒绝采样等关键阶段
解释 GRPO 或类似强化学习算法在其中的作用
说明如何通过规则奖励而非训练奖励模型来引导推理
能讨论训练过程中解决的语言混杂问题和格式奖励设计
换一题
上一题
你认为数据在跨境电商运营中起什么作用?
下一题
请说明Decoder的因果注意力机制,以及Q、K、V的来源。
本题还出现在
电商行业面试题
人工智能面试题