AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
请概述 DeepSeek-R1 的训练过程,重点…
人工智能面试题
更新 2026-08-05
请概述 DeepSeek-R1 的训练过程,重点说明从基础模型到推理增强模型的关键阶段。
阿里巴巴
人工智能
电商
问题拆解
技术原理
考察说明
考察对强化学习在推理模型训练中的应用及多阶段训练流程的理解
回答思路
能描述 R1 的冷启动、推理强化学习和拒绝采样等关键阶段
解释 GRPO 或类似强化学习算法在其中的作用
说明如何通过规则奖励而非训练奖励模型来引导推理
能讨论训练过程中解决的语言混杂问题和格式奖励设计
换一题
上一题
除 RQ-VAE 外,你还了解哪些生成码本模型?例如基于平衡 K-Means 的 one-REC 等。请介绍其核心思想和与 RQ-VAE 的差异。
下一题
请介绍什么是访存密集型算子,并说明它们的特点与优化思路。
本题还出现在
电商行业面试题
阿里巴巴面试题