阿里巴巴面试题更新 2026-08-05

请概述 DeepSeek-R1 的训练过程,重点说明从基础模型到推理增强模型的关键阶段。

阿里巴巴人工智能电商问题拆解技术原理

考察说明

考察对强化学习在推理模型训练中的应用及多阶段训练流程的理解

回答思路

  1. 能描述 R1 的冷启动、推理强化学习和拒绝采样等关键阶段
  2. 解释 GRPO 或类似强化学习算法在其中的作用
  3. 说明如何通过规则奖励而非训练奖励模型来引导推理
  4. 能讨论训练过程中解决的语言混杂问题和格式奖励设计