阿里巴巴面试题更新 2026-08-05

DeepSeek-R1的强化学习训练方式与传统RLHF有何不同?

阿里巴巴百度人工智能专业服务电商持续改进技术原理方案权衡

考察说明

考察对R1中强化学习训练机制的理解

回答思路

  1. 指出R1采用纯强化学习(如GRPO)而非传统RLHF
  2. 说明无需人工标注的奖励模型
  3. 强调在推理任务中通过规则验证激励思考过程