小鹏汽车面试题更新 2026-08-05

从技术原理角度,为什么强化学习可以提升大语言模型的能力?

小鹏汽车人工智能消费品/零售技术原理方案权衡

考察说明

考察对强化学习在大模型训练中的作用机制与适用边界的理解

回答思路

  1. 能说明RL与监督学习的核心差异,强调反馈信号而非固定标签
  2. 能解释RLHF中奖励模型、策略更新和PPO等关键环节
  3. 能指出RL的适用场景与潜在风险,如奖励黑客、分布漂移
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。