小鹏汽车面试题更新 2026-08-05
从技术原理角度,为什么强化学习可以提升大语言模型的能力?
小鹏汽车人工智能消费品/零售技术原理方案权衡
考察说明
考察对强化学习在大模型训练中的作用机制与适用边界的理解
回答思路
- 能说明RL与监督学习的核心差异,强调反馈信号而非固定标签
- 能解释RLHF中奖励模型、策略更新和PPO等关键环节
- 能指出RL的适用场景与潜在风险,如奖励黑客、分布漂移
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。