腾讯面试题更新 2026-08-05

你了解或使用过 RLHF 吗?请简单介绍一下它。

腾讯人工智能互联网/IT技术原理技术选型

考察说明

考察对强化学习与人类反馈微调技术的理解深度与实际经验

回答思路

  1. 解释 RLHF 的基本流程:预训练、监督微调、奖励模型训练、强化学习优化
  2. 说明 RLHF 的目标与作用:让模型输出更符合人类偏好
  3. 结合自身经历说明是否实际使用过,包括工具或框架
  4. 能指出 RLHF 的局限性或改进方向
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。