字节跳动面试题更新 2026-08-05

如何判断一个任务在训练时是先进行监督微调(SFT)还是直接使用强化学习(RL)?

字节跳动人工智能互联网/IT技术原理方案权衡

考察说明

考察对SFT与RL适用场景的判断和训练流程理解

回答思路

  1. 明确SFT与RL的目标差异:模仿学习 vs 偏好优化
  2. 根据任务是否有明确可优化的奖励信号判断是否适合RL
  3. 讨论数据规模和成本对选择的影响
  4. 举例说明常见任务(如对话、代码生成)的典型选择
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。