字节跳动面试题更新 2026-08-05
如何判断一个任务在训练时是先进行监督微调(SFT)还是直接使用强化学习(RL)?
字节跳动人工智能互联网/IT技术原理方案权衡
考察说明
考察对SFT与RL适用场景的判断和训练流程理解
回答思路
- 明确SFT与RL的目标差异:模仿学习 vs 偏好优化
- 根据任务是否有明确可优化的奖励信号判断是否适合RL
- 讨论数据规模和成本对选择的影响
- 举例说明常见任务(如对话、代码生成)的典型选择
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。