字节跳动面试题更新 2026-08-05
SFT和强化学习之间的区别在哪里,分别适用什么场景?
字节跳动人工智能互联网/IT技术原理方案权衡
考察说明
考察对监督微调与强化学习在原理、目标及适用场景上的理解
回答思路
- 准确说明SFT基于监督信号进行概率拟合,强化学习基于奖励信号优化策略
- 指出SFT适合模仿已有高质量行为,强化学习适合优化难以直接监督的目标
- 结合具体场景说明选择依据,如指令遵循用SFT,安全对齐或复杂任务用强化学习
- 能指出两者结合的实践,如先SFT后进行强化学习对齐
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。