互联网/IT行业面试题更新 2026-08-05
了解强化学习吗,跟 SFT 有什么区别?
网易人工智能互联网/IT问题拆解技术原理
考察说明
考察对强化学习与监督微调的概念理解及在模型训练中的定位
回答思路
- 准确阐述强化学习的核心机制(奖励、试错、策略优化)
- 对比 SFT 的监督信号与 RL 的奖励信号差异
- 说明两者在数据依赖、目标函数和应用场景上的区别
- 能结合实际例子说明何时使用强化学习
- 体现对训练稳定性和资源成本的认知
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。