互联网/IT行业面试题更新 2026-08-05

了解强化学习吗,跟 SFT 有什么区别?

网易人工智能互联网/IT问题拆解技术原理

考察说明

考察对强化学习与监督微调的概念理解及在模型训练中的定位

回答思路

  1. 准确阐述强化学习的核心机制(奖励、试错、策略优化)
  2. 对比 SFT 的监督信号与 RL 的奖励信号差异
  3. 说明两者在数据依赖、目标函数和应用场景上的区别
  4. 能结合实际例子说明何时使用强化学习
  5. 体现对训练稳定性和资源成本的认知
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。