专业服务行业面试题更新 2026-08-05
请谈谈你对监督微调(SFT)和强化学习(RL)在大型语言模型训练中的区别与理解。
百度人工智能专业服务技术原理方案权衡
考察说明
考察对SFT与RL在训练目标、数据与反馈机制上的本质差异的理解
回答思路
- 准确说明SFT基于监督数据做最大似然学习、RL基于奖励信号做策略优化
- 能区分两者在数据依赖性、目标函数和训练稳定性上的差异
- 能结合对齐场景说明RL(如RLHF)如何改进SFT不足,并指出各自适用阶段
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。