请从学习范式、数据依赖、目标函数和适用场景等角度,阐述强化学习与监督学习之间的相同点和不同点。
考察说明
考查对机器学习两大核心范式的本质区别与联系的理解,能否清晰辨析二者在训练信号、反馈机制、交互性等方面的差异。
回答思路
- 【回答框架 1】监督学习基于带标签的静态数据集,通过最小化预测值与真实标签的损失函数(如交叉熵、均方误差)来学习输入到输出的映射,模型训练与数据采集分离。
- 【回答框架 2】强化学习则通过智能体与环境交互,以最大化累积奖励为目标,学习最优策略(状态到动作的映射),训练信号是延迟的、稀疏的奖励信号,而非直接的正确标签。
- 【回答框架 3】相同点:两者都属于机器学习范式,都在学习从输入到输出的映射(策略也可视为状态到动作的映射);都依赖数据驱动,都需要定义目标函数(损失函数或回报函数)来指导优化;都可能使用神经网络等函数逼近器。
- 【回答框架 4】核心差异:监督学习假设数据独立同分布,强化学习面临非独立同分布的数据(状态转移影响后续采样);监督学习是单步决策,强化学习是序列决策,需要考虑时间信用分配;监督学习反馈即时且明确,强化学习反馈延迟且可能噪声大;监督学习不涉及探索与利用权衡,强化学习必须平衡探索新动作与利用已知好策略。
- 【回答框架 5】适用场景:监督学习适合分类、回归等有明确标注任务(如图像识别、房价预测);强化学习适合序贯决策任务(如游戏AI、机器人控制、自动驾驶、推荐系统动态决策)。
- 【关键点 1】监督学习依赖静态标签样本,强化学习依赖与环境交互产生的奖励序列。
- 【关键点 2】监督学习优化单步预测误差,强化学习优化长期累积回报,需处理时序信用分配。
- 【关键点 3】强化学习包含探索与利用权衡,监督学习没有。
- 【关键点 4】二者均为数据驱动的函数拟合过程,可共用深度学习模型结构。
- 【关键点 5】强化学习数据非独立同分布,监督学习通常假设独立同分布。
- 【易错点 1】混淆奖励函数与损失函数:奖励是环境反馈,损失是模型优化目标,不可直接等同。
- 【易错点 2】忽略强化学习的非平稳性:策略更新改变数据分布,监督学习模型不改变数据分布。
- 【易错点 3】将监督学习中的评价指标(如准确率)直接用于强化学习策略评估,需用回报或价值函数评估。