人工智能面试题更新 2026-08-05

请列举并解释求解马尔科夫决策过程(MDP)的几种主要方法,并说明各自的特点或适用情况。

人工智能技术原理

考察说明

考察对MDP求解算法的掌握程度,包括动态规划、蒙特卡洛、时序差分等方法的原理和适用场景。

回答思路

  1. 【回答框架 1】马尔科夫决策过程由状态、动作、转移概率、奖励和折扣因子五元组定义,求解目标是找到最优策略,即最大化累积折扣奖励。主要求解方法分为基于模型(动态规划)和无模型(强化学习)两大类。
  2. 【回答框架 2】动态规划方法包括策略迭代和值迭代。策略迭代分为策略评估和策略改进两步,值迭代则直接迭代最优值函数。动态规划需要已知转移概率和奖励,计算复杂度高,适用于小规模问题。
  3. 【回答框架 3】蒙特卡洛方法通过采样完整轨迹估计值函数,不需要环境模型,但需要等回合结束才能更新,方差大,适用于情节性任务。
  4. 【回答框架 4】时序差分(TD)方法结合了动态规划和蒙特卡洛的思想,可以逐步更新估计值,无需完整轨迹,如TD(0)和SARSA。Q-learning是一种离策略的TD控制方法,直接学习最优动作值函数,广泛应用于无模型环境。
  5. 【回答框架 5】此外,还有基于策略梯度的方法,如REINFORCE、Actor-Critic,直接优化策略参数,适用于高维或连续动作空间。近年来,深度强化学习(如DQN)使用神经网络近似值函数,处理大规模状态空间。
  6. 【关键点 1】动态规划(策略迭代、值迭代)需要已知模型,适合小规模问题。
  7. 【关键点 2】蒙特卡洛方法无需模型,但需要完整轨迹,方差大。
  8. 【关键点 3】时序差分(TD)方法在线更新,结合MC和DP优点,Q-learning是常见离策略方法。
  9. 【关键点 4】策略梯度方法直接优化策略,适合连续动作空间,可结合Actor-Critic架构。
  10. 【关键点 5】深度强化学习(如DQN)用神经网络处理大规模状态,但有稳定性挑战。
  11. 【易错点 1】混淆基于模型和无模型方法的条件,动态规划必须已知转移概率。
  12. 【易错点 2】忽略蒙特卡洛和TD在方差与偏差上的权衡,前者方差大。
  13. 【易错点 3】将Q-learning误认为在线策略方法,其实是离策略。