人工智能面试题更新 2026-08-05

如果要修改模型生成的商品名称,应该优先使用监督微调(SFT)还是强化学习(RL)?请说明理由。

百度人工智能专业服务技术选型方案权衡

考察说明

考察对SFT与RL适用场景、目标函数和样本效率的理解

回答思路

  1. 明确区分SFT用于模仿分布、RL用于优化不可微或奖励驱动的目标
  2. 指出商品名称修改通常有明确标准,SFT可低成本达标
  3. 说明RL适合需要多步推理或奖励函数复杂的场景
  4. 必要时提及RL的高方差和采样成本
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。