阿里巴巴面试题更新 2026-08-05

重RL(强化学习)和重SFT(监督微调)你倾向于哪个?

阿里巴巴人工智能电商技术原理技术选型方案权衡

考察说明

考察对强化学习与监督微调在模型训练中作用的理解及工程取舍

回答思路

  1. 能明确区分SFT与RL各自的目标和能力边界
  2. 能结合任务场景说明何时侧重RL或SFT
  3. 能讨论数据质量、奖励设计、训练成本等现实约束
  4. 能给出清晰的倾向和理由,体现技术判断力
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。