阿里巴巴面试题更新 2026-08-05
重RL(强化学习)和重SFT(监督微调)你倾向于哪个?
阿里巴巴人工智能电商技术原理技术选型方案权衡
考察说明
考察对强化学习与监督微调在模型训练中作用的理解及工程取舍
回答思路
- 能明确区分SFT与RL各自的目标和能力边界
- 能结合任务场景说明何时侧重RL或SFT
- 能讨论数据质量、奖励设计、训练成本等现实约束
- 能给出清晰的倾向和理由,体现技术判断力
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。