阿里巴巴面试题更新 2026-08-05
在训练大语言模型时,强化学习能否取代监督微调(SFT)?请谈谈你的理解。
阿里巴巴人工智能电商技术原理方案权衡
考察说明
考察对强化学习与监督微调在大模型训练流程中作用、边界与互补关系的理解
回答思路
- 区分SFT与强化学习各自的训练目标和适用场景
- 说明SFT在知识注入、指令对齐上的基础作用
- 说明强化学习在偏好对齐、奖励优化上的优势与挑战
- 讨论两者通常串行而非取代的实践共识
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。