阿里巴巴面试题更新 2026-08-05

在训练大语言模型时,强化学习能否取代监督微调(SFT)?请谈谈你的理解。

阿里巴巴人工智能电商技术原理方案权衡

考察说明

考察对强化学习与监督微调在大模型训练流程中作用、边界与互补关系的理解

回答思路

  1. 区分SFT与强化学习各自的训练目标和适用场景
  2. 说明SFT在知识注入、指令对齐上的基础作用
  3. 说明强化学习在偏好对齐、奖励优化上的优势与挑战
  4. 讨论两者通常串行而非取代的实践共识
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。