消费品/零售行业面试题更新 2026-08-05

为什么不能跳过SFT去做RLHF?

唯品会人工智能消费品/零售问题拆解技术原理

考察说明

考察对LLM训练流程中SFT与RLHF职责和先后逻辑的理解

回答思路

  1. 说明SFT为模型建立预训练后可控输出格式与基础指令能力
  2. 说明RLHF依赖SFT产出的策略作为初始模型以稳定训练
  3. 说明直接RLHF会导致训练不稳定、策略坍塌或奖励泛化失效
  4. 阐述阶段递进与各阶段作用的关系
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。