科大讯飞面试题更新 2026-08-05

在LLM训练中,为什么要先进行SFT微调,再进行RL(如RLHF)对齐?

科大讯飞人工智能专业服务问题拆解技术原理方案权衡LLM

考察说明

考察对SFT与RL阶段作用与先后次序的深入理解

回答思路

  1. 说明SFT让模型学会指令跟随和输出格式
  2. 说明RL阶段基于偏好优化进一步对齐人类价值
  3. 解释若不先SFT直接RL会导致探索空间过大、训练不稳定
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。