科大讯飞面试题更新 2026-08-05
请比较监督微调(SFT)与强化学习(RL)阶段在数据质量要求上的异同,并说明各自的关键关注点。
科大讯飞人工智能专业服务技术原理方案权衡
考察说明
考察对SFT与RL数据质量差异及核心要求的理解
回答思路
- 明确区分SFT与RL的数据目标差异(模仿vs奖励优化)
- 指出SFT侧重多样性、覆盖度与标注一致性,RL侧重奖励信号质量与偏好对齐
- 提到数据规模、噪声容忍度和反馈来源的不同要求
- 举例说明数据质量问题对两个阶段的影响
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。