AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
说明 SFT(监督微调)和 RLHF(基于人类反…
人工智能面试题
更新 2026-08-05
说明 SFT(监督微调)和 RLHF(基于人类反馈的强化学习)的具体作用。
腾讯
人工智能
互联网/IT
业务理解
技术原理
考察说明
考察对大模型训练范式作用与差异的理解
回答思路
分别解释 SFT 和 RLHF 的目标与机制
说明两者在训练流程中的先后关系
指出 SFT 的局限与 RLHF 的补充价值
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
请手写并解释交叉熵损失函数的计算过程
下一题
如何系统地学习并掌握序关系(偏序、全序等)的相关知识?
本题还出现在
互联网/IT行业面试题
腾讯面试题