AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
腾讯面试题
说明 SFT(监督微调)和 RLHF(基于人类反…
腾讯面试题
更新 2026-08-05
说明 SFT(监督微调)和 RLHF(基于人类反馈的强化学习)的具体作用。
腾讯
人工智能
互联网/IT
业务理解
技术原理
考察说明
考察对大模型训练范式作用与差异的理解
回答思路
分别解释 SFT 和 RLHF 的目标与机制
说明两者在训练流程中的先后关系
指出 SFT 的局限与 RLHF 的补充价值
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
操作系统虚拟内存和物理内存的区别?
下一题
如果一个组件内部代码超过 200 行甚至上千行,但全是内部逻辑,是否还应该拆分?你如何判断?
本题还出现在
互联网/IT行业面试题
人工智能面试题