AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
说明 SFT(监督微调)和 RLHF(基于人类反…
互联网/IT行业面试题
更新 2026-08-05
说明 SFT(监督微调)和 RLHF(基于人类反馈的强化学习)的具体作用。
腾讯
人工智能
互联网/IT
业务理解
技术原理
考察说明
考察对大模型训练范式作用与差异的理解
回答思路
分别解释 SFT 和 RLHF 的目标与机制
说明两者在训练流程中的先后关系
指出 SFT 的局限与 RLHF 的补充价值
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
请介绍你负责的一个功能模块,包括它的业务背景和业务流程是如何流转的。
下一题
为什么HashMap的容量(初始容量和扩容后容量)设计为2的n次方?
本题还出现在
腾讯面试题
人工智能面试题