AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
如何为基于 pair 对的训练样本设计 Rewa…
人工智能面试题
更新 2026-08-05
如何为基于 pair 对的训练样本设计 Reward Model 的损失函数?
滴滴
人工智能
编码实现
技术原理
PyTorch
考察说明
考察对偏好学习损失函数的理解与实现能力
回答思路
说明 pair 样本的构造与对比目标
写出或描述 Bradley-Terry 损失公式
解释 logits 与 margin 的作用
能处理 batch 内的配对逻辑
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
Transformer 中为何使用 LayerNorm 而非 BatchNorm?这对大模型训练的稳定性有何影响?
下一题
4发3收的MIMO系统相对于SISO系统在性能上能提升多少?
本题还出现在
滴滴面试题