AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
互联网/IT行业面试题
DPO(直接偏好优化)的公式是什么?
互联网/IT行业面试题
更新 2026-08-05
DPO(直接偏好优化)的公式是什么?
字节跳动
人工智能
互联网/IT
技术原理
考察说明
考察对直接偏好优化算法的数学定义和核心公式的掌握
回答思路
准确列出DPO的目标函数或损失函数
说明公式中各符号的含义(如策略、参考策略、偏好对)
能解释DPO与RLHF中PPO的区别,特别是省去奖励模型和强化学习的特性
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
请描述如何优化基于 CUDA 的 GEMM(矩阵乘法)实现,并说明其中 shared memory 的大小应如何确定。
下一题
请介绍一次你参加过的学科竞赛或技术比赛,包括你的角色、解决的问题和最终结果。
本题还出现在
字节跳动面试题
人工智能面试题