AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
科大讯飞面试题
请写出或口述DPO(Direct Prefere…
科大讯飞面试题
更新 2026-08-05
请写出或口述DPO(Direct Preference Optimization)的损失函数公式。
科大讯飞
人工智能
专业服务
技术原理
考察说明
考察对DPO算法核心公式的记忆与理解
回答思路
正确写出DPO损失函数公式
解释公式中各符号的含义
能说明与RLHF(PPO)的区别
提及参考模型和策略模型的作用
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
平时怎么去学习的?
下一题
请列举并比较常见的中文分词器(Tokenizer)类型,说明各自的适用场景。
本题还出现在
专业服务行业面试题
人工智能面试题