科大讯飞面试题更新 2026-08-05

请写出或口述DPO(Direct Preference Optimization)的损失函数公式。

科大讯飞人工智能专业服务技术原理

考察说明

考察对DPO算法核心公式的记忆与理解

回答思路

  1. 正确写出DPO损失函数公式
  2. 解释公式中各符号的含义
  3. 能说明与RLHF(PPO)的区别
  4. 提及参考模型和策略模型的作用
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。