科大讯飞面试题更新 2026-08-05

在 GRPO(群组相对策略优化)训练中,奖励模型或奖励函数的奖励信号一般如何设计?

京东科大讯飞人工智能专业服务电商问题拆解技术原理

考察说明

考察对 GRPO 训练流程中奖励信号设计原则与实现方式的理解

回答思路

  1. 能说明 GRPO 中奖励来源:基于规则或学习到的奖励模型
  2. 能区分过程奖励与结果奖励及其适用场景
  3. 能讨论奖励归一化/基线处理以稳定训练
  4. 能结合具体任务说明奖励设计细节
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。