科大讯飞面试题更新 2026-08-05
在 GRPO(群组相对策略优化)训练中,奖励模型或奖励函数的奖励信号一般如何设计?
京东科大讯飞人工智能专业服务电商问题拆解技术原理
考察说明
考察对 GRPO 训练流程中奖励信号设计原则与实现方式的理解
回答思路
- 能说明 GRPO 中奖励来源:基于规则或学习到的奖励模型
- 能区分过程奖励与结果奖励及其适用场景
- 能讨论奖励归一化/基线处理以稳定训练
- 能结合具体任务说明奖励设计细节
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。