阿里巴巴面试题更新 2026-08-05

在使用GRPO提升大模型的Function Calling能力时,除了结果奖励(outcome reward),还可以如何设计过程奖励(process reward)?

阿里巴巴人工智能电商问题拆解技术原理方案权衡

考察说明

考察对GRPO训练中奖励模型设计,特别是过程奖励的深入理解与应用

回答思路

  1. 能解释结果奖励与过程奖励的差异及过程奖励的优势
  2. 能提出具体的过程奖励设计思路,如逐步校验参数解析、工具选择等
  3. 能结合Function Calling场景讨论过程奖励的粒度与信号来源
  4. 能考虑奖励的稀疏性和可解释性,避免过度工程化
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。