电子/半导体行业面试题更新 2026-08-05

请解释 DeepSeek 模型中 MoE(混合专家)架构和 GRPO(组相对策略优化)的基本原理及其在训练中的作用。

vivo人工智能电子/半导体问题拆解技术原理

考察说明

考察对大规模预训练模型关键架构与强化学习算法的理解

回答思路

  1. 准确解释 MoE 的稀疏激活与路由器机制
  2. 说明 GRPO 如何组内相对奖励更新策略
  3. 关联两者在 DeepSeek 训练中的互补作用