飞猪面试题更新 2026-08-05

DeepSeek相关技术要点:请说明MLA(多头潜在注意力)的原理,以及GRPO中优势函数的计算方式。

飞猪人工智能电商持续改进技术原理技术选型

考察说明

考察对前沿大模型架构和强化学习算法的深入理解

回答思路

  1. 解释MLA通过低秩压缩和联合投影减少KV缓存的核心思想
  2. 说明GRPO优势函数基于组内相对奖励归一化的计算方式
  3. 能分析两者在训练效率或推理效率上的实际收益