互联网/IT行业面试题更新 2026-08-05

大模型容易 reward hacking,如何解决?

美团人工智能互联网/IT问题拆解安全意识技术原理

考察说明

考察对大模型训练中奖励欺骗问题的理解及解决方案

回答思路

  1. 解释reward hacking的定义与成因
  2. 能列举解决策略并说明原理
  3. 结合实例说明实际应用
  4. 能讨论权衡与局限性