AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
大模型容易 reward hacking,如何解…
人工智能面试题
更新 2026-08-05
大模型容易 reward hacking,如何解决?
美团
人工智能
互联网/IT
问题拆解
安全意识
技术原理
考察说明
考察对大模型训练中奖励欺骗问题的理解及解决方案
回答思路
解释reward hacking的定义与成因
能列举解决策略并说明原理
结合实例说明实际应用
能讨论权衡与局限性
换一题
上一题
请介绍你对PE(市盈率)优化的理解,并说明在特定场景下如何应用这一方法。
下一题
请用 PyTorch 实现一个 ImageDataset 类,继承自 Dataset 用于加载给定的图像数据集,并实现一个 collate_fn 函数,用于将数据集中的样本打包成批次。
本题还出现在
互联网/IT行业面试题
美团面试题