AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
登录
登录
AI 简历
简历模板
简历范文
模拟面试
校招
求职攻略
关于我们
我要招人
首页
面试题库
人工智能面试题
为什么强化学习训练会存在不稳定的问题?
人工智能面试题
更新 2026-08-05
为什么强化学习训练会存在不稳定的问题?
京东
人工智能
电商
风险判断
技术原理
考察说明
考察对强化学习训练不稳定性原因的理解
回答思路
能指出奖励信号稀疏或高方差导致梯度估计不稳定
能说明策略与环境交互造成数据非独立同分布、样本相关性强
能提及目标网络、经验回放等缓解机制
能联系不收敛、崩溃等典型现象
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。
开始模拟面试
登录查看答题指导
换一题
上一题
请介绍你最近阅读的一篇技术论文,以及它如何影响你的工作或思考。
下一题
给定正整数 N,求一个非负整数连续序列,使其和等于 N,且序列长度不小于 L,输出满足条件的最小长度,若无解则说明。请解释算法思路并给出代码实现。
本题还出现在
电商行业面试题
京东面试题