Decoder-only模型在推理时,预测第i+1个token时,输入用的是第i个token的one-hot还是概率分布?为什么?
考察说明
考察对自回归模型推理输入本质的理解,区分训练与推理阶段
回答思路
- 明确推理时输入的是前一个token的one-hot向量(即实际采样或argmax得到的token嵌入)
- 解释原因:自回归生成需要精确、确定的历史token,而非概率混合
- 对比训练阶段使用teacher forcing的真值token嵌入,说明差异
- 能提到采样策略如greedy或top-p对输入的影响
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。