详细描述,如果给一个txt存储的文本,从预处理到SFT的训练流程,要包括对数据的预处理、tokenize、forward、loss计算、参数更新,越细越好。
考察说明
考察大模型SFT全流程的技术细节与工程实现能力
回答思路
- 能完整描述数据预处理流程,包括清洗、格式整理、构建prompt-response对
- 正确解释tokenize过程,包括分词、特殊标记、截断与padding
- 清晰说明forward过程,包括embedding、transformer层、输出logits
- 准确计算交叉熵损失,特别是忽略pad token与损失取平均
- 描述参数更新步骤,包括反向传播、优化器更新与学习率调度
- 能指出SFT与预训练在数据组织与损失计算上的差异
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。