说一下ChatGLM或LLaMA与传统Transformer结构的区别,有哪些改动,以及可以借鉴的地方?主要从模型结构、Layer Norm、激活方式、位置编码回答。
考察说明
考察对主流大模型架构改进点的理解深度与迁移能力
回答思路
- 能准确描述ChatGLM与LLaMA在模型结构上的差异,如层数、宽度、注意力变体
- 能说明LayerNorm从Post-LN到Pre-LN及RMSNorm的变化及其原因
- 能解释激活函数如GELU、SwiGLU的差异及对训练稳定性的影响
- 能说明位置编码如ALiBi、RoPE的原理与优势
- 能提出对大模型预训练或微调工程的可借鉴之处
本题已收录答题指导
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。