从 Word2Vec 到 BERT,模型在词表示学习上有哪些关键改进?请对比两者的核心机制、上下文建模方式以及各自适用场景。
考察说明
考查对 NLP 词向量技术演进脉络的理解,以及从静态向量到动态上下文表示的核心差异。
回答思路
- 【回答框架 1】Word2Vec 是静态词嵌入,通过 skip-gram 或 CBOW 在浅层神经网络中训练得到每个词的固定向量,无法区分一词多义,如 bank 在不同语境下向量相同。
- 【回答框架 2】BERT 是预训练语言模型,基于 Transformer 编码器,通过掩码语言模型和下一句预测任务学习上下文相关的动态表示,同一词在不同句子中向量不同,能捕捉语境语义。
- 【回答框架 3】改进的本质是从无上下文到有上下文的表示:Word2Vec 只看局部窗口,BERT 利用双向注意力融合全局上下文;Word2Vec 适合作为下游模型初始化特征,BERT 可直接微调用于各类 NLP 任务。
- 【回答框架 4】适用场景上,Word2Vec 计算资源少、推理快,适合资源受限或简单基线;BERT 在需要深层语义理解的场景如问答、情感分析、命名实体识别中效果更优,但代价是更大的模型和更高延迟。
- 【关键点 1】Word2Vec 生成静态词向量,BERT 生成动态上下文向量,这是最核心的改进。
- 【关键点 2】BERT 使用 Transformer 双向注意力,建模全局上下文,优于 Word2Vec 的局部窗口。
- 【关键点 3】一词多义问题被显著缓解,动态表示可根据语境区分不同语义。
- 【关键点 4】BERT 可通过微调适配下游任务,Word2Vec 通常作为特征或初始化使用。
- 【关键点 5】Word2Vec 轻量高效,BERT 更重但效果更强,选型需权衡资源与性能。
- 【易错点 1】不要把 BERT 的向量直接当作传统词嵌入用于相似度计算,动态向量需要配合具体上下文,否则无意义。
- 【易错点 2】不要忽视 BERT 的输入限制(如最大长度 512),超长文本需要截断或分段,否则影响效果。
- 【易错点 3】不要认为 BERT 一定全面优于 Word2Vec,在简单任务或数据量小场景下,静态向量可能更适用且不易过拟合。