人工智能面试题更新 2026-08-05

从 Word2Vec 到 BERT,模型在词表示学习上有哪些关键改进?请对比两者的核心机制、上下文建模方式以及各自适用场景。

人工智能技术原理方案权衡BERTWord2Vec

考察说明

考查对 NLP 词向量技术演进脉络的理解,以及从静态向量到动态上下文表示的核心差异。

回答思路

  1. 【回答框架 1】Word2Vec 是静态词嵌入,通过 skip-gram 或 CBOW 在浅层神经网络中训练得到每个词的固定向量,无法区分一词多义,如 bank 在不同语境下向量相同。
  2. 【回答框架 2】BERT 是预训练语言模型,基于 Transformer 编码器,通过掩码语言模型和下一句预测任务学习上下文相关的动态表示,同一词在不同句子中向量不同,能捕捉语境语义。
  3. 【回答框架 3】改进的本质是从无上下文到有上下文的表示:Word2Vec 只看局部窗口,BERT 利用双向注意力融合全局上下文;Word2Vec 适合作为下游模型初始化特征,BERT 可直接微调用于各类 NLP 任务。
  4. 【回答框架 4】适用场景上,Word2Vec 计算资源少、推理快,适合资源受限或简单基线;BERT 在需要深层语义理解的场景如问答、情感分析、命名实体识别中效果更优,但代价是更大的模型和更高延迟。
  5. 【关键点 1】Word2Vec 生成静态词向量,BERT 生成动态上下文向量,这是最核心的改进。
  6. 【关键点 2】BERT 使用 Transformer 双向注意力,建模全局上下文,优于 Word2Vec 的局部窗口。
  7. 【关键点 3】一词多义问题被显著缓解,动态表示可根据语境区分不同语义。
  8. 【关键点 4】BERT 可通过微调适配下游任务,Word2Vec 通常作为特征或初始化使用。
  9. 【关键点 5】Word2Vec 轻量高效,BERT 更重但效果更强,选型需权衡资源与性能。
  10. 【易错点 1】不要把 BERT 的向量直接当作传统词嵌入用于相似度计算,动态向量需要配合具体上下文,否则无意义。
  11. 【易错点 2】不要忽视 BERT 的输入限制(如最大长度 512),超长文本需要截断或分段,否则影响效果。
  12. 【易错点 3】不要认为 BERT 一定全面优于 Word2Vec,在简单任务或数据量小场景下,静态向量可能更适用且不易过拟合。