请阐述 BERT 模型的结构组成及其典型使用场景。
考察说明
考查对 BERT 模型架构理解及其应用场景掌握程度。
回答思路
- 【回答框架 1】BERT 是基于 Transformer 编码器的预训练语言模型。它采用双向编码方式,通过掩码语言模型和下一句预测两个任务在大规模语料上预训练。其主要结构包括多层双向 Transformer 编码器、嵌入层(词嵌入、位置嵌入、段落嵌入)以及输出层。
- 【回答框架 2】模型核心机制是双向上下文表示。传统语言模型从单一方向建模,而 BERT 利用掩码语言模型随机掩盖输入中部分词以预测它们,从而同时利用左右两侧上下文信息。此外,下一句预测任务让模型学习句子间关系,增强对句子级任务的理解。
- 【回答框架 3】应用场景广泛。在自然语言理解任务中,如文本分类、情感分析、命名实体识别、问答系统等,BERT 通过微调可达到当时最优性能。它还可用于句子对任务(如推理、语义相似度)以及生成任务的前置编码器。
- 【回答框架 4】使用流程通常包括预训练加微调两阶段:先在无标注大语料上训练通用语言表示,再针对下游任务在较小标注数据上微调模型参数,适配具体任务需求。
- 【关键点 1】BERT 由多层双向 Transformer 编码器构成
- 【关键点 2】采用掩码语言模型和下一句预测进行预训练
- 【关键点 3】通过微调适应各类自然语言理解任务
- 【关键点 4】预训练加微调是其主要应用范式
- 【易错点 1】容易出现将 BERT 当作普通单向模型的误用
- 【易错点 2】微调时忽略学习率等超参数导致性能下降
- 【易错点 3】预训练与微调数据分布不一致导致效果不佳