人工智能面试题更新 2026-08-05

请列举 RAG 流程中常用的 Embedding Model 嵌入模型,并说明它们各自的特点或适用场景。

人工智能技术原理技术选型方案权衡RAG

考察说明

考查候选人对 RAG 中嵌入模型选型的了解,包括常用模型、特点与适用场景。

回答思路

  1. 【回答框架 1】嵌入模型用于将文本转换为向量,以便在向量数据库中检索。常用模型包括 OpenAI 的 text-embedding-ada-002、text-embedding-3-small/large,BGE 系列(如 bge-large-zh),M3E,以及开源的 sentence-transformers 模型。
  2. 【回答框架 2】不同模型在语言支持、维度、效果、成本上有差异。中文场景常选 BGE 或 M3E,英文场景常用 OpenAI 或 sentence-transformers;需根据数据规模、语言、延迟和预算选择。
  3. 【回答框架 3】实际选型需评估检索效果、向量维度对存储和性能的影响,以及模型部署成本。通常需要在大规模数据集上测试召回率和精度。
  4. 【回答框架 4】可考虑微调嵌入模型或使用领域预训练模型提升效果,但需注意模型更新和维护成本。
  5. 【关键点 1】常用嵌入模型包括 OpenAI text-embedding-ada-002、BGE 系列、M3E 和 sentence-transformers。
  6. 【关键点 2】中文场景常选 BGE 或 M3E,英文场景多用 OpenAI 或 sentence-transformers。
  7. 【关键点 3】选型需权衡效果、维度、成本与延迟,并基于实际数据评测。
  8. 【易错点 1】避免忽视不同模型的语言支持差异,可能导致检索效果不佳。
  9. 【易错点 2】不要仅看模型名,应关注维度、上下文长度和文档大小限制。