互联网/IT行业面试题更新 2026-08-05

在大型语言模型的预训练阶段,数据收集通常包含哪些关键步骤?请说明主要的数据来源、清洗和去重方法。

贝壳找房人工智能互联网/IT性能优化问题拆解技术原理

考察说明

考察对预训练数据收集全流程的理解,包括来源、清洗、去重及质量考量

回答思路

  1. 列举主要数据来源(网页、书籍、代码、学术等)
  2. 说明数据清洗流程(HTML去除、噪声过滤、语言识别)
  3. 提及去重方法(精确去重、近似去重MinHash)
  4. 讨论数据质量与多样性平衡
  5. 提及数据配比和规模影响
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。