互联网/IT行业面试题更新 2026-08-05
在大型语言模型的预训练阶段,数据收集通常包含哪些关键步骤?请说明主要的数据来源、清洗和去重方法。
贝壳找房人工智能互联网/IT性能优化问题拆解技术原理
考察说明
考察对预训练数据收集全流程的理解,包括来源、清洗、去重及质量考量
回答思路
- 列举主要数据来源(网页、书籍、代码、学术等)
- 说明数据清洗流程(HTML去除、噪声过滤、语言识别)
- 提及去重方法(精确去重、近似去重MinHash)
- 讨论数据质量与多样性平衡
- 提及数据配比和规模影响
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。