数据岗位面试题 · 方案权衡
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 889 道 · 更新 2026-08-05
筛选题目已选:方案权衡
考察点
技术栈
第 241 题讲下XGBoost算法的优缺点,以及为何要二阶泰勒展开 考察对XGBoost算法原理、工程特性及数学推导的理解深度第 242 题数据库中什么样的列适合建立索引?请结合具体场景说明。 考察索引列选择的判断能力和实际落地经验第 243 题在实际项目中,你会什么情况下使用逻辑回归,什么情况下使用随机森林? 考察结合业务需求和数据特点进行模型选型的能力第 244 题操作系统如何调度线程和进程的运行? 考察对CPU调度时机、策略和底层机制的理解第 245 题对于持续追加写入的大规模数据集,应该写入单个磁盘文件还是拆分为多个文件?请谈谈你的设计考虑。 考察大规模数据落盘方案在并发、故障恢复与维护性上的权衡第 246 题请介绍数据仓库分层设计的思路,并结合你的实习经历说明分层带来的实际价值。 考察对数据仓库分层原理的理解及结合真实项目经验的应用能力第 247 题设计一个提升复购率的方案,你会如何权衡短期见效策略(如定向发券)与长期策略(如会员积分体系)?请用数据指标说明优先级理由。 考察候选人基于数据指标进行商业策略优先级权衡的能力第 248 题请描述决策树剪枝的完整流程,并说明预剪枝与后剪枝的区别。 考察对决策树剪枝方法、流程及两种策略差异的理解第 249 题数仓建模了解哪些?星形模型和雪花模型的区别和适用场景是什么? 考察数仓建模基础、模型比较与场景判断能力第 250 题Flink 和 Spark 在实时处理方面哪个更好? 考察对两类流式计算引擎原理差异的理解及选型依据第 251 题Spark和MapReduce最大的区别是什么? 考察对两大分布式计算框架核心差异的理解与概括能力第 252 题在特征工程中,处理异常值和缺失值有哪些常用方法? 考察特征工程中数据清洗的基础方法掌握第 253 题机器学习中L1、L2正则化是如何让模型变得稀疏的?请说明其原理。 考察对L1与L2正则化原理及稀疏性机制的理解第 254 题请介绍数据仓库建模的核心理念与常用方法,并说明它们各自适用的场景。 考察对数仓建模核心思想、分层思路和常用建模方法(范式建模、维度建模等)的理解及应用能力第 255 题数据集市、数据仓库和数据湖有什么区别? 考察对三类数据架构的核心差异、适用场景和演进关系的理解第 256 题你是怎么在开发中保证数据的一致性和完整性的 考察对数据一致性、完整性保障手段的理解与实践第 257 题MySQL 的索引默认使用什么数据结构?为什么选择这种结构? 考察对 MySQL 索引底层数据结构的理解及选型理由第 258 题请介绍数据仓库分层设计,并说明每层的职责与典型内容。 考察对数据仓库分层架构的理解及各层功能定位第 259 题如何确保消息处理具备精确一次(exactly-once)语义? 考察对精确一次语义的理解及其实践方法与权衡第 260 题请解释星型模型和雪花模型的区别及其适用场景。 考察数据仓库建模中的维度建模基础概念理解