数据岗位面试题 · 性能优化
题库中标记为“数据”的结构化面试题。
共 3928 道真题 · 当前筛选命中 514 道 · 更新 2026-08-05
筛选题目已选:性能优化
考察点
技术栈
第 21 题异步IO是什么,有哪些使用场景? 考察对异步IO概念的理解及其典型应用场景第 22 题同时计算用户14和30天的留存率,要求仅连接一次数据库,你会怎么做? 考察数据计算、SQL优化与连接复用能力第 23 题请描述MMoE模型的完整训练流程,并说明如何确定专家数量。 考察MMoE架构理解与超参数选择能力第 24 题目标检测任务中常用的评价指标有哪些?如何理解它们? 考察目标检测评价指标的理解和应用第 25 题SQL的JOIN操作在数据量上存在哪些限制?如何理解JOIN能处理的最大数据量? 考察对数据库JOIN性能边界和资源约束的认识第 26 题HDFS中小文件比较多的话,会有什么问题? 考察对HDFS元数据管理、存储效率和任务调度瓶颈的理解第 27 题请详述 Hive 中常用的 join 方法及其适用场景。 考察对 Hive join 类型、语法和优化策略的理解第 28 题如何提升SQL执行效率? 考察SQL优化方法论、索引原理与实际调优手段第 29 题XGBoost怎么调参避免过拟合? 考察对XGBoost过拟合原因的理解及参数调优的针对性第 30 题有无了解过MySQL的性能调优? 考察MySQL性能调优的知识广度、实践深度和排查思路第 31 题请说明 Spark 能处理的数据量级范围,以及影响其处理能力的关键因素。 考察对 Spark 架构扩展性和资源模型的理解第 32 题慢SQL的处理方法 考察对慢SQL识别、定位与优化的系统性掌握第 33 题请列举常见的数据倾斜场景,并说明各自的解决方法。 考察对分布式计算中数据倾斜问题的识别与解决能力第 34 题请具体介绍一次你做过的性能优化,包括优化目标、分析方法和量化结果。 考察性能优化的完整闭环与数据驱动能力第 35 题请介绍 Spark SQL 的执行流程以及 Catalyst 优化器的作用。 考察对 Spark SQL 查询处理管道和 Catalyst 优化机制的理解第 36 题请解释 Flink 中的算子链(Operator Chaining)机制及其作用。 考察对 Flink 执行模型和性能优化机制的理解第 37 题Spark为什么快? 考察对Spark计算引擎核心优化机制的理解第 38 题请介绍一个你在数据仓库开发中写过的较复杂 SQL 任务,并说明你的实现思路。 考察复杂 SQL 的拆解能力、优化意识与业务理解第 39 题请谈谈你对JVM的了解,包括内存结构、垃圾回收和类加载机制。 考察对JVM核心知识体系的系统性理解与表达能力第 40 题如果只有1亿个数(假设为64位整数或double),请说明如何在单机内存中高效排序? 考察对内存容量与常用排序算法的掌握