后端岗位面试题 · 性能优化 · Apache Spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 53 道 · 更新 2026-08-05
筛选题目已选:性能优化 · Apache Spark
考察点
技术栈
第 1 题在 Spark 中,你遇到过数据倾斜问题吗?如何定位和解决? 考察数据倾斜的定位能力与解决方案的掌握第 2 题如何优化实际 Spark 任务?请举例(如数据倾斜、Shuffle 优化)。 考察对 Spark 任务性能瓶颈的识别与常见优化手段的实际运用能力第 3 题说一下 Shuffle 和宽窄依赖,怎么可以避免 Shuffle? 考察 Spark 数据分区机制与性能优化意识第 4 题Spark的数据倾斜体现在哪些方面,以及如何解决? 考察对Spark数据倾斜的识别能力和实际调优手段第 5 题平时工作中有遇到任务产出比较慢、数据倾斜的问题吗?是怎么解决的? 考察大数据任务性能问题排查与数据倾斜解决能力第 6 题Hive 查询为什么走 Spark 引擎通常比走 MR 更好?如果只能走 MR,可以从哪些方向优化? 考察对两种计算引擎差异的理解及 MR 场景下的优化能力第 7 题Spark你知道怎么用日志和UI来排查数据倾斜问题吗 考察使用日志与Spark UI定位数据倾斜问题的实践能力第 8 题请介绍Spark UI各主要界面的作用,以及你如何理解其中核心指标的含义? 考察对Spark运行时观测界面及关键性能指标的理解第 9 题Spark 的 count distinct 是怎么做的? 考察对 Spark 分布式去重计数底层实现的理解第 10 题请解释数据倾斜的概念,并给出常见的解决方法。 考察分布式数据处理中对数据倾斜问题的理解及应对策略第 11 题执行一个PySpark作业,它的底层操作是怎么样的? 考察对PySpark执行模型、任务调度和底层计算原理的理解第 12 题请列举Spark中涉及shuffle的操作算子,并说明它们各自的特点。 考察对Apache Spark shuffle机制及相关算子的理解第 13 题Spark参数调优做了些什么? 考察对Spark核心参数的理解和实际调优经验第 14 题Map Join 中如果小表太大导致内存占用过高甚至内存溢出,你会怎么处理? 考察对 Map Join 原理、内存模型及优化策略的理解第 15 题Spark小文件怎么处理? 考察对Spark小文件问题的理解及优化手段第 16 题请解释 Spark 中 local read 数据量的含义及其在任务执行中的影响。 考察对 Spark 任务读取本地数据的理解及对性能的影响第 17 题请介绍 Spark 中的 Shuffle 机制及其工作原理。 考察对 Spark Shuffle 原理、过程和相关配置的理解第 18 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路第 19 题请说明 Spark 能处理的数据量级范围,以及影响其处理能力的关键因素。 考察对 Spark 架构扩展性和资源模型的理解第 20 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解