后端岗位面试题 · 问题排查 · tech:apache-spark

题库中标记为“后端”的结构化面试题。

89928 道真题 · 当前筛选命中 31 · 更新 2026-08-05

筛选题目已选:问题排查 · tech:apache-spark
第 1 题在 Spark 中,你遇到过数据倾斜问题吗?如何定位和解决? 考察数据倾斜的定位能力与解决方案的掌握性能优化问题拆解问题排查Apache Spark第 2 题自定义 UDF 怎么实现?比如在 Hive 或Spark 里,具体步骤是啥,有没有踩过坑 考察对 Hive/Spark 自定义 UDF 开发流程、生命周期和踩坑点的理解编码实现技术原理问题排查Apache HiveApache Spark第 3 题Spark的数据倾斜体现在哪些方面,以及如何解决? 考察对Spark数据倾斜的识别能力和实际调优手段性能优化技术原理问题排查Apache Spark第 4 题平时工作中有遇到任务产出比较慢、数据倾斜的问题吗?是怎么解决的? 考察大数据任务性能问题排查与数据倾斜解决能力性能优化方案权衡问题排查Apache Spark第 5 题Spark什么情况会写入磁盘? 考察Spark执行过程中的磁盘写入触发条件与内存管理机制技术原理问题排查Apache Spark第 6 题Spark你知道怎么用日志和UI来排查数据倾斜问题吗 考察使用日志与Spark UI定位数据倾斜问题的实践能力性能优化技术原理问题排查Apache Spark第 7 题请介绍Spark UI各主要界面的作用,以及你如何理解其中核心指标的含义? 考察对Spark运行时观测界面及关键性能指标的理解性能优化技术原理问题排查Apache Spark第 8 题Spark数据倾斜的解决方法? 考察对Spark数据倾斜成因的理解及系统性调优方案技术原理方案权衡问题排查Apache Spark第 9 题请解释数据倾斜的概念,并给出常见的解决方法。 考察分布式数据处理中对数据倾斜问题的理解及应对策略性能优化技术原理问题排查Apache HiveApache SparkMapReduce第 10 题Spark为什么会存在Shuffle? 考察对Spark分布式计算中数据重分布机制的理解技术原理问题排查Apache Spark第 11 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路性能优化风险判断问题排查Apache Spark第 12 题数据倾斜怎么排查,如何解决? 考察对分布式计算中数据倾斜问题的识别、定位与处理能力风险判断技术原理问题排查Apache HiveApache Spark第 13 题Spark UI 怎么看,关注哪些点去判断数据倾斜? 考察对 Spark UI 的理解、数据倾斜的症状识别与排查路径数据驱动技术原理问题排查Apache Spark第 14 题Flink 与 Spark 的容错机制和故障恢复机制有哪些异同? 考察对两种主流流批计算引擎容错设计的理解与对比技术原理方案权衡问题排查Apache FlinkApache Spark第 15 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略性能优化技术原理问题排查Apache Spark第 16 题Spark如何进行数据倾斜的优化? 考察对Spark数据倾斜问题的识别、定位和常见优化手段的理解性能优化技术原理问题排查Apache Spark第 17 题请结合一个实际项目,谈谈你在 Spark 任务中遇到数据倾斜时的处理思路。 考察数据倾斜的识别、定位和解决方案设计能力性能优化技术原理问题排查Apache Spark第 18 题请列举并解释Spark作业中常见的内存问题,以及如何定位和解决这些问题? 考察对Spark内存模型、常见OOM场景及调优手段的理解性能优化技术原理问题排查Apache Spark第 19 题请分享你在使用或研究 Spark 过程中遇到的一个较难解决的问题,以及你是如何解决的。 考察候选人基于真实项目经验的 Spark 问题排查与解决能力项目复盘技术原理问题排查Apache Spark第 20 题如果通过参数调优无法解决数据倾斜,还有哪些其他方法可以尝试? 考察对数据倾斜问题的系统性理解和多元解决方案的掌握技术原理方案权衡问题排查Apache Spark