后端岗位面试题 · 技术原理 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 216 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 101 题请解释 Spark 中 Job 和 Stage 的概念及其关系。 考察对 Spark 作业分解与执行流程的理解第 102 题Spark是完全基于内存吗? 考察对Spark内存计算模型和存储层原理的理解第 103 题Spark合并小文件怎么做的,落HDFS之前合并还是之后合并? 考察Spark写HDFS时小文件问题的处理策略与时机选择第 104 题请比较 RDD 与 MapReduce 的优缺点。 考察对 RDD 与 MapReduce 在计算模型、性能与容错方面的理解第 105 题Spark常见的Shuffle策略有哪些?这些不同的策略分别在哪些项目中用到? 考察对Spark Shuffle机制的理解及其在不同业务场景下的应用第 106 题什么是 Spark 中的宽依赖和窄依赖?它们分别起到什么作用? 考察对 Spark 依赖关系原理及其对任务调度的影响第 107 题reduceByKey() 和 groupByKey() 的区别是什么? 考察对 Spark 算子执行语义和数据混洗性能的理解第 108 题请解释Spark Shuffle的原理及主要过程。 考察对Spark Shuffle机制、数据倾斜和性能影响的理解第 109 题Spark中的Task、Stage和Job之间是什么关系? 考察Spark执行模型的核心概念及其层次关系第 110 题Spark RDD和DataFrame的区别 考察对Spark核心数据抽象的理解及使用场景判断第 111 题讲一讲你对分布式数据处理框架(如 Hadoop、Spark 等)的理解。 考察对分布式数据处理框架核心概念、架构与适用场景的掌握第 112 题Spark调优中,代码层面有哪些手段? 考察对Spark应用代码级优化的理解与实践第 113 题请介绍你最熟悉的大数据框架 Spark,包括它的核心架构、常用组件及其应用场景。 考察对 Spark 架构理解、组件掌握及实际应用能力第 114 题请结合一个实际项目,谈谈你在 Spark 任务中遇到数据倾斜时的处理思路。 考察数据倾斜的识别、定位和解决方案设计能力第 115 题请列举并解释Spark作业中常见的内存问题,以及如何定位和解决这些问题? 考察对Spark内存模型、常见OOM场景及调优手段的理解第 116 题你了解Spark的宽窄依赖吗? 考察Spark任务划分与依赖关系的基本原理第 117 题除了join,还有哪些操作会引起Shuffle? 考察对分布式计算中Shuffle触发机制的掌握第 118 题Spark 3.0 引入了哪些新的核心机制或原理? 考察对 Spark 新版本技术演进的了解程度第 119 题请解释Spark中的宽依赖和窄依赖,并描述一个典型的DAG执行流程。 考察对Spark任务调度和依赖关系的理解第 120 题请描述 Spark 中 Shuffle 的原理与执行流程。 考察对 Spark Shuffle 底层机制、磁盘与网络开销的掌握