后端岗位面试题 · 问题拆解 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 48 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · tech:apache-spark
考察点
技术栈
第 21 题请解释Spark Shuffle的原理及主要过程。 考察对Spark Shuffle机制、数据倾斜和性能影响的理解第 22 题Spark中的Task、Stage和Job之间是什么关系? 考察Spark执行模型的核心概念及其层次关系第 23 题请解释Spark中的宽依赖和窄依赖,并描述一个典型的DAG执行流程。 考察对Spark任务调度和依赖关系的理解第 24 题请描述MapReduce或Spark中常见的Shuffle流程,并说明其关键环节。 考察对分布式计算框架中Shuffle机制的理解第 25 题在Hive中指定Spark作为计算引擎时,任务调度是如何进行的?请描述从提交Hive查询到Spark任务执行的完整调度链路。 考察对Hive on Spark架构及Spark任务调度机制的理解第 26 题请解释 Spark 中宽依赖和窄依赖的区别。 考察对 Spark 任务调度与数据分区理解第 27 题请解释Spark中RDD与Partition的关系,并说明Partition数如何影响任务执行。 考察对Spark RDD分区机制及并行度影响的理解第 28 题请解释 Spark RDD 的容错机制,并说明它是如何保证数据可靠性的? 考察对 Spark RDD 血缘关系和容错恢复原理的理解第 29 题在 Spark 中,哪些算子会触发宽依赖?请举例说明。 考察对 Spark 宽依赖算子及其数据 shuffle 机制的理解第 30 题Spark stage怎么划分 考察Spark作业中stage划分的原理和宽度依赖理解第 31 题宽窄依赖,算子中哪个是宽依赖算子?哪个是窄依赖算子?简单举几个例子。 考察对宽窄依赖概念的理解及算子分类能力第 32 题请描述Spark应用通过jar包提交后,从提交命令到任务执行完成的完整过程。 考察对Spark任务提交、调度与执行生命周期的理解第 33 题Spark架构介绍一下,里面的进程? 考察Spark集群架构核心组件、进程职责与数据流转第 34 题DataFrame和RDD有什么区别? 考察对Spark核心数据抽象的理解及适用场景第 35 题以 Spark 为例,如何确定 core 和内存等资源参数的合适值? 考察对 Spark 资源调优原理和计算方法的理解第 36 题在大数据处理中,数据倾斜是如何产生的,有哪些常见的解决思路? 考察对数据倾斜问题的识别、原因分析和解决策略第 37 题请描述 Spark 中从提交作业到任务执行的任务调度流程。 考察对 Spark 作业调度、DAG 构建和任务分配机制的理解第 38 题请描述Spark的Shuffle过程及其内部实现机制。 考察对Spark核心执行阶段的理解与细节把控第 39 题请介绍一下 Spark 的核心组件和运行机制。 考察对 Spark 基础架构和运行流程的理解第 40 题Spark的stage是怎么划分的? 考察对Spark任务调度中stage划分原理的理解