后端岗位面试题 · 技术原理 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 216 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 141 题Spark宽窄依赖怎么划分? 考察对Spark RDD依赖类型及其计算特性的理解第 142 题Hive底层使用的是什么技术或框架? 考察对Hive底层实现原理的了解第 143 题Spark和Flink有什么区别? 考察对两种主流大数据计算引擎的理解与选型判断第 144 题请介绍Spark的内存管理机制,包括执行内存与存储内存的划分及动态调整策略。 考察对Spark内存管理核心概念的理解与表述能力第 145 题在Spark中,shuffle的数据传输是采用推模型还是拉模型?请说明原因。 考察对Spark shuffle机制的理解,特别是数据拉取模型的设计动机第 146 题介绍一下Spark问题定位的流程? 考察Spark任务故障排查的系统性方法与核心工具链掌握第 147 题介绍一下Spark的内存模型。 考察对Spark内存管理机制的理解,包括Executor内内存区域的划分与配置第 148 题请详细介绍一下你在Spark项目中的具体工作,包括你负责的模块、技术难点和最终的成果。 考察候选人在Spark项目中的实际职责、技术深度和问题解决能力第 149 题Spark stage怎么划分 考察Spark作业中stage划分的原理和宽度依赖理解第 150 题请说明 Hadoop 与 Spark、Flink 的主要区别,以及离线计算与实时计算在架构和实现上的差异。 考察对大数据生态中批处理与流处理框架的认知及架构取舍第 151 题宽窄依赖,算子中哪个是宽依赖算子?哪个是窄依赖算子?简单举几个例子。 考察对宽窄依赖概念的理解及算子分类能力第 152 题你知道Spark的宽窄依赖吗?有没有把宽依赖转化为窄依赖的例子? 考察对Spark任务依赖关系的理解及实际优化能力第 153 题Application、Job、Stage、Task在Spark中有什么区别? 考察Spark作业调度层级概念的理解第 154 题请描述Spark应用通过jar包提交后,从提交命令到任务执行完成的完整过程。 考察对Spark任务提交、调度与执行生命周期的理解第 155 题Spark和Hive对数据倾斜的处理有哪些异同? 考察对大数据引擎数据倾斜问题的理解与方案对比第 156 题Spark架构介绍一下,里面的进程? 考察Spark集群架构核心组件、进程职责与数据流转第 157 题请解释一下 Map Join 的工作原理及其适用场景。 考察对分布式计算中优化手段的理解,特别是 Map Join 的执行机制与适用条件第 158 题DataFrame和RDD有什么区别? 考察对Spark核心数据抽象的理解及适用场景第 159 题请介绍Spark中常见的4种Join优化方式,并说明各自适用的场景。 考察Spark Join优化原理及场景适配能力第 160 题请解释 Spark 中 shuffle write 数据量的含义及其与 shuffle read 的关系。 考察对 Spark shuffle 写阶段机制与整体数据流理解