后端岗位面试题 · 技术原理 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 216 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 81 题Spark RDD和MapReduce的区别? 考察对Spark RDD与MapReduce核心机制差异的理解第 82 题Spark中job、stage和task分别是什么含义,它们之间有什么关系? 考察对Spark作业执行模型和任务划分机制的理解第 83 题使用Spark引擎做wordcount,基本的流程是什么? 考察Spark编程模型与基本计算流程第 84 题请介绍 Spark 的基本运行原理,包括任务提交到执行的整体流程。 考察对 Spark 分布式计算模型和调度执行流程的理解第 85 题请解释 Spark 中宽依赖与窄依赖的区别,并说明其对作业划分和优化策略的影响。 考察对 Spark 依赖类型及其在任务调度和性能优化中作用的理解第 86 题spark.sql.shuffle.partitions调节的经验,调多大合适,是否有公式 考察对Spark shuffle分区设置原理、经验值与调优方法的理解第 87 题Spark UI 怎么看,关注哪些点去判断数据倾斜? 考察对 Spark UI 的理解、数据倾斜的症状识别与排查路径第 88 题请介绍你对 Hive on Spark 的了解,包括它的基本原理和适用场景。 考察对 Hive on Spark 技术原理和适用场景的理解第 89 题Spark和Hive的区别是什么? 考察对Spark与Hive在架构、计算模型和适用场景上的理解第 90 题Spark 的体系结构中包含哪些核心组件? 考察对 Spark 核心组件及其职责的理解第 91 题请详细说明Spark中一个算子从提交到分布式执行的完整过程,包括DAG构建、任务调度和执行阶段。 考察对Spark执行引擎核心流程的理解,包括调度、执行和容错机制第 92 题请介绍你阅读 Spark 源码的经历,包括重点关注的模块和思考。 考察候选人对 Spark 源码的深入理解与抽象总结能力第 93 题请对比 MapReduce 和 Spark 在计算模型、性能与适用场景上的主要差异。 考察对经典大数据计算框架原理与选型的理解第 94 题MR和Spark的区别是什么? 考察对MapReduce与Spark核心架构、计算模型及适用场景差异的理解第 95 题Flink 与 Spark 的容错机制和故障恢复机制有哪些异同? 考察对两种主流流批计算引擎容错设计的理解与对比第 96 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 97 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力第 98 题Spark为什么比MR快? 考察对Spark和MapReduce执行引擎差异的理解及性能优化原理第 99 题请介绍 Spark 中 Shuffle 的过程及其涉及的主要组件。 考察对 Spark Shuffle 机制的理解,包括数据分区、磁盘读写和网络传输等核心环节第 100 题Spark如何进行数据倾斜的优化? 考察对Spark数据倾斜问题的识别、定位和常见优化手段的理解