后端岗位面试题 · 技术原理 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 216 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 21 题请介绍大数据治理的一般方法,并说明你熟悉的大数据组件及其核心原理。 考察大数据治理思路与核心技术组件的原理掌握第 22 题Spark什么情况会写入磁盘? 考察Spark执行过程中的磁盘写入触发条件与内存管理机制第 23 题Presto和Spark的区别是什么? 考察对两种大数据计算引擎的架构、适用场景和性能特性的理解第 24 题Hive 查询为什么走 Spark 引擎通常比走 MR 更好?如果只能走 MR,可以从哪些方向优化? 考察对两种计算引擎差异的理解及 MR 场景下的优化能力第 25 题请介绍Spark中shuffle的几种实现方式,并简要说明sort-based shuffle的特点。 考察对Spark shuffle机制及其演进的理解第 26 题Hive on Spark和Spark on Hive的区别是什么? 考察对Hive与Spark集成方案的理解与架构辨析第 27 题在 Spark 中,你如何设置 executor 的 core 数量?为什么通常设置为 2? 考察对 Spark 资源分配与并行度权衡的理解第 28 题Spark共享变量的使用条件? 考察对Spark广播变量和累加器的使用场景与限制的理解第 29 题在 Spark 中求两数之和会用到哪些算子? 考察对 Spark 数据处理算子及并行计算模型的理解第 30 题请介绍你最熟悉的一项大数据组件,并说明你对其技术原理的理解。 考察候选人大数据组件的深度理解与专业表达第 31 题请解释 Spark 中的 semi join,它用于解决什么问题? 考察对 Spark SQL 语义及半连接(semi join)用途的理解第 32 题请介绍 Spark 的整体架构及其核心组件。 考察对 Spark 分布式计算架构的理解深度第 33 题MapReduce与Spark的区别是什么? 考察候选人是否理解两种大数据计算框架的架构差异、适用场景与性能特点第 34 题你如何理解Hadoop生态系统?请列举其主要组件及其作用,并说明它们之间的协作关系。 考察对Hadoop生态的核心组件、职责划分及整体架构的理解深度第 35 题请介绍 Spark 的 TaskScheduler 调度算法。 考察对 Spark 任务调度原理的理解及对常用调度算法的掌握程度第 36 题Spark你知道怎么用日志和UI来排查数据倾斜问题吗 考察使用日志与Spark UI定位数据倾斜问题的实践能力第 37 题请介绍Spark UI各主要界面的作用,以及你如何理解其中核心指标的含义? 考察对Spark运行时观测界面及关键性能指标的理解第 38 题本科大数据专业主要学习了哪些核心课程和技能? 考察候选人专业知识体系与自我梳理能力第 39 题Spark 的 count distinct 是怎么做的? 考察对 Spark 分布式去重计数底层实现的理解第 40 题Spark数据倾斜的解决方法? 考察对Spark数据倾斜成因的理解及系统性调优方案