后端岗位面试题 · 技术原理 · tech:apache-spark

题库中标记为“后端”的结构化面试题。

89928 道真题 · 当前筛选命中 216 · 更新 2026-08-05

筛选题目已选:技术原理 · tech:apache-spark
第 21 题请介绍大数据治理的一般方法,并说明你熟悉的大数据组件及其核心原理。 考察大数据治理思路与核心技术组件的原理掌握问题拆解技术原理技术选型Apache FlinkApache SparkHDFS第 22 题Spark什么情况会写入磁盘? 考察Spark执行过程中的磁盘写入触发条件与内存管理机制技术原理问题排查Apache Spark第 23 题Presto和Spark的区别是什么? 考察对两种大数据计算引擎的架构、适用场景和性能特性的理解技术原理技术选型方案权衡Apache SparkPresto第 24 题Hive 查询为什么走 Spark 引擎通常比走 MR 更好?如果只能走 MR,可以从哪些方向优化? 考察对两种计算引擎差异的理解及 MR 场景下的优化能力性能优化技术原理方案权衡Apache HiveApache SparkMapReduce第 25 题请介绍Spark中shuffle的几种实现方式,并简要说明sort-based shuffle的特点。 考察对Spark shuffle机制及其演进的理解技术原理方案权衡Apache Spark第 26 题Hive on Spark和Spark on Hive的区别是什么? 考察对Hive与Spark集成方案的理解与架构辨析技术原理技术选型Apache HiveApache Spark第 27 题在 Spark 中,你如何设置 executor 的 core 数量?为什么通常设置为 2? 考察对 Spark 资源分配与并行度权衡的理解技术原理方案权衡Apache Spark第 28 题Spark共享变量的使用条件? 考察对Spark广播变量和累加器的使用场景与限制的理解技术原理技术选型Apache Spark第 29 题在 Spark 中求两数之和会用到哪些算子? 考察对 Spark 数据处理算子及并行计算模型的理解编码实现技术原理Apache Spark第 30 题请介绍你最熟悉的一项大数据组件,并说明你对其技术原理的理解。 考察候选人大数据组件的深度理解与专业表达自我认知技术原理技术选型Apache FlinkApache Spark第 31 题请解释 Spark 中的 semi join,它用于解决什么问题? 考察对 Spark SQL 语义及半连接(semi join)用途的理解业务理解技术原理Apache Spark第 32 题请介绍 Spark 的整体架构及其核心组件。 考察对 Spark 分布式计算架构的理解深度系统设计技术原理Apache Spark第 33 题MapReduce与Spark的区别是什么? 考察候选人是否理解两种大数据计算框架的架构差异、适用场景与性能特点技术原理方案权衡Apache SparkMapReduce第 34 题你如何理解Hadoop生态系统?请列举其主要组件及其作用,并说明它们之间的协作关系。 考察对Hadoop生态的核心组件、职责划分及整体架构的理解深度系统设计技术原理Apache HiveApache SparkHDFS第 35 题请介绍 Spark 的 TaskScheduler 调度算法。 考察对 Spark 任务调度原理的理解及对常用调度算法的掌握程度技术原理方案权衡Apache Spark第 36 题Spark你知道怎么用日志和UI来排查数据倾斜问题吗 考察使用日志与Spark UI定位数据倾斜问题的实践能力性能优化技术原理问题排查Apache Spark第 37 题请介绍Spark UI各主要界面的作用,以及你如何理解其中核心指标的含义? 考察对Spark运行时观测界面及关键性能指标的理解性能优化技术原理问题排查Apache Spark第 38 题本科大数据专业主要学习了哪些核心课程和技能? 考察候选人专业知识体系与自我梳理能力持续改进自我认知技术原理Apache HadoopApache SparkSQL第 39 题Spark 的 count distinct 是怎么做的? 考察对 Spark 分布式去重计数底层实现的理解性能优化技术原理Apache Spark第 40 题Spark数据倾斜的解决方法? 考察对Spark数据倾斜成因的理解及系统性调优方案技术原理方案权衡问题排查Apache Spark