后端岗位面试题 · 方案权衡 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 72 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · tech:apache-spark
考察点
技术栈
第 61 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解第 62 题对于非结构化数据,大数据技术如何处理? 考察对非结构化数据在大数据体系中的存储、处理与分析路径的理解第 63 题Spark on YARN两种提交模式的区别 考察对YARN集群模式下Spark执行架构与资源隔离机制的理解第 64 题RDD、DataFrame和Dataset的区别是什么? 考察对Spark三种数据抽象在类型安全、性能与编程模型上的理解第 65 题请介绍 Spark 中有哪些 Shuffle 机制,并说明不同场景下如何选择合适的 Shuffle 实现。 考察对 Spark Shuffle 演进、原理及场景选型的理解第 66 题请解释Spark SQL中的自适应查询执行(AQE)是什么,并说明其主要优化机制。 考察对Spark AQE的核心概念、触发机制与优化能力的理解第 67 题SparkSQL 做 Join 的时候有哪些 Join 算法? 考察对 Spark 各 Join 算法原理、适用场景和参数选择的掌握第 68 题请介绍 Spark 中内部表和外部表的区别。 考察对 Spark 表元数据与数据存储管理机制的理解第 69 题请解释 Hive on MR 与 Hive on Spark 的执行引擎差异,以及各自适用的场景。 考察对 Hive 执行引擎原理的理解及选型能力第 70 题MapReduce和Spark 到底差在哪儿?适用场景这些都得对比着说 考察对分布式计算框架的核心差异、适用场景及技术选型的理解第 71 题请介绍一下 AQE(自适应查询执行)的核心特性。 考察对 Spark AQE 核心特性的理解与适用场景第 72 题请分析数据倾斜的常见成因,并说明有哪些解决方案。 考察对分布式数据处理中数据倾斜问题的理解深度与解决能力