后端岗位面试题 · 技术原理 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 216 道 · 更新 2026-08-05
筛选题目已选:技术原理 · tech:apache-spark
考察点
技术栈
第 181 题请介绍一下 Spark 的核心组件和运行机制。 考察对 Spark 基础架构和运行流程的理解第 182 题请介绍 Spark 中常见的 Join 类型及其适用场景。 考察对 Spark Join 实现原理、代价模型和场景选择的理解第 183 题Spark的stage是怎么划分的? 考察对Spark任务调度中stage划分原理的理解第 184 题什么是大数据与数据库的区别? 考察对大数据概念与传统数据库核心差异的理解第 185 题Spark Shuffle过程中有sort和没有sort的区别? 考察Spark Shuffle实现原理及排序优化对性能与语义的影响第 186 题在 Spark SQL 中,如何通过查看 DAG 图来优化 SQL 执行或判断 SQL 改写是否正确? 考察对 Spark DAG 图的理解及基于 DAG 分析的 SQL 优化能力第 187 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景第 188 题请谈谈你理解的数据开发岗位通常需要掌握哪些技术栈,并说明这些技术各自在数据开发中的用途。 考察对数据开发技术栈的整体认知和分类组织能力第 189 题请对比Spark和Hive的区别。 考察对两种大数据计算模型差异的理解第 190 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解第 191 题对于非结构化数据,大数据技术如何处理? 考察对非结构化数据在大数据体系中的存储、处理与分析路径的理解第 192 题请解释 Spark 中 shuffle read 数据量的含义及其对作业性能的影响。 考察对 Spark shuffle 阶段数据读取机制的理解第 193 题Spark on YARN两种提交模式的区别 考察对YARN集群模式下Spark执行架构与资源隔离机制的理解第 194 题RDD、DataFrame和Dataset的区别是什么? 考察对Spark三种数据抽象在类型安全、性能与编程模型上的理解第 195 题请介绍 Spark 中有哪些 Shuffle 机制,并说明不同场景下如何选择合适的 Shuffle 实现。 考察对 Spark Shuffle 演进、原理及场景选型的理解第 196 题在 Spark 中,广播变量(Broadcast Variable)的广播过程是怎样的? 考察 Spark 广播变量的内部机制、内存管理及适用场景第 197 题请谈谈你对大数据相关技术的了解,包括你熟悉的大数据组件或框架。 考察候选人对大数据技术的知识储备和实际使用经验第 198 题Spark调优你做过哪些? 考察Spark性能调优的实际经验与系统性第 199 题请解释Spark SQL中的自适应查询执行(AQE)是什么,并说明其主要优化机制。 考察对Spark AQE的核心概念、触发机制与优化能力的理解第 200 题请介绍数据研发工作中通常会涉及哪些核心组件或工具。 考察对数据研发技术栈和组件的整体认知