后端岗位面试题 · 问题拆解 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 48 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · tech:apache-spark
考察点
技术栈
第 1 题在 Spark 中,你遇到过数据倾斜问题吗?如何定位和解决? 考察数据倾斜的定位能力与解决方案的掌握第 2 题Spark 中 Stage 是如何切分的? 考察对 Spark 作业执行模型和调度机制的理解第 3 题Spark中RDD的Task数量由什么决定? 考察对Spark任务调度与分区机制的理解第 4 题为什么选择 Spark 来处理数据?是因为非结构化数据较多吗? 考察候选人对自己技术选型背后的原因理解及对 Spark 适用场景的把握第 5 题请介绍 Spark 中常用的算子,并说明它们的作用。 考察对 Spark 核心算子的理解与应用第 6 题请介绍大数据治理的一般方法,并说明你熟悉的大数据组件及其核心原理。 考察大数据治理思路与核心技术组件的原理掌握第 7 题请设计一个方案,计算两个包含1000亿和100亿数据量的集合的交集。 考察海量数据场景下的交集计算方案设计能力第 8 题请详细介绍Spark的底层工作原理。 考察对Spark架构、执行模型和底层机制的深入理解第 9 题请说明Spark中DAG(有向无环图)是如何生成的。 考察对Spark执行计划生成机制的理解,包括RDD依赖和Stage划分第 10 题面对一万亿条用户购买记录,每行包含用户ID和购买数量,如何找出购买数量最多的三位用户?请给出你的设计思路和可能的实现方案。 考察海量数据处理中的排序与内存优化能力,以及取舍意识第 11 题请介绍Spark提交流程 考察对Spark作业从客户端到集群执行的整体流程理解第 12 题请介绍你在Spark、大模型或Elasticsearch相关项目中的一次深入技术实践,并说明你如何解决其中的核心难点。 考察候选人在大数据、大模型或搜索技术项目中的实践深度与问题解决能力第 13 题请描述 Spark 任务从提交到执行的完整流程。 考察对 Spark 作业调度、执行模型和核心组件的理解第 14 题在Spark中,为什么要有DAG图?为什么要划分阶段? 考察对Spark任务调度核心机制的理解第 15 题Spark的宽窄依赖有了解吗?Shuffle有了解吗,哪些算子会触发Shuffle? 考察Spark依赖类型与Shuffle触发机制的理解第 16 题Spark中job、stage和task分别是什么含义,它们之间有什么关系? 考察对Spark作业执行模型和任务划分机制的理解第 17 题请介绍 Spark 的基本运行原理,包括任务提交到执行的整体流程。 考察对 Spark 分布式计算模型和调度执行流程的理解第 18 题请详细说明Spark中一个算子从提交到分布式执行的完整过程,包括DAG构建、任务调度和执行阶段。 考察对Spark执行引擎核心流程的理解,包括调度、执行和容错机制第 19 题请详细说明你当前所在公司日常进行数据统计时,主要采用哪些方式?这些方式分别适用于什么场景?例如针对实时数据统计、离线批量数据统计等不同需求,会选择不同的工具或方法吗? 考察数据统计方式与场景匹配能力第 20 题请解释 Spark 中 Job 和 Stage 的概念及其关系。 考察对 Spark 作业分解与执行流程的理解