深圳虾皮信息科技有限公司面试题 · Apache Spark
深圳虾皮信息科技有限公司相关面试题,按最终去重题目聚合。
共 2768 道真题 · 当前筛选命中 27 道 · 更新 2026-08-05
筛选题目已选:Apache Spark
考察点
技术栈
第 1 题如何优化实际 Spark 任务?请举例(如数据倾斜、Shuffle 优化)。 考察对 Spark 任务性能瓶颈的识别与常见优化手段的实际运用能力第 2 题请介绍你最熟悉的一项大数据组件,并说明你对其技术原理的理解。 考察候选人大数据组件的深度理解与专业表达第 3 题Spark 的内存管理机制是怎样的? 考察对 Spark 统一内存模型及内存区域的掌握第 4 题Spark Executor 的内存分为哪几部分?请说明堆内与堆外内存的区别及应用场景。 考察对 Spark 内存模型的理解及对堆内外内存设计的掌握第 5 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路第 6 题Hive和Spark分别是什么?它们的主要用途和区别是什么? 考察对Hive和Spark基本概念、应用场景及差异的理解第 7 题请说明 Spark 能处理的数据量级范围,以及影响其处理能力的关键因素。 考察对 Spark 架构扩展性和资源模型的理解第 8 题数据倾斜怎么排查,如何解决? 考察对分布式计算中数据倾斜问题的识别、定位与处理能力第 9 题Spark中job、stage和task分别是什么含义,它们之间有什么关系? 考察对Spark作业执行模型和任务划分机制的理解第 10 题从代码到输出结果,Spark引擎做了什么? 考察对Spark作业从提交到执行的完整生命周期理解第 11 题有遇到大规模数据处理的情况吗?用过 Spark 吗? 考察大规模数据处理经验与 Spark 实际使用能力第 12 题请详细说明你当前所在公司日常进行数据统计时,主要采用哪些方式?这些方式分别适用于什么场景?例如针对实时数据统计、离线批量数据统计等不同需求,会选择不同的工具或方法吗? 考察数据统计方式与场景匹配能力第 13 题请解释 Spark 中 Job 和 Stage 的概念及其关系。 考察对 Spark 作业分解与执行流程的理解第 14 题请解释Spark Shuffle的原理及主要过程。 考察对Spark Shuffle机制、数据倾斜和性能影响的理解第 15 题请解释Spark中RDD与Partition的关系,并说明Partition数如何影响任务执行。 考察对Spark RDD分区机制及并行度影响的理解第 16 题请解释 Spark RDD 的容错机制,并说明它是如何保证数据可靠性的? 考察对 Spark RDD 血缘关系和容错恢复原理的理解第 17 题请介绍你使用 Spark 的经验,包括你处理过的典型数据处理任务以及你如何优化作业性能。 考察候选人 Spark 实际使用经验、问题拆解与性能优化能力第 18 题请介绍Spark内存模型,说明各部分作用并给出调参思路。 考察对Spark统一内存管理机制的理解及参数调优能力第 19 题能否描述一下Spark的执行原理和提交过程? 考察对Spark作业提交流程、执行模型及资源调度机制的理解第 20 题请描述 Spark 中从提交作业到任务执行的任务调度流程。 考察对 Spark 作业调度、DAG 构建和任务分配机制的理解