后端岗位面试题 · 性能优化 · Apache Spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 53 道 · 更新 2026-08-05
筛选题目已选:性能优化 · Apache Spark
考察点
技术栈
第 21 题在数据倾斜场景下,group by 操作如何进行优化? 考察对数据倾斜问题的识别能力及分布式聚合优化策略第 22 题请介绍Spark的三种join优化,以及针对数据倾斜的处理方法。 考察SparkSQL执行计划理解、join策略选择与数据倾斜调优能力第 23 题请介绍 Spark 中 Shuffle 的过程及其涉及的主要组件。 考察对 Spark Shuffle 机制的理解,包括数据分区、磁盘读写和网络传输等核心环节第 24 题Spark如何进行数据倾斜的优化? 考察对Spark数据倾斜问题的识别、定位和常见优化手段的理解第 25 题Spark是完全基于内存吗? 考察对Spark内存计算模型和存储层原理的理解第 26 题Spark合并小文件怎么做的,落HDFS之前合并还是之后合并? 考察Spark写HDFS时小文件问题的处理策略与时机选择第 27 题请解释Spark Shuffle的原理及主要过程。 考察对Spark Shuffle机制、数据倾斜和性能影响的理解第 28 题Spark调优中,代码层面有哪些手段? 考察对Spark应用代码级优化的理解与实践第 29 题请结合一个实际项目,谈谈你在 Spark 任务中遇到数据倾斜时的处理思路。 考察数据倾斜的识别、定位和解决方案设计能力第 30 题请列举并解释Spark作业中常见的内存问题,以及如何定位和解决这些问题? 考察对Spark内存模型、常见OOM场景及调优手段的理解第 31 题你了解Spark的宽窄依赖吗? 考察Spark任务划分与依赖关系的基本原理第 32 题除了join,还有哪些操作会引起Shuffle? 考察对分布式计算中Shuffle触发机制的掌握第 33 题请描述 Spark 中 Shuffle 的原理与执行流程。 考察对 Spark Shuffle 底层机制、磁盘与网络开销的掌握第 34 题请介绍Spark的内存管理机制,包括执行内存与存储内存的划分及动态调整策略。 考察对Spark内存管理核心概念的理解与表述能力第 35 题请谈谈你在处理数据倾斜问题时,通常会针对哪些参数进行调优,并说明具体的调优思路和效果。 考察对数据倾斜问题的理解和参数调优的实际经验第 36 题介绍一下Spark的内存模型。 考察对Spark内存管理机制的理解,包括Executor内内存区域的划分与配置第 37 题你知道Spark的宽窄依赖吗?有没有把宽依赖转化为窄依赖的例子? 考察对Spark任务依赖关系的理解及实际优化能力第 38 题请解释 Spark 中 shuffle write 数据量的含义及其与 shuffle read 的关系。 考察对 Spark shuffle 写阶段机制与整体数据流理解第 39 题请介绍你使用 Spark 的经验,包括你处理过的典型数据处理任务以及你如何优化作业性能。 考察候选人 Spark 实际使用经验、问题拆解与性能优化能力第 40 题请介绍Spark内存模型,说明各部分作用并给出调参思路。 考察对Spark统一内存管理机制的理解及参数调优能力