后端岗位面试题 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 233 道 · 更新 2026-08-05
筛选题目已选:tech:apache-spark
考察点
技术栈
第 61 题请列举Spark中涉及shuffle的操作算子,并说明它们各自的特点。 考察对Apache Spark shuffle机制及相关算子的理解第 62 题YARN在Hadoop生态中主要解决什么问题?什么是计算资源? 考察YARN资源调度的基本原理及对计算资源的理解第 63 题Spark参数调优做了些什么? 考察对Spark核心参数的理解和实际调优经验第 64 题Map Join 中如果小表太大导致内存占用过高甚至内存溢出,你会怎么处理? 考察对 Map Join 原理、内存模型及优化策略的理解第 65 题Spark为什么会存在Shuffle? 考察对Spark分布式计算中数据重分布机制的理解第 66 题Spark 的内存管理机制是怎样的? 考察对 Spark 统一内存模型及内存区域的掌握第 67 题Spark小文件怎么处理? 考察对Spark小文件问题的理解及优化手段第 68 题请简要介绍 Spark 中的 coalesce 算子及其作用场景。 考察对 Spark 分区调整算子的理解与实际应用第 69 题请描述 Spark RDD 的主要特点。 考察对 Spark RDD 核心特性的理解第 70 题请谈谈你对大数据运算的了解。 考察候选人对大数据运算相关技术的认知深度与广度第 71 题请解释 Spark 中 local read 数据量的含义及其在任务执行中的影响。 考察对 Spark 任务读取本地数据的理解及对性能的影响第 72 题谈谈你对大数据组件的理解?请按照采集、存储、计算、调度、应用五个层面展开。 考察对大数据技术栈各层组件的整体认知与归类能力第 73 题Hadoop生态通常分为哪几个部分? 考察对Hadoop生态组成结构的宏观认识第 74 题请介绍 Spark 中的 Shuffle 机制及其工作原理。 考察对 Spark Shuffle 原理、过程和相关配置的理解第 75 题Spark Executor 的内存分为哪几部分?请说明堆内与堆外内存的区别及应用场景。 考察对 Spark 内存模型的理解及对堆内外内存设计的掌握第 76 题请描述 Spark 任务从提交到执行的完整流程。 考察对 Spark 作业调度、执行模型和核心组件的理解第 77 题在Spark中,为什么要有DAG图?为什么要划分阶段? 考察对Spark任务调度核心机制的理解第 78 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路第 79 题DataFrame和DataSet的区别 考察对Spark两种核心数据抽象的理解与适用场景辨析第 80 题Spark 中各组件之间是如何进行数据通信与连接的? 考察对 Spark 组件间数据流转和通信机制的理解