后端岗位面试题 · 风险判断 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 8 道 · 更新 2026-08-05
筛选题目已选:风险判断 · tech:apache-spark
考察点
技术栈
第 1 题在配置大数据计算引擎(如 Spark 或 Flink)的内存管理时,是否应将最大堆与最小堆参数设置为相同值?请说明原因。 考察对 JVM 堆内存动态调整机制及其在分布式计算环境中影响的理解第 2 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路第 3 题数据倾斜怎么排查,如何解决? 考察对分布式计算中数据倾斜问题的识别、定位与处理能力第 4 题什么是 Spark 中的宽依赖和窄依赖?它们分别起到什么作用? 考察对 Spark 依赖关系原理及其对任务调度的影响第 5 题Spark中算子内的变量共享是如何实现的? 考察对Spark广播变量和累加器机制的理解第 6 题Spark宽窄依赖怎么划分? 考察对Spark RDD依赖类型及其计算特性的理解第 7 题进一步讲解下Apache Spark中executor集群如何实现分布式一致。 考察对Spark执行引擎的深入理解,特别是executor间数据一致性机制第 8 题面对一张千亿条数据的大表,请在不依赖直接SQL聚合的前提下,设计一个将全表聚合结果导出到Excel的整体方案,并说明关键技术点。 考察海量数据离线处理的架构设计能力、分布式计算与导出细节