后端岗位面试题 · tech:apache-spark

题库中标记为“后端”的结构化面试题。

89928 道真题 · 当前筛选命中 233 · 更新 2026-08-05

筛选题目已选:tech:apache-spark
第 61 题请列举Spark中涉及shuffle的操作算子,并说明它们各自的特点。 考察对Apache Spark shuffle机制及相关算子的理解性能优化技术原理Apache Spark第 62 题YARN在Hadoop生态中主要解决什么问题?什么是计算资源? 考察YARN资源调度的基本原理及对计算资源的理解系统设计技术原理Apache HadoopApache SparkYarn第 63 题Spark参数调优做了些什么? 考察对Spark核心参数的理解和实际调优经验性能优化技术原理Apache Spark第 64 题Map Join 中如果小表太大导致内存占用过高甚至内存溢出,你会怎么处理? 考察对 Map Join 原理、内存模型及优化策略的理解性能优化技术原理方案权衡Apache HiveApache Spark第 65 题Spark为什么会存在Shuffle? 考察对Spark分布式计算中数据重分布机制的理解技术原理问题排查Apache Spark第 66 题Spark 的内存管理机制是怎样的? 考察对 Spark 统一内存模型及内存区域的掌握技术原理Apache Spark第 67 题Spark小文件怎么处理? 考察对Spark小文件问题的理解及优化手段性能优化技术原理方案权衡Apache Spark第 68 题请简要介绍 Spark 中的 coalesce 算子及其作用场景。 考察对 Spark 分区调整算子的理解与实际应用技术原理方案权衡Apache Spark第 69 题请描述 Spark RDD 的主要特点。 考察对 Spark RDD 核心特性的理解业务理解技术原理Apache Spark第 70 题请谈谈你对大数据运算的了解。 考察候选人对大数据运算相关技术的认知深度与广度业务理解技术原理Apache HadoopApache Spark第 71 题请解释 Spark 中 local read 数据量的含义及其在任务执行中的影响。 考察对 Spark 任务读取本地数据的理解及对性能的影响性能优化技术原理Apache Spark第 72 题谈谈你对大数据组件的理解?请按照采集、存储、计算、调度、应用五个层面展开。 考察对大数据技术栈各层组件的整体认知与归类能力系统设计技术原理技术选型Apache FlinkApache HadoopApache Kafka第 73 题Hadoop生态通常分为哪几个部分? 考察对Hadoop生态组成结构的宏观认识系统设计技术原理Apache HiveApache SparkHDFS第 74 题请介绍 Spark 中的 Shuffle 机制及其工作原理。 考察对 Spark Shuffle 原理、过程和相关配置的理解性能优化技术原理Apache Spark第 75 题Spark Executor 的内存分为哪几部分?请说明堆内与堆外内存的区别及应用场景。 考察对 Spark 内存模型的理解及对堆内外内存设计的掌握技术原理方案权衡Apache Spark第 76 题请描述 Spark 任务从提交到执行的完整流程。 考察对 Spark 作业调度、执行模型和核心组件的理解问题拆解技术原理Apache Spark第 77 题在Spark中,为什么要有DAG图?为什么要划分阶段? 考察对Spark任务调度核心机制的理解问题拆解技术原理Apache Spark第 78 题Spark 中 OOM 问题通常是由什么造成的?如何定位和解决? 考察对 Spark 内存溢出原因分析及排查思路性能优化风险判断问题排查Apache Spark第 79 题DataFrame和DataSet的区别 考察对Spark两种核心数据抽象的理解与适用场景辨析技术原理技术选型Apache Spark第 80 题Spark 中各组件之间是如何进行数据通信与连接的? 考察对 Spark 组件间数据流转和通信机制的理解系统设计技术原理Apache Spark