互联网/IT行业面试题 · 方案权衡 · tech:apache-spark
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 29 道 · 更新 2026-08-05
筛选题目已选:方案权衡 · tech:apache-spark
考察点
技术栈
第 1 题MapReduce和Spark 到底差在哪儿?适用场景这些都得对比着说 考察对分布式计算框架的核心差异、适用场景及技术选型的理解第 2 题请讲讲 Join 操作在数据处理中的原理和实现方式? 考察对 Join 原理、实现方式及性能问题的理解第 3 题请说明 Spark 能处理的数据量级范围,以及影响其处理能力的关键因素。 考察对 Spark 架构扩展性和资源模型的理解第 4 题Spark on YARN两种提交模式的区别 考察对YARN集群模式下Spark执行架构与资源隔离机制的理解第 5 题在配置大数据计算引擎(如 Spark 或 Flink)的内存管理时,是否应将最大堆与最小堆参数设置为相同值?请说明原因。 考察对 JVM 堆内存动态调整机制及其在分布式计算环境中影响的理解第 6 题说说MapReduce和Spark的区别 考察对大数据处理框架核心架构和适用场景的理解第 7 题请对比Spark和Hive的区别。 考察对两种大数据计算模型差异的理解第 8 题处理小文件有哪些方法?请举例说明。 考察对大数据场景下小文件问题的理解及解决方案的掌握第 9 题请解释Spark SQL中的自适应查询执行(AQE)是什么,并说明其主要优化机制。 考察对Spark AQE的核心概念、触发机制与优化能力的理解第 10 题MR和Spark的区别是什么? 考察对MapReduce与Spark核心架构、计算模型及适用场景差异的理解第 11 题Flink和Spark流式处理的区别 考察流式计算引擎的架构差异与实时性理解第 12 题请谈谈你在处理数据倾斜问题时,通常会针对哪些参数进行调优,并说明具体的调优思路和效果。 考察对数据倾斜问题的理解和参数调优的实际经验第 13 题Spark和MapReduce最大的区别是什么? 考察对两大分布式计算框架核心差异的理解与概括能力第 14 题Spark为什么比MR快? 考察对Spark和MapReduce执行引擎差异的理解及性能优化原理第 15 题请介绍 Spark 的 TaskScheduler 调度算法。 考察对 Spark 任务调度原理的理解及对常用调度算法的掌握程度第 16 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解第 17 题你知道Spark的宽窄依赖吗?有没有把宽依赖转化为窄依赖的例子? 考察对Spark任务依赖关系的理解及实际优化能力第 18 题请说明在Spark作业中执行commit提交操作时需要配置的参数,并解释其作用。 考察对Spark内部提交机制及关键参数的理解第 19 题请介绍DWD层的设计理念和常见构建方式。 考察对数据仓库分层建模的理解及DWD层实践第 20 题离线数仓中有大任务,你通常如何优化其性能? 考察大任务性能分析与资源优化能力