互联网/IT行业面试题 · 问题拆解 · tech:apache-spark
互联网/IT行业相关面试题,按题目行业基础数据聚合。
共 47588 道真题 · 当前筛选命中 30 道 · 更新 2026-08-05
筛选题目已选:问题拆解 · tech:apache-spark
考察点
技术栈
第 21 题请描述Spark应用通过jar包提交后,从提交命令到任务执行完成的完整过程。 考察对Spark任务提交、调度与执行生命周期的理解第 22 题请设计一个方案,计算两个包含1000亿和100亿数据量的集合的交集。 考察海量数据场景下的交集计算方案设计能力第 23 题请介绍 Spark 中常用的算子,并说明它们的作用。 考察对 Spark 核心算子的理解与应用第 24 题请说明Spark是如何处理小文件问题的? 考察对Spark小文件问题的成因、影响及常见处理策略的理解第 25 题请描述Spark的Shuffle过程及其内部实现机制。 考察对Spark核心执行阶段的理解与细节把控第 26 题能否描述一下Spark的执行原理和提交过程? 考察对Spark作业提交流程、执行模型及资源调度机制的理解第 27 题你在离线计算中遇到过数据倾斜吗?它是如何形成的,你又是如何解决的? 考察对数据倾斜成因的理解、排查思路与实际解决能力第 28 题面对一万亿条用户购买记录,每行包含用户ID和购买数量,如何找出购买数量最多的三位用户?请给出你的设计思路和可能的实现方案。 考察海量数据处理中的排序与内存优化能力,以及取舍意识第 29 题请解释 Spark 中 Job 和 Stage 的概念及其关系。 考察对 Spark 作业分解与执行流程的理解第 30 题请解释 Spark 中宽依赖和窄依赖的区别。 考察对 Spark 任务调度与数据分区理解