互联网/IT行业面试题 · tech:apache-spark

互联网/IT行业相关面试题,按题目行业基础数据聚合。

47588 道真题 · 当前筛选命中 103 · 更新 2026-08-05

筛选题目已选:tech:apache-spark
第 61 题Spark为什么快? 考察对Spark计算引擎核心优化机制的理解性能优化技术原理Apache Spark第 62 题Spark和MapReduce的区别 考察对两种大数据计算框架的架构原理和适用场景的理解技术原理技术选型Apache SparkMapReduce第 63 题请介绍DWD层的设计理念和常见构建方式。 考察对数据仓库分层建模的理解及DWD层实践技术原理方案权衡Apache HiveApache Spark第 64 题在 Spark 中,广播变量(Broadcast Variable)的广播过程是怎样的? 考察 Spark 广播变量的内部机制、内存管理及适用场景性能优化技术原理Apache Spark第 65 题请解释 Spark 中的 semi join,它用于解决什么问题? 考察对 Spark SQL 语义及半连接(semi join)用途的理解业务理解技术原理Apache Spark第 66 题数据倾斜怎么排查,如何解决? 考察对分布式计算中数据倾斜问题的识别、定位与处理能力风险判断技术原理问题排查Apache HiveApache Spark第 67 题请介绍Spark中常见的三种Join实现方式,并说明它们各自适用的场景以及优化的原理。 考察对Spark Join机制的理解、场景选型和优化能力性能优化技术原理技术选型Apache Spark第 68 题大数据开发是以Java为主吗? 考察对大数据开发技术栈的理解及语言生态认知技术原理技术选型Apache SparkJavaPython第 69 题请设计一个方案,计算两个包含1000亿和100亿数据量的集合的交集。 考察海量数据场景下的交集计算方案设计能力问题拆解系统设计Apache SparkMapReduce第 70 题Hive和Spark有什么区别? 考察对计算引擎与执行模型差异的理解技术原理技术选型Apache HiveApache Spark第 71 题离线数仓中有大任务,你通常如何优化其性能? 考察大任务性能分析与资源优化能力性能优化方案权衡问题排查Apache HiveApache Spark第 72 题自定义 UDF 怎么实现?比如在 Hive 或Spark 里,具体步骤是啥,有没有踩过坑 考察对 Hive/Spark 自定义 UDF 开发流程、生命周期和踩坑点的理解编码实现技术原理问题排查Apache HiveApache Spark第 73 题请介绍 Spark 中常用的算子,并说明它们的作用。 考察对 Spark 核心算子的理解与应用问题拆解技术原理Apache Spark第 74 题请说明Spark是如何处理小文件问题的? 考察对Spark小文件问题的成因、影响及常见处理策略的理解问题拆解技术原理Apache Spark第 75 题Hive和Spark分别是什么?它们的主要用途和区别是什么? 考察对Hive和Spark基本概念、应用场景及差异的理解技术原理技术选型Apache HiveApache Spark第 76 题请描述Spark的Shuffle过程及其内部实现机制。 考察对Spark核心执行阶段的理解与细节把控问题拆解技术原理Apache Spark第 77 题Spark 提交任务时,Client 模式和集群模式有什么区别?例如 Driver 运行位置、日志查看方式和适用场景。 考察对 Spark 部署模式的理解及实际运维能力技术原理方案权衡Apache Spark第 78 题Spark和Flink有什么区别? 考察对两种主流大数据计算引擎的理解与选型判断技术原理方案权衡Apache FlinkApache Spark第 79 题请说明在进行实时计算框架技术选型时,你会考虑哪些关键因素,并给出你的选择逻辑。 考察对实时计算技术栈的理解及技术选型的系统思维业务理解技术选型方案权衡Apache FlinkApache KafkaApache Spark第 80 题Spark的数据倾斜体现在哪些方面,以及如何解决? 考察对Spark数据倾斜的识别能力和实际调优手段性能优化技术原理问题排查Apache Spark