后端岗位面试题 · 技术原理 · tech:apache-spark

题库中标记为“后端”的结构化面试题。

89928 道真题 · 当前筛选命中 216 · 更新 2026-08-05

筛选题目已选:技术原理 · tech:apache-spark
第 181 题请介绍一下 Spark 的核心组件和运行机制。 考察对 Spark 基础架构和运行流程的理解问题拆解技术原理Apache Spark第 182 题请介绍 Spark 中常见的 Join 类型及其适用场景。 考察对 Spark Join 实现原理、代价模型和场景选择的理解性能优化技术原理技术选型Apache Spark第 183 题Spark的stage是怎么划分的? 考察对Spark任务调度中stage划分原理的理解问题拆解技术原理Apache Spark第 184 题什么是大数据与数据库的区别? 考察对大数据概念与传统数据库核心差异的理解业务理解技术原理Apache HadoopApache SparkMySQL第 185 题Spark Shuffle过程中有sort和没有sort的区别? 考察Spark Shuffle实现原理及排序优化对性能与语义的影响性能优化技术原理方案权衡Apache Spark第 186 题在 Spark SQL 中,如何通过查看 DAG 图来优化 SQL 执行或判断 SQL 改写是否正确? 考察对 Spark DAG 图的理解及基于 DAG 分析的 SQL 优化能力性能优化技术原理问题排查Apache Spark第 187 题请介绍 Spark 的 AQE(自适应查询执行)功能及其主要作用。 考察对 Spark 自适应查询执行机制的理解及应用场景性能优化技术原理Apache Spark第 188 题请谈谈你理解的数据开发岗位通常需要掌握哪些技术栈,并说明这些技术各自在数据开发中的用途。 考察对数据开发技术栈的整体认知和分类组织能力业务理解技术原理Apache AirflowApache FlinkApache Hive第 189 题请对比Spark和Hive的区别。 考察对两种大数据计算模型差异的理解技术原理技术选型方案权衡Apache HiveApache Spark第 190 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解系统设计技术原理方案权衡Apache SparkYarn第 191 题对于非结构化数据,大数据技术如何处理? 考察对非结构化数据在大数据体系中的存储、处理与分析路径的理解系统设计技术原理方案权衡Apache FlinkApache KafkaApache Spark第 192 题请解释 Spark 中 shuffle read 数据量的含义及其对作业性能的影响。 考察对 Spark shuffle 阶段数据读取机制的理解性能优化技术原理Apache Spark第 193 题Spark on YARN两种提交模式的区别 考察对YARN集群模式下Spark执行架构与资源隔离机制的理解系统设计技术原理方案权衡Apache SparkYarn第 194 题RDD、DataFrame和Dataset的区别是什么? 考察对Spark三种数据抽象在类型安全、性能与编程模型上的理解技术原理方案权衡Apache Spark第 195 题请介绍 Spark 中有哪些 Shuffle 机制,并说明不同场景下如何选择合适的 Shuffle 实现。 考察对 Spark Shuffle 演进、原理及场景选型的理解技术原理技术选型方案权衡Apache Spark第 196 题在 Spark 中,广播变量(Broadcast Variable)的广播过程是怎样的? 考察 Spark 广播变量的内部机制、内存管理及适用场景性能优化技术原理Apache Spark第 197 题请谈谈你对大数据相关技术的了解,包括你熟悉的大数据组件或框架。 考察候选人对大数据技术的知识储备和实际使用经验自我认知技术原理Apache FlinkApache HadoopApache Spark第 198 题Spark调优你做过哪些? 考察Spark性能调优的实际经验与系统性性能优化项目复盘技术原理Apache Spark第 199 题请解释Spark SQL中的自适应查询执行(AQE)是什么,并说明其主要优化机制。 考察对Spark AQE的核心概念、触发机制与优化能力的理解技术原理方案权衡Apache SparkSpark SQL第 200 题请介绍数据研发工作中通常会涉及哪些核心组件或工具。 考察对数据研发技术栈和组件的整体认知业务理解系统设计技术原理Apache FlinkApache HiveApache Kafka