后端岗位面试题 · 系统设计 · tech:apache-spark
题库中标记为“后端”的结构化面试题。
共 89928 道真题 · 当前筛选命中 24 道 · 更新 2026-08-05
筛选题目已选:系统设计 · tech:apache-spark
考察点
技术栈
第 1 题说一下 Spark 任务的大概提交流程是什么样的? 考察对 Spark 任务从提交到运行的整体流程理解第 2 题如何理解大数据任务的本质是“节点多则并行,节点少则串行,节点中等则整体并行加内部串行”这句话? 考察对大规模数据处理中并行化策略的理解和工程思维第 3 题你了解哪些大数据平台? 考察对大数据生态组件的了解广度与理解深度第 4 题请说明Spark On YARN的Cluster和Client两种运行模式的区别。 考察对Spark YARN部署模型的理解及Driver运行位置的影响第 5 题大数据在分布式存储和计算层面的作用分别是什么?哪些技术比较有特点? 考察大数据技术栈的整体理解及分布式存储与计算的特性第 6 题请设计一个方案,计算两个包含1000亿和100亿数据量的集合的交集。 考察海量数据场景下的交集计算方案设计能力第 7 题请介绍 Spark 的整体架构及其核心组件。 考察对 Spark 分布式计算架构的理解深度第 8 题你如何理解Hadoop生态系统?请列举其主要组件及其作用,并说明它们之间的协作关系。 考察对Hadoop生态的核心组件、职责划分及整体架构的理解深度第 9 题执行一个PySpark作业,它的底层操作是怎么样的? 考察对PySpark执行模型、任务调度和底层计算原理的理解第 10 题YARN在Hadoop生态中主要解决什么问题?什么是计算资源? 考察YARN资源调度的基本原理及对计算资源的理解第 11 题谈谈你对大数据组件的理解?请按照采集、存储、计算、调度、应用五个层面展开。 考察对大数据技术栈各层组件的整体认知与归类能力第 12 题Hadoop生态通常分为哪几个部分? 考察对Hadoop生态组成结构的宏观认识第 13 题Spark 中各组件之间是如何进行数据通信与连接的? 考察对 Spark 组件间数据流转和通信机制的理解第 14 题请设计一个方案,将海量数据接入业务后台,并进行处理和存储。你会如何设计实现? 考察对海量数据接入、处理和存储的整体架构设计与关键技术选型第 15 题讲一讲你对分布式数据处理框架(如 Hadoop、Spark 等)的理解。 考察对分布式数据处理框架核心概念、架构与适用场景的掌握第 16 题请描述Spark应用提交到YARN集群运行的整体流程。 考察对Spark On YARN提交与资源调度流程的理解第 17 题请谈谈你对大数据生态中常用组件的了解,比如存储、计算或查询框架。 考察大数据技术栈的广度、深度及与实际项目的结合能力第 18 题如果让你设计一个大数据分析平台,你会如何选择存储、计算等核心组件? 考察大数据技术选型与方案设计能力第 19 题大数据生态圈都了解哪些? 考察大数据技术栈的广度和系统性理解第 20 题请介绍 Spark 在 YARN 上的执行模型,包括 yarn-client 和 yarn-cluster 两种模式的区别。 考察对 Spark 部署模式与资源管理机制的理解