哔哩哔哩面试题 · 性能优化 · Apache Spark
哔哩哔哩相关面试题,按最终去重题目聚合。
共 2456 道真题 · 当前筛选命中 6 道 · 更新 2026-08-05
筛选题目已选:性能优化 · Apache Spark
考察点
技术栈
第 1 题Spark 的 count distinct 是怎么做的? 考察对 Spark 分布式去重计数底层实现的理解第 2 题请解释 Spark 中 local read 数据量的含义及其在任务执行中的影响。 考察对 Spark 任务读取本地数据的理解及对性能的影响第 3 题在 Spark 中执行 join 时,如果两个表一大一小,如何实现高效 join? 考察对大表小表 join 优化策略的掌握程度第 4 题请解释 Spark 中 shuffle write 数据量的含义及其与 shuffle read 的关系。 考察对 Spark shuffle 写阶段机制与整体数据流理解第 5 题请列举 Hive 或 Spark 日常调优中你常用的关键参数,并说明其作用。 考察对 Hive/Spark 性能调优核心参数的理解与实际应用能力第 6 题请解释 Spark 中 shuffle read 数据量的含义及其对作业性能的影响。 考察对 Spark shuffle 阶段数据读取机制的理解