后端岗位面试题更新 2026-08-05

Spark 的 count distinct 是怎么做的?

哔哩哔哩后端开发性能优化技术原理Apache Spark

考察说明

考察对 Spark 分布式去重计数底层实现的理解

回答思路

  1. 能说明 count distinct 在 Spark 中的执行原理,即通过分区内去重和全局再聚合实现
  2. 能说明不同数据规模下的优化策略,如使用 Approximate Distinct Count 或精确去重方案
  3. 能说明影响性能的关键因素,如数据倾斜和 shuffled 数据量
本题已收录答题指导

本题附完整参考答案与评分标准

登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。