后端岗位面试题更新 2026-08-05
Spark 的 count distinct 是怎么做的?
哔哩哔哩后端开发性能优化技术原理Apache Spark
考察说明
考察对 Spark 分布式去重计数底层实现的理解
回答思路
- 能说明 count distinct 在 Spark 中的执行原理,即通过分区内去重和全局再聚合实现
- 能说明不同数据规模下的优化策略,如使用 Approximate Distinct Count 或精确去重方案
- 能说明影响性能的关键因素,如数据倾斜和 shuffled 数据量
本题附完整参考答案与评分标准
登录后可查看结构化答题指导;也可以直接开一场模拟面试,AI 面试官用本题实时追问并给出评分。