数据岗位面试题更新 2026-08-05

请阐述 Spark Streaming 与 HDFS 集成的方式是怎样的?

数据系统设计技术原理HDFSSpark Streaming

考察说明

考查对 Spark Streaming 与 HDFS 集成机制的理解。

回答思路

  1. 【回答框架 1】Spark Streaming 与 HDFS 的集成主要体现在数据读写层面:读取时可通过 textFileStream 或 fileStream 监控 HDFS 目录,将新文件作为数据流处理;写入时可将计算结果以 saveAsTextFile、saveAsParquetFile 等形式输出到 HDFS。
  2. 【回答框架 2】读取 HDFS 数据时,Spark Streaming 会定期扫描指定目录,识别并处理新增文件,支持使用通配符或文件前缀过滤,并可通过设置清理策略管理已处理文件。
  3. 【回答框架 3】写入 HDFS 时,结果文件会按批次生成,可通过调整文件分区数控制输出文件大小,避免小文件过多影响后续分析性能。
  4. 【回答框架 4】集成过程中需注意文件幂等性、事务性写入及目录权限等配置,确保数据准确性和系统稳定性。
  5. 【关键点 1】Spark Streaming 可通过文件流方式读取 HDFS 新文件实现集成。
  6. 【关键点 2】计算结果可写入 HDFS,支持多种文件格式。
  7. 【关键点 3】集成需考虑文件管理、性能及幂等性。
  8. 【易错点 1】忽视 HDFS 小文件问题,导致元数据压力大。
  9. 【易错点 2】未处理文件读取幂等性,可能重复消费。
  10. 【易错点 3】未配置合理的批次间隔,影响实时性。