数据岗位面试题更新 2026-08-05

请描述 Ambari 在 Hadoop 集群监控中的角色,并列举一些常用的监控指标。

数据技术原理Apache AmbariApache Hadoop

考察说明

考查对 Ambari 监控机制的理解以及常用 Hadoop 集群监控指标的掌握。

回答思路

  1. 【回答框架 1】Ambari 通过 Metrics Collector 定期从各节点采集监控数据,存入 Metrics Collector 后端存储,并通过 Ambari Web UI 展示图表和告警。监控数据来源包括 Ganglia 和 Nagios,其中 Ganglia 用于指标采集,Nagios 用于告警。
  2. 【回答框架 2】常用监控指标包括:CPU 使用率、内存使用率、磁盘 I/O 和空间使用率、网络流量;JVM 堆内存使用、GC 次数和时间;HDFS 的容量使用率、块数量、DataNode 健康状况;YARN 的资源使用率、运行中的任务数、队列资源使用等。
  3. 【回答框架 3】Ambari 还支持自定义告警,可设置阈值,当指标超出阈值时通过邮件等方式通知管理员。告警定义可通过 Ambari 界面或 API 配置。
  4. 【关键点 1】Ambari 使用 Ganglia 采集指标,Nagios 提供告警。
  5. 【关键点 2】常用指标包括 HDFS 容量、DataNode 状态、JVM 使用等。
  6. 【关键点 3】告警阈值可自定义,并支持多种通知方式。
  7. 【易错点 1】仅依赖 Ambari 默认指标不足以发现所有问题,需业务相关指标。
  8. 【易错点 2】监控数据可能存在延迟,部分指标非实时。
  9. 【易错点 3】自定义告警阈值不合理易产生误报或漏报。