请描述 Ambari 在 Hadoop 集群监控中的角色,并列举一些常用的监控指标。
考察说明
考查对 Ambari 监控机制的理解以及常用 Hadoop 集群监控指标的掌握。
回答思路
- 【回答框架 1】Ambari 通过 Metrics Collector 定期从各节点采集监控数据,存入 Metrics Collector 后端存储,并通过 Ambari Web UI 展示图表和告警。监控数据来源包括 Ganglia 和 Nagios,其中 Ganglia 用于指标采集,Nagios 用于告警。
- 【回答框架 2】常用监控指标包括:CPU 使用率、内存使用率、磁盘 I/O 和空间使用率、网络流量;JVM 堆内存使用、GC 次数和时间;HDFS 的容量使用率、块数量、DataNode 健康状况;YARN 的资源使用率、运行中的任务数、队列资源使用等。
- 【回答框架 3】Ambari 还支持自定义告警,可设置阈值,当指标超出阈值时通过邮件等方式通知管理员。告警定义可通过 Ambari 界面或 API 配置。
- 【关键点 1】Ambari 使用 Ganglia 采集指标,Nagios 提供告警。
- 【关键点 2】常用指标包括 HDFS 容量、DataNode 状态、JVM 使用等。
- 【关键点 3】告警阈值可自定义,并支持多种通知方式。
- 【易错点 1】仅依赖 Ambari 默认指标不足以发现所有问题,需业务相关指标。
- 【易错点 2】监控数据可能存在延迟,部分指标非实时。
- 【易错点 3】自定义告警阈值不合理易产生误报或漏报。